本周精选 · 第6期 — 国产开源大模型扎堆发布:Qwen3.8-27B、GLM-5.3,本地部署党的新弹药
又到周六,本周精选第 6 期。这周本地 AI…
又到周六,本周精选第 6 期。这周本地 AI 圈子的关键词就一个:密集开源。官方数据刚出来,中国开源大模型全球累计下载量突破 100 亿次,占全球总量的 41%,冲到第一。更实在的是,通义、智谱、DeepSeek 几家像约好了一样,一周之内轮流放出新模型。对咱们自部署党来说,这不是看热闹,是真有能拉回自己机器上跑的硬货。这期就挑几个跟本地部署关系最紧的说说。
1. Qwen3.8-27B — 通义千问的”单卡 Agent 模型”
本周最值得本地党动手的,是通义千问放出的 Qwen3.8-27B。一句话定位:一个 27B 的稠密多模态 Agent 模型,Apache 2.0 全开源,专治”想跑 Agent 但手里只有一张卡”的尴尬。几个关键点帮你划出来:
- 体量:27B 稠密,Q4 量化后约 16GB,单张 24GB 卡(3090 / 4090)稳稳能跑
- 上下文:原生 256K,配合 YarN 可扩展到 1M token
- 多模态:图文混排输入,能读截图、图表、文档
- 亮点:新增
reasoning_effort推理强度控制(xhigh / medium / low),按任务调节”想多久” - 提升:相较 Qwen3.6-27B,编程和办公场景大幅增强
给它一条 vLLM 的部署命令,27B 稠密模型走这条路最稳:
docker run --runtime=nvidia --gpus all \
-p 8000:8000 --ipc=host \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:latest \
--model Qwen/Qwen3.8-27B-Instruct --max-model-len 131072
它最有意思的是 reasoning_effort 这个新开关——写代码、做规划时拉到 xhigh 让它多想想,日常问答降到 low 省 token。OpenAI 兼容接口直接就能用:
import openai
client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none")
r = client.chat.completions.create(
model="Qwen/Qwen3.8-27B-Instruct",
messages=[{"role": "user", "content": "写个监控脚本,每分钟抓一次内存占用"}],
extra_body={"reasoning_effort": "xhigh"},
)
print(r.choices[0].message.content)
两个提醒:上面的模型 ID 以 HuggingFace 实际发布的为准,别照抄名字;Ollama 官方 registry 大概率还要等几天才收录,急着尝鲜就先走 vLLM。
2. GLM-5.3 — 编程开源第一,但先别急着装
智谱这周放出的 GLM-5.3 更猛:754B(40B 激活)、1M 上下文、最大输出 128K。官方称编程体感提升约 50%,在 Terminal Bench 3.0、DeepSWE 这些基准里拿了开源模型第一,甚至涌现出接近 Mythos 5 的网络安全能力。
但——注意这个但——权重还没开源。官方目前只发了技术报告,模型仓库标注”等待开源”。所以对本地党来说,GLM-5.3 这期的正确姿势是:盯紧、记笔记、先别动手。真等权重落地,754B 的体量也不是普通 Homelab 能伺候的,得靠多卡集群或量化蒸馏版,不是一张两张消费卡能扛住的。
3. DeepSeek V4 系列 — 百万级上下文的性价比路线
DeepSeek 这边,V4 系列主打”高效百万级 token 上下文”。Flash 版已经开放 API,单次任务成本压到 0.03 美元级别,Pro 正式版预计这个月内放出。对自部署场景,DeepSeek 的意义一直在于”用更少的卡跑更长的上下文”,V4 这条路线值得持续关注——尤其是准备做长文档 RAG 或代码库级问答的朋友。
4. TencentDB-Agent-Memory — 让 Agent 记住昨天说过什么
工具侧本周有个小而美的开源:腾讯的 TencentDB-Agent-Memory,把对话和代码沉淀成可复用的记忆资产,解决 Agent 跨会话”失忆”这个老大难,上线就冲上日榜第一。如果你在折腾本地 Agent 工作流,这个项目和上周聊的 OpenClaw 可以搭着看——一个管入口,一个管记忆。
大叔的私房建议
这周的密集开源,本质上是”Agent 能力下放”这条主线在加速:模型从”会聊天”走向”能干活”,而且开始往单卡能跑的方向收敛。对咱们来说,别被新模型刷屏牵着走,抓一个真实痛点——比如把 Qwen3.8-27B 拉下来,用它替代你现在某个要联网才肯干的活。数据不出门 + 单卡跑 Agent,这周末就能落地。
以上就是本周精选第 6 期。老规矩,有问题评论区聊。
——IT大叔,2026.08.22
