本周精选 · 第5期 — Meta 开源 Muse Glimmer 30B:24GB 显存跑通本地 Agent 模型
又到周六,本周精选第 5 期。上周我把本地 …
又到周六,本周精选第 5 期。上周我把本地 AI 部署的全链路——推理引擎、统一网关、交互界面——捋了一遍。结果这周 Meta 就放了个大消息:时隔多年,重新掏出一个完全 Apache 2.0 开源的模型 Muse Glimmer 30B,而且明说了就是冲着”本地 Agent”去的。看到”24GB 显存就能跑、专为 always-on 本地智能体设计”这几个字,我的第一反应是:Homelab 党终于等来一个正经的本地 Agent 底座了。这期就围绕它,再带上本周另外几个值得盯一盯的项目。
1. Muse Glimmer 30B — Meta 回归开源的本地 Agent 模型
8 月 10 日,Meta Superintelligence Labs 发布了 Muse Glimmer,一个 30B 稠密多模态模型。关键信息我帮你划重点:
- 架构:2B 视觉编码器 + 28B 文本解码器,支持图文混排输入,能读截图、图表、文档
- 上下文:131K token,长程 Agent 工作流不会动不动就丢上下文
- 定位:工具调用、失败自动重试、长程规划——这些都是 Agent 每天在干的事
- 门槛:量化到约 17GB,正好塞进 24GB 显存(3090 / 4090 / 一张卡搞定)
- 速度:配上官方 DFlash 投机解码,官方称最高能到 233 tok/s
- 许可证:Apache 2.0,商用、魔改、二次分发都不受限
官方给的两个基准分——MCP Atlas 75.5、SWE-Bench Verified 76.0——在同尺寸里相当能打。不过老规矩,厂商自报的分数只能当参考,真正值不值得,还得拉回自己机器上跑一遍才作数。
权重挂在 Hugging Face 的 meta-models/Muse-Glimmer-30B,BF16 全量、GGUF 量化版、ExecuTorch 版(Mac 用)社区都跟进了。给一张 24GB 卡的部署流程,走 llama.cpp 这条路最省事:
# 编译 llama.cpp(开 CUDA 加速)
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp
cmake -B build -DGGML_CUDA=ON && cmake --build build -j
# 跑 K-Quant 量化版(约 17GB,24GB 显存正好)
./build/bin/llama-server \
-m ./Muse-Glimmer-30B-Q4_K_M.gguf \
--ctx-size 131072 -ngl 99
两个提醒:上面的 .gguf 文件名以 Hugging Face 上实际发布的为准,别照着抄名字;Ollama 官方 registry 大概率还要等几天才收录,急着尝鲜就先走 llama.cpp 或官方 transformers 示例。
2. Ollama 的”云端化” — 本地党的免费午餐还在
本周另一个值得注意的信号:Ollama 正式把云服务推到了前台,分 Free / Pro($20/月)/ Max($100/月) 三档,按 GPU 时长计费。很多人看到这开始慌:本地推理是不是要收费了?
我的判断是:不用慌。本地推理引擎依然永久免费、完全开源,云服务是另一条产品线。对 Homelab 用户来说,数据敏感、量大、图省心的场景,本地跑依然是最划算的选择——尤其上了 Muse Glimmer 这类本地 Agent 模型之后,云和本地的性价比差距只会越拉越大。
3. little-coder — Apple Silicon 上比 Ollama 快 4 倍
如果你是 Mac 用户,itayinbarr/little-coder 这周还在持续升温。它专为 Apple Silicon(M1-M5)优化,号称比 Ollama 快 4.2 倍,缓存命中的首 token 延迟压到 0.08 秒,还兼容 OpenAI 格式,可以直接接 Claude Code、Cursor、Aider 这类工具。
如果你日常在 Mac 上跑本地模型做编程辅助,这个值得花半小时换上去试试——注意它是 Python 方案,装之前先开个 venv 隔离。
4. OpenClaw — 把 AI 助手接进你的聊天软件
最后一个推荐:OpenClaw,一个可自部署的个人 AI 助手框架。它的亮点是带持久记忆,并且原生支持 Telegram / Slack / Discord / WhatsApp 等消息入口——也就是说,你可以把自己本地跑的模型包装成一个随时能找到的”私人助理”,挂在你常用的聊天软件里。
适合那些”想让本地模型真正融入日常”、又不想被某个云厂商绑定的朋友。部署有托管选项,也可以自己 Docker 拉起来,量力而行。
大叔的私房建议
Muse Glimmer 这类本地 Agent 模型,真正的价值从来不在 benchmark 分数,而在”数据不出门“的那份安心。如果你手里正好有张 24GB 的卡,这周末就值得把它拉下来跑一跑,用它解决一个你工作流里的真实痛点——而不是又去追下一个新框架。模型会一直换代,但”把工具用透”这个本事,永远不会过时。
以上就是本周精选第 5 期。老规矩,有问题评论区聊。
——IT大叔,2026.08.15
