本周精选 · 第7期 — 本地大模型推理与自动化运维,五篇干货串成一条链

这一周(8月24日—8月28日),vpnt….

这一周(8月24日—8月28日),vpnt.top 连着发了五篇干货,主题其实是一条线:本地大模型推理 + 自动化运维。从推理引擎换血,到模型量化省显存,再到把日常命令、密钥管理、批量部署全部自动化——单独看每一篇都是拿来就能用的工具,串起来就是一套完整的 Homelab 工作流。

今天是周六,照例不写新教程,把本周这五篇给你汇总到一篇,文末再给一个把它们串起来的组合示例,帮你一次性收齐弹药。

一、本周回顾:五篇干货一条线

  1. vLLM 本地部署实战(周一):给本地大模型换上生产级推理引擎,吞吐翻倍还兼容 OpenAI API。如果你还在用 Ollama 单卡跑,这篇值得先看,核心是理解 Continuous Batching 和 PagedAttention 为什么能榨干显存。
  2. age + sops 实战(周二):给自建服务的密钥和 .env 上一把真正的锁。GPG 太笨重、Ansible Vault 绑定太死,age 这套组合轻量又干净,密钥加密落盘、版本管理无压力。
  3. 本地大模型量化避坑指南(周三):显存不够别急着换卡。GGUF / GPTQ / AWQ 三种量化方案怎么选、精度掉多少、哪些场景不能量化,这篇把坑都替你踩了一遍。
  4. just 命令执行器(周四):让 Makefile 下岗。把运维命令固化成一条条短命令,进目录敲 just deploy 就行,不用再翻 shell 历史记录。
  5. Ansible 自动化运维实战(周五):多节点 Homelab 一条命令全管。告别手动 SSH 登录每台机器敲命令,playbook 写一次、处处复用。

二、串起来:一条组合工作流

这五样东西不是孤立的,把它们接起来,你就有了一个「命令入口 → 密钥安全 → 批量部署 → 推理服务」的完整链路。下面给一个最小可用的例子。

假设你有三台推理节点(192.168.1.11 / .12 / .13),想一键把量化好的模型推上去,再用 vLLM 拉起来。先用 just 把入口固化,密钥交给 age + sops 管,批量动作交给 Ansible

# justfile —— 进目录敲一条命令,剩下的自动跑
set shell := ["bash", "-uc"]

# 加密 .env,用 age 公钥收好
encrypt:
    sops --encrypt --age {{AGE_KEY}} secrets.env > secrets.enc.env

# 一键把量化模型 + vLLM 配置推到全部推理节点
deploy:
    ansible-playbook -i hosts.ini playbooks/vllm.yml

# 查看三台节点的推理服务状态
status:
    ansible all -i hosts.ini -m shell -a "curl -s localhost:8000/v1/models"

对应的 vllm.yml 里,用 vllm serve 以 AWQ 量化权重启动,配合 Ansible 的变量把每台节点的显存大小和模型路径区分开。这样你改一次 playbook,三台机器同步生效,比手动 SSH 快一个量级。

三、下周预告

下周会继续沿着「本地 AI 自部署」这条主线往下走,准备写模型服务的高可用与负载均衡、以及 ComfyUI 在分布式节点上的调度。如果你在折腾过程中踩了坑,或者有想让我拆解的题目,欢迎在评论区留言。

老规矩:本地优先、隐私优先。能不上云就不上云,自己的算力自己说了算。

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注