云端 API 与本地模型协同使用方案
制定日期:2026-10-02 适用人:Flynn 老师 硬件:i5-12600KF / 48GB DDR5-5600 / RX 6500 XT 4GB(Vulkan) / 三星 980 NVMe 相关调研文档:20261002 Colibrì小蜂鸟调研与本地大模型运行规划.md
一、总原则:云端管"质量与联网",本地管"隐私、离线与高频小任务"
不追求"本地完全取代云端",也不养成"事事调云"的习惯,而是按任务性质路由:
| 判断维度 | 优先云端 API | 优先本地模型 |
|---|---|---|
| 数据敏感性 | 公开信息 | 隐私稿件、未公开资料、本地代码库 |
| 是否需要联网 | 需要最新知识/搜索 | 纯生成、改写、总结、翻译 |
| 质量要求 | 出版级成稿、复杂推理 | 初稿、草稿、解释、批处理 |
| 实时性/成本 | 长文少量请求 | 高频次、可容忍慢速、零 token 费用 |
| 网络条件 | 网络良好 | 断网/弱网/出差演示 |
一句话分工:云端是"主编",本地是"贴身助理 + 离线工作台"。
二、当前已配置的模型清单(Hermes)
2.1 云端(主力,按现有 config.yaml)
| 用途 | 提供商 / 接入 | 接入点 |
|---|---|---|
| 当前默认主力(编码) | 火山方舟 ark-code-latest(custom provider) | https://ark.cn-beijing.volces.com/api/coding/v3 |
| 备用 / 长文 | DeepSeek(deepseek-v4-flash / v4-pro) | https://api.deepseek.com |
| Hermes 内置可选 | OpenRouter / Anthropic / Google / Nous 等 20+ | hermes model 切换 |
2.2 本地(本次新建)
| 项目 | 内容 |
|---|---|
| 模型 | Qwen3.6-35B-A3B(MoE,35B 总参 / 每 token 激活 3B) |
| 量化 | UD-Q4_K_M(分组量化,20.61GB,质量损失约 1~3%) |
| 引擎 | llama.cpp b11345 Vulkan 预编译版(AMD 显卡可参与计算) |
| 服务 | llama-server,OpenAI 兼容 API,http://127.0.0.1:8080/v1 |
| Hermes provider 名 | local-llamacpp,模型名 qwen3.6-35b-a3b |
2.3 目录结构(D 盘)
D:\LocalLLM\
├─ engine\ llama.cpp Vulkan 引擎(llama-server.exe 及 DLL)
├─ models\ Qwen3.6-35B-A3B-UD-Q4_K_M.gguf(20.61GB)
├─ scripts\ 启动/健康检查/自启脚本、ensure_server.py
└─ logs\
三、本地模型能力边界(结合官方基准与本机硬件)
3.1 能力(官方模型卡实测参考)
- 编码:SWE-bench Verified 73.4,Terminal-Bench 51.5,LiveCodeBench 80.4
- Agent / 工具:MCPMark 37.0,MCP-Atlas 62.8
- 知识:MMLU-Pro 85.2,C-Eval 90.0(中文优秀)
- 数理:GPQA 86.0,AIME26 92.7
3.2 本机预期表现(实测数据待首次运行后回填)
- 非思考模式:预估 8~14 tok/s(约每秒 6~10 汉字)
- 思考模式(复杂问题):思考链长,需 1~5 分钟,只给难题用
- 内存占用:模型 20.6GB + KV/缓冲约 2~6GB,合计 23~27GB;48GB 内存可同时办公
- GPU:RX 6500 XT 4GB 仅 offload 少量层,加速 10~30%
3.3 任务路由表
| 日常任务 | 路由 | 说明 |
|---|---|---|
| PPT 文案、课程大纲、分集结构 | 本地 ✅(要成稿质量再云端润色) | 批量、高频 |
| 提词稿初稿、金句卡、标题选题 | 本地 ✅ | |
| 书稿/SRT 喂入后的摘要、结构化 | 本地 ✅ | 上下文 64k 够用 |
| 单文件代码、代码讲解、bug 调试 | 本地 ✅ | 编码是该模型强项 |
| 本地代码库问答(隐私) | 本地 ✅ | 代码不出本机 |
| 中英互译 | 本地 ✅ | C-Eval 90 |
| 出题、参考答案、知识点讲解 | 本地 ✅ | 计算机/数学均可 |
| 隐私/未公开稿件处理 | 本地 ✅ | 核心价值场景 |
| 断网演示、离线工作 | 本地 ✅ | |
| 公众号/课程出版级成稿 | ☁️ 云端终审 | 本地起草 → 云端把关 |
| 多文件复杂重构 | ☁️ 云端(本地可辅助) | 可靠性要求高 |
| AI 资讯日报/周报 | ☁️ 云端 | 必须联网搜索 |
| 需要最新知识的问答 | ☁️ 云端 | 本地有知识截止期 |
| 最高质量长文、顶尖推理 | ☁️ 云端旗舰 | Claude/GPT 级 |
四、操作手册
4.1 启动 / 停止本地服务
- 手动启动(有窗口,看日志):双击
D:\LocalLLM\scripts\启动本地模型.bat - 后台智能启动(已在跑则跳过):
bash python D:\LocalLLM\scripts\ensure_server.py - 开机自启:双击
D:\LocalLLM\scripts\注册开机自启.bat(登录后自动后台运行) - 健康检查:双击
D:\LocalLLM\scripts\健康检查.bat - 命令行停止:
taskkill /F /IM llama-server.exe(cmd);或任务管理器结束 llama-server
注意:模型未下载完成时 ensure_server.py 会提示"仍在下载中",属正常。
4.2 Hermes 中使用本地模型
会话内切换(无需改配置):
/model local-llamacpp/qwen3.6-35b-a3b
或在命令行直接指定:
hermes chat -m qwen3.6-35b-a3b
切回云端主力:
/model
(/model 不带参数会打开交互选择器,选 ark-code-latest 等云端模型)
4.3 直接调用本地 API(脚本/其他程序)
curl http://127.0.0.1:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen3.6-35b-a3b",
"messages":[{"role":"user","content":"用三句话解释什么是 MoE"}]}'
端点与 OpenAI 完全兼容,可接任意支持自定义 base_url 的软件(Obsidian 插件、IDE 等)。
4.4 思考模式 / 非思考模式
- 默认非思考,适合日常快速响应;
- 难题在提示中要求"请深度思考后回答"可引导其展开推理;
- 批量任务务必保持非思考,避免等待长思考链。
五、使用策略与省钱建议
- "本地起草、云端终审"两段式:课程稿、公众号长文先本地出框架和主体(零费用、不限次数),最后用云端过一遍质量。
- 批量与重复任务一律本地:一次要生成几十条标题、改写多段文案、批量总结,本地不心疼 token。
- 敏感数据不出本机:未发表书稿、学生信息、校内文件、自有代码,默认本地。
- 联网/时效任务直接云端:不在本地模型上浪费时间问最新资讯。
- 按任务切模型,不要一个模型用到黑:Hermes
/model随时切换。 - 内存与电力:本地服务常驻约占 23~27GB 内存;做视频导出/大型剪辑前可先
taskkill释放。
六、后续可扩展
| 方向 | 动作 | 价值 |
|---|---|---|
| 加 2TB NVMe | 第二 M.2 插槽加装 | 解锁 Colibrì + GLM-5.2 744B、DeepSeek V4 Flash 等 |
| 内存 → 96GB | 2×48GB 替换 | 70B Q4 常驻、大上下文 |
| 换 24GB 显卡 | RX 7900 XTX / RTX | 本地速度质变 |
| 多模型库 | 在 models 目录增配 7B 轻量模型 | 轻任务更快、省内存 |
| Colibrì 教学 | 写入 AI Agent 课程 | 多层存储/专家路由案例 |
七、故障排查
| 现象 | 处理 |
|---|---|
| Hermes 调本地报连接失败 | 服务没启动:运行 ensure_server.py 或启动 bat |
| 提示模型仍在下载 | 等下载完成(models 目录文件到 20.61GB) |
| 8080 端口被占 | netstat -ano | findstr :8080 查占用,或改启动脚本端口并同步 Hermes provider base_url |
| 速度很慢 | 确认模型在 NVMe(非 HDD/NAS);切非思考模式;减少其他占内存/IO 程序 |
| Vulkan 未生效 | 确认 AMD 驱动正常(vulkaninfo 可查到设备);引擎会自动回退 CPU,功能不受影响 |
| 配置改坏 | 用备份恢复:config.yaml.bak-20261002 |
| 与 Ollama 冲突 | Ollama 默认 11434,与本地 8080 不冲突;如不用 Ollama 保持其进程关闭即可 |
八、关键路径速查
- Hermes 配置:C:\Users\41456\AppData\Local\hermes\config.yaml
- 配置备份:同目录 config.yaml.bak-20261002
- 本地根目录:D:\LocalLLM\
- 模型文件:D:\LocalLLM\models\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
- 本地 API:http://127.0.0.1:8080/v1
- 模型来源:https://hf-mirror.com/unsloth/Qwen3.6-35B-A3B-GGUF
- 引擎来源:llama.cpp b11345 Vulkan(ggml-org/llama.cpp Releases)