云端 API 与本地模型协同使用方案

写于 2026-10-02

制定日期:2026-10-02 适用人:Flynn 老师 硬件:i5-12600KF / 48GB DDR5-5600 / RX 6500 XT 4GB(Vulkan) / 三星 980 NVMe 相关调研文档:20261002 Colibrì小蜂鸟调研与本地大模型运行规划.md


一、总原则:云端管"质量与联网",本地管"隐私、离线与高频小任务"

不追求"本地完全取代云端",也不养成"事事调云"的习惯,而是按任务性质路由:

判断维度 优先云端 API 优先本地模型
数据敏感性 公开信息 隐私稿件、未公开资料、本地代码库
是否需要联网 需要最新知识/搜索 纯生成、改写、总结、翻译
质量要求 出版级成稿、复杂推理 初稿、草稿、解释、批处理
实时性/成本 长文少量请求 高频次、可容忍慢速、零 token 费用
网络条件 网络良好 断网/弱网/出差演示

一句话分工:云端是"主编",本地是"贴身助理 + 离线工作台"。


二、当前已配置的模型清单(Hermes)

2.1 云端(主力,按现有 config.yaml)

用途 提供商 / 接入 接入点
当前默认主力(编码) 火山方舟 ark-code-latest(custom provider) https://ark.cn-beijing.volces.com/api/coding/v3
备用 / 长文 DeepSeek(deepseek-v4-flash / v4-pro) https://api.deepseek.com
Hermes 内置可选 OpenRouter / Anthropic / Google / Nous 等 20+ hermes model 切换

2.2 本地(本次新建)

项目 内容
模型 Qwen3.6-35B-A3B(MoE,35B 总参 / 每 token 激活 3B)
量化 UD-Q4_K_M(分组量化,20.61GB,质量损失约 1~3%)
引擎 llama.cpp b11345 Vulkan 预编译版(AMD 显卡可参与计算)
服务 llama-server,OpenAI 兼容 API,http://127.0.0.1:8080/v1
Hermes provider 名 local-llamacpp,模型名 qwen3.6-35b-a3b

2.3 目录结构(D 盘)

D:\LocalLLM\
├─ engine\      llama.cpp Vulkan 引擎(llama-server.exe 及 DLL)
├─ models\      Qwen3.6-35B-A3B-UD-Q4_K_M.gguf(20.61GB)
├─ scripts\     启动/健康检查/自启脚本、ensure_server.py
└─ logs\

三、本地模型能力边界(结合官方基准与本机硬件)

3.1 能力(官方模型卡实测参考)

  • 编码:SWE-bench Verified 73.4,Terminal-Bench 51.5,LiveCodeBench 80.4
  • Agent / 工具:MCPMark 37.0,MCP-Atlas 62.8
  • 知识:MMLU-Pro 85.2,C-Eval 90.0(中文优秀)
  • 数理:GPQA 86.0,AIME26 92.7

3.2 本机预期表现(实测数据待首次运行后回填)

  • 非思考模式:预估 8~14 tok/s(约每秒 6~10 汉字)
  • 思考模式(复杂问题):思考链长,需 1~5 分钟,只给难题用
  • 内存占用:模型 20.6GB + KV/缓冲约 2~6GB,合计 23~27GB;48GB 内存可同时办公
  • GPU:RX 6500 XT 4GB 仅 offload 少量层,加速 10~30%

3.3 任务路由表

日常任务 路由 说明
PPT 文案、课程大纲、分集结构 本地 ✅(要成稿质量再云端润色) 批量、高频
提词稿初稿、金句卡、标题选题 本地 ✅
书稿/SRT 喂入后的摘要、结构化 本地 ✅ 上下文 64k 够用
单文件代码、代码讲解、bug 调试 本地 ✅ 编码是该模型强项
本地代码库问答(隐私) 本地 ✅ 代码不出本机
中英互译 本地 ✅ C-Eval 90
出题、参考答案、知识点讲解 本地 ✅ 计算机/数学均可
隐私/未公开稿件处理 本地 ✅ 核心价值场景
断网演示、离线工作 本地 ✅
公众号/课程出版级成稿 ☁️ 云端终审 本地起草 → 云端把关
多文件复杂重构 ☁️ 云端(本地可辅助) 可靠性要求高
AI 资讯日报/周报 ☁️ 云端 必须联网搜索
需要最新知识的问答 ☁️ 云端 本地有知识截止期
最高质量长文、顶尖推理 ☁️ 云端旗舰 Claude/GPT 级

四、操作手册

4.1 启动 / 停止本地服务

  • 手动启动(有窗口,看日志):双击 D:\LocalLLM\scripts\启动本地模型.bat
  • 后台智能启动(已在跑则跳过): bash python D:\LocalLLM\scripts\ensure_server.py
  • 开机自启:双击 D:\LocalLLM\scripts\注册开机自启.bat(登录后自动后台运行)
  • 健康检查:双击 D:\LocalLLM\scripts\健康检查.bat
  • 命令行停止:taskkill /F /IM llama-server.exe(cmd);或任务管理器结束 llama-server

注意:模型未下载完成时 ensure_server.py 会提示"仍在下载中",属正常。

4.2 Hermes 中使用本地模型

会话内切换(无需改配置):

/model local-llamacpp/qwen3.6-35b-a3b

或在命令行直接指定:

hermes chat -m qwen3.6-35b-a3b

切回云端主力:

/model

(/model 不带参数会打开交互选择器,选 ark-code-latest 等云端模型)

4.3 直接调用本地 API(脚本/其他程序)

curl http://127.0.0.1:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.6-35b-a3b",
       "messages":[{"role":"user","content":"用三句话解释什么是 MoE"}]}'

端点与 OpenAI 完全兼容,可接任意支持自定义 base_url 的软件(Obsidian 插件、IDE 等)。

4.4 思考模式 / 非思考模式

  • 默认非思考,适合日常快速响应;
  • 难题在提示中要求"请深度思考后回答"可引导其展开推理;
  • 批量任务务必保持非思考,避免等待长思考链。

五、使用策略与省钱建议

  1. "本地起草、云端终审"两段式:课程稿、公众号长文先本地出框架和主体(零费用、不限次数),最后用云端过一遍质量。
  2. 批量与重复任务一律本地:一次要生成几十条标题、改写多段文案、批量总结,本地不心疼 token。
  3. 敏感数据不出本机:未发表书稿、学生信息、校内文件、自有代码,默认本地。
  4. 联网/时效任务直接云端:不在本地模型上浪费时间问最新资讯。
  5. 按任务切模型,不要一个模型用到黑:Hermes /model 随时切换。
  6. 内存与电力:本地服务常驻约占 23~27GB 内存;做视频导出/大型剪辑前可先 taskkill 释放。

六、后续可扩展

方向 动作 价值
加 2TB NVMe 第二 M.2 插槽加装 解锁 Colibrì + GLM-5.2 744B、DeepSeek V4 Flash 等
内存 → 96GB 2×48GB 替换 70B Q4 常驻、大上下文
换 24GB 显卡 RX 7900 XTX / RTX 本地速度质变
多模型库 在 models 目录增配 7B 轻量模型 轻任务更快、省内存
Colibrì 教学 写入 AI Agent 课程 多层存储/专家路由案例

七、故障排查

现象 处理
Hermes 调本地报连接失败 服务没启动:运行 ensure_server.py 或启动 bat
提示模型仍在下载 等下载完成(models 目录文件到 20.61GB)
8080 端口被占 netstat -ano | findstr :8080 查占用,或改启动脚本端口并同步 Hermes provider base_url
速度很慢 确认模型在 NVMe(非 HDD/NAS);切非思考模式;减少其他占内存/IO 程序
Vulkan 未生效 确认 AMD 驱动正常(vulkaninfo 可查到设备);引擎会自动回退 CPU,功能不受影响
配置改坏 用备份恢复:config.yaml.bak-20261002
与 Ollama 冲突 Ollama 默认 11434,与本地 8080 不冲突;如不用 Ollama 保持其进程关闭即可

八、关键路径速查

  • Hermes 配置:C:\Users\41456\AppData\Local\hermes\config.yaml
  • 配置备份:同目录 config.yaml.bak-20261002
  • 本地根目录:D:\LocalLLM\
  • 模型文件:D:\LocalLLM\models\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf
  • 本地 API:http://127.0.0.1:8080/v1
  • 模型来源:https://hf-mirror.com/unsloth/Qwen3.6-35B-A3B-GGUF
  • 引擎来源:llama.cpp b11345 Vulkan(ggml-org/llama.cpp Releases)