引言#
随着量化技术和硬件能力的进步,在本地运行大语言模型(LLM)变得越来越实用。对于像OpenClaw和Hermes这样的代理框架,拥有一个具有大上下文窗口(10万+令牌)的本地LLM对于维护对话历史和执行复杂的多步骤任务至关重要。
本指南涵盖了2026年6月适用于128GB显存机器(如Strix Halo配置)的最佳模型,如何使用Docker中的Ollama部署它们,以及如何利用多令牌预测(MTP)进行推测解码以实现更快的推理。
为什么要本地运行LLM?#
在深入具体模型之前,以下是本地运行LLM用于代理的关键原因:
- 隐私:数据永远不会离开您的机器
- 延迟:无网络往返意味着更快的响应时间
- 成本:初始硬件投资后无需API费用
- 定制化:无限制地微调和修改模型
- 离线能力:代理无需互联网连接即可工作
128GB显存的最佳模型(2026年6月)#
以下是可以在128GB显存机器上运行、上下文窗口为10万+令牌的顶级模型:
Cohere Command A+(总参数218B,活跃参数25B)#
- 上下文:128k输入 / 64k输出
- 显存:4位量化下约110GB
- 优势:专门为对话式工具使用而训练,非常适合需要调用外部API和工具的代理框架
DeepSeek Coder V2(总参数236B,活跃参数20.9B)#
- 上下文:128k
- 显存:4位量化下约118GB
- 优势:专注于代码生成,支持338种语言,非常适合以代码为中心的代理
DeepSeek V4 Flash(总参数284B,活跃参数13B)#
- 上下文:128k原生(使用推测解码可达1M)
- 显存:4位量化下约80GB
- 优势:旗舰MoE模型,具有出色的推理能力
Gemma 4 26B/31B#
- 上下文:128k(E4B)至256k(26B/31B)
- 显存:4位量化下约33GB
- 优势:Google最新的开放模型,具有出色的长上下文支持
Qwen3-8B-128K#
- 上下文:128k
- 显存:4位量化下约4GB
- 优势:超轻量级,非常适合运行多个代理实例
使用Docker中的Ollama进行部署#
在本地运行这些模型最简单的方法是使用Docker容器中的Ollama。以下是开始步骤:
步骤1:获取GGUF模型#
大多数模型在Hugging Face上以GGUF文件形式提供。例如,获取DeepSeek V4 Flash Q2模型:
| |
步骤2:在Docker中设置Ollama#
创建模型目录并启动Ollama容器:
| |
步骤3:将模型导入Ollama#
| |
理解量化:Q2与Q4#
部署大型模型时,量化对于将其放入显存至关重要。以下是量化级别的含义:
| 量化 | 文件大小 | 显存使用 | 质量 |
|---|---|---|---|
| FP16 | ~570GB | ~600GB | 基线 |
| Q4 | ~150GB | ~160GB | 最小损失 |
| Q2 | ~80GB | ~90GB | 明显降质 |
对于128GB显存机器:
- Q4量化推荐用于参数高达约236B的模型
- Q2量化允许您运行更大的模型(284B+),但会有一些质量权衡
Imatrix与标准量化#
某些模型提供使用量化过程中重要性矩阵的"imatrix"变体:
- 标准Q2:使用基于权重能量的合成回退启发式方法
- Q2-imatrix:使用来自校准数据集的真实激活统计信息
imatrix版本在相同文件大小下提供更好的质量,因为它更智能地将位分配给最重要的参数。
使用MTP进行推测解码#
本地LLM推理中最令人兴奋的进步之一是多令牌预测(MTP)与推测解码的结合。以下是其工作原理:
标准推理的问题#
传统的自回归生成一次产生一个令牌:
| |
这是顺序的,没有有效利用GPU并行性。
MTP +推测解码的工作原理#
- 草稿阶段:MTP头使用单次前向传播并行预测多个候选令牌
- 验证阶段:基础模型在一次额外前向传播中验证所有候选
- 接受/拒绝:匹配的令牌保留;不匹配触发从该点重新生成
加速效果#
根据DeepSeek报告的85-90%接受率,您可以实现:
- 1.8倍吞吐量改进(每秒令牌数)
- 多令牌生成的延迟降低
在Ollama中使用MTP#
要在Ollama中启用MTP,请创建一个引用基础模型和MTP辅助文件的Modelfile:
| |
然后创建并运行模型:
| |
为您的用例选择合适的模型#
以下是快速参考指南:
| 用例 | 推荐模型 | 原因 |
|---|---|---|
| 带工具调用的代理编排 | Cohere Command A+ | 专门为工具使用而训练 |
| 代码生成和调试 | DeepSeek Coder V2 | 专注于代码,128k上下文 |
| 快速、低延迟响应 | Qwen3-8B-128K | 仅需4GB显存,可运行多个实例 |
| 平衡推理+长上下文 | Gemma 4 26B/31B | 最高256k上下文,适中显存 |
| 最大性能 | DeepSeek V4 Flash | 13B活跃参数,支持MTP加速 |
性能技巧#
- 量化到4位以获得质量和显存使用的最佳平衡
- 使用GGUF格式与基于llama.cpp的运行器,实现自动CPU卸载
- 为DeepSeek V4 Flash启用MTP以获得1.8倍速度改进
- 运行多个较小模型而不是一个大模型(如果您需要并发代理)
- 使用
nvidia-smi监控显存使用情况以避免内存不足错误
结论#
本地运行LLM用于代理从未如此简单。拥有128GB显存,您可以灵活选择多个具有128k+上下文窗口的优秀模型。无论您优先考虑工具使用能力(Command A+)、代码生成(DeepSeek Coder V2)还是原始性能(DeepSeek V4 Flash),都有适合您需求的模型。
Ollama的简单部署与推测解码的快速推理相结合,使本地代理部署既实用又高效。随着量化技术的不断改进,我们可以期待更大的模型在消费级硬件上变得可用。
