Kimi K2 本地部署实操指南:16 张卡一条命令跑起万亿参数智能体模型
2026/9/15 11:55:31 网站建设 项目流程

Kimi K2 本地部署实操指南:16 张卡一条命令跑起万亿参数智能体模型

【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2

把 Kimi K2 智能体模型部署到本地,最先卡住你的往往不是模型本身,而是显存:总参数 1 万亿,FP8 权重大约 1TB,官方给出的最小部署单元是 16 卡集群。后文按官方文档路线走:先核对硬件,再起 vLLM 服务,最后把工具调用接上。

能力速览:Kimi K2 到底能干什么

Kimi K2 是 Moonshot AI 团队出品的开源智能体大模型,MoE 架构:总参数 1 万亿,每个 token 只激活 320 亿,从 384 个专家里选 8 个。上下文 128K,权重为 FP8(block-fp8)。两个变体:Base 是基座模型,适合微调;Instruct 是后训练版,直接用于对话和智能体任务。它的主场是三件事:长上下文理解、工具调用、智能体代码修复。

项目数值
架构MoE,384 个专家,每 token 选 8 个
总参数 / 激活参数1T / 32B
上下文长度128K
权重格式FP8(block-fp8)
推荐推理引擎vLLM、SGLang、KTransformers、TensorRT-LLM
适合的场景不适合的场景
长代码库、长文档的 128K 上下文分析单卡或小集群家用环境(官方最小单元为 16 卡)
工具调用、多步骤自动化任务拿 Base 直接当聊天助手(应用 Instruct)
智能体代码修复、自动改 bug 提补丁磁盘只剩 1TB 可用(权重本身已约 1TB)

开工前先核对这张硬件表 🧰

显存要求最直接的依据是部署文档:FP8 权重跑满 128K 上下文,在 H200/H20 平台的最小单元是 16 卡集群,张量并行或"数据并行+专家并行"。一句话,Kimi K2 的显存要求没有"单卡就行"这条路。采购前对一下这张表:

项目要求
GPU16 张 H20(96GB)或 H200(141GB),官方最小单元
Python3.8 以上,具体以推理引擎官方说明为准
CUDA11.7 以上,具体以推理引擎官方说明为准
磁盘权重约 1TB,建议预留 2TB 以上可用空间

卡数凑不够 16 张,就别硬上 vLLM,转去看部署文档里 KTransformers(GGUF)那一节,它面向 CPU 加 GPU 混合的环境。

一条命令路线跑通服务

先把项目拉下来:

git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2 cd Kimi-K2

再用 vLLM 起服务,官方要求版本不低于 v0.10.0rc1,$MODEL_PATH 换成权重路径:

vllm serve $MODEL_PATH --port 8000 \ --served-model-name kimi-k2 --trust-remote-code \ --tensor-parallel-size 16 \ --enable-auto-tool-choice --tool-call-parser kimi_k2

最后两个参数是开启工具调用的必选项。多节点示例和完整参数说明都在部署指南 docs/deploy_guidance.md 里。想追更高吞吐的,看同文件的 SGLang 一节;KTransformers 和 TensorRT-LLM 路线也在同一份文档里,这里不展开。

跑通后最值得调的三个点

温度。官方 README 给 Kimi-K2-Instruct 的推荐值是 0.6。它比推理引擎默认的 1.0 低,换一些随机性,工具调用和代码输出更稳定。请求里直接带上这个值,不用反复试。

工具调用。服务启动时带上--enable-auto-tool-choice --tool-call-parser kimi_k2,请求里把工具列表传进去并设tool_choice="auto",模型自己决定何时调用:

completion = client.chat.completions.create( model="kimi-k2", messages=messages, temperature=0.6, tools=tools, tool_choice="auto", ) # finish_reason=="tool_calls" 时执行函数,把结果以 role="tool" 写回 messages,再调一次

完整循环、流式输出、框架没有解析器时的手动解析,都写在 docs/tool_call_guidance.md。

代码生成。SWE-bench Verified 智能体代码修复单项,Kimi K2 Instruct 单次尝试通过率 65.8%,多语言任务 47.3%。想搭"开 issue → 自动修 bug → 提补丁"这类流程,可以从它切入。

新手最容易踩的三个坑 ⚠️

显存爆了。权重默认就是 FP8,再往下是量化路线;更先做的是砍你实际用到的上下文长度。官方 16 卡最小单元是按 128K 满长度算的,用不满就从这里省。

端口冲突。--port之前先看旧进程是不是还占着端口。等旧服务退出,再换端口重试,别以为换号就能绕过去。

工具调用回来一堆乱码。多半是启动 vLLM 时漏了--enable-auto-tool-choice--tool-call-parser kimi_k2。模型输出的是原始工具调用片段,客户端解析不了。你的推理框架没有原生解析器的话,翻工具调用说明的手动解析一节。

服务起好后,打开 docs/deploy_guidance.md 的 vLLM 一节,把参数和你实际的卡数对上。再跑通 README 里 Tool Calling 那章的 get_weather 示例,控制台打出 tool_result,这条路线就算真正通了。

【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询