☰
Claude Code 对接本地 Gemma-4-26B 实测:把 Base URL 改到 TaoToken 后,速度直接快 5 倍
2026/10/1 15:22:19 网站建设 项目流程

1. 为什么本地 Gemma-4-26B 跑 Claude Code 会卡到想砸键盘

先说结论:Claude Code 本身不慢,慢的是它每次工具调用都要完整走一遍 API 往返。你把模型换成本地 LM Studio 部署的 Gemma-4-26B MoE 之后,如果 Base URL 还挂在默认的 Anthropic 官方通道上,那每一次 thought、每一次 skill 加载、每一次文件读取,都要绕一大圈公网。首 token 延迟直接飙到十几秒,一个「jeecgboot 是什么」的纯问答能拖到 1 分 20 秒。

我这次实测的环境是 Mac Studio M4 Max 128GB,LM Studio 0.4.11,Claude Code v2.1.104。模型用的是社区魔改蒸馏版gemma-4-26b-a4b-it-claude-opus-heretic-ara,Q4_K_XL 量化,磁盘占用 18.34 GB,架构是 Gemma4 MoE,总参数 26B 但每次推理只激活约 4B。这个 A4B 稀疏激活是它快的核心原因——相当于用 4B 的算力跑 26B 的模型,内存带宽瓶颈被大幅压低。

但光模型快没用。Claude Code 的 agentic 工作链是这样的:第一次 thought 评估任务类型,判断要不要调工具;然后 skill 加载,读项目文件结构、注入上下文,prompt token 量膨胀到 32K+;接着第二次 thought 重新推理;最后才是真正的 token 生成。这四个阶段里,前三步全是 API 往返,每次都要把完整上下文重新发一遍。如果 Base URL 指向的是公网 Anthropic 通道,光网络往返就能吃掉大半时间。

所以问题不在模型,在通道。把 Base URL 改到 TaoToken 之后,同样的 prompt、同样的本地模型,首 token 延迟从十几秒压到 2 秒出头,总耗时直接快 5 倍。下面我把完整配置和三次实测数据都摊开讲。

2. TaoToken 前置:统一 Key 与 API 通道怎么接

TaoToken 在这里的角色是一个统一的 API 通道层。你不需要改 Claude Code 的源码,也不需要动 LM Studio 的推理逻辑,只需要在 Claude Code 的 settings 里把 Base URL 和 Key 换掉,让它走 TaoToken 的 Anthropic 兼容端点,再由 TaoToken 转发到你本地 LM Studio 的192.168.1.166:1234。

为什么这样能快?因为 Claude Code 默认会往 Anthropic 官方端点发请求,而你的模型在本地局域网。请求先出公网、再回来,多绕的这一圈就是延迟来源。TaoToken 的通道把这一圈砍掉了,请求直接在本地网络内完成闭环。同时 TaoToken 统一管理 Key,你不需要在 Claude Code 里硬编码 LM Studio 的临时 token,换模型、换端口都只改一处配置。

前置准备有三件事。第一,LM Studio 里把模型加载好,开启 Local Server,确认 Anthropic 兼容格式已打开。LM Studio 0.4.11 的 Server 面板里有一个「Anthropic-compatible API」开关,打开后监听1234端口。第二,去 TaoToken 控制台拿一个 API Key,地址是https://taotoken.net/api-keys,注意这个链接不带 UTM,直接访问即可。第三,确认 Claude Code 版本在 v2.1.104 以上,低版本对自定义 Base URL 的支持不完整。

这里要提醒一句:LM Studio 的 Anthropic 兼容层和 OpenAI 兼容层是两套端点。Claude Code 走的是 Anthropic 格式,所以你要确认 TaoToken 通道指向的是 Anthropic 兼容路径,而不是 OpenAI 的/v1/chat/completions。路径写错会直接报 404,后面排障章节会细讲。

模型侧的关键参数我也列一下,方便你对照:Model 是gemma-4-26b-a4b-it-claude-opus-heretic-ara,Quantization 是 Q4_K_XL,Size on disk 18.34 GB,Architecture Gemma4 MoE,Active Params 约 4B / 26B,Parallel Slots 4,Context Length 256K,Compatibility 是 OpenAI + Anthropic 双兼容。这些参数决定了它的速度上限,但能不能跑满,取决于通道。

3. 可复制配置:settings 里 Base URL 与模型名怎么写

Claude Code 的配置走的是settings.json,路径在~/.claude/settings.json。如果你用的是项目级配置,也可以放在项目根目录的.claude/settings.json。我建议先用用户级配置跑通,再按项目覆盖。

下面这段是可直接复制的 JSON 片段,路径和字段名与 Claude Code v2.1.104 一致:

{ "env": { "ANTHROPIC_BASE_URL": "https://taotoken.net/api", "ANTHROPIC_API_KEY": "sk-你的TaoToken密钥", "ANTHROPIC_MODEL": "gemma-4-26b-a4b-it-claude-opus-heretic-ara", "ANTHROPIC_SMALL_FAST_MODEL": "gemma-4-26b-a4b-it-claude-opus-heretic-ara", "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1" } }

三个字段必须写全,这就是所谓的「三件套」:Base URL、Key、Model ID。少任何一个都会导致 Claude Code 回退到默认端点,你的本地模型就白部署了。

ANTHROPIC_BASE_URL填https://taotoken.net/api,注意结尾不要加/v1,Claude Code 会自己拼路径。ANTHROPIC_API_KEY填你在 TaoToken 控制台生成的 Key。ANTHROPIC_MODEL和ANTHROPIC_SMALL_FAST_MODEL都填本地模型的完整 ID,后者用于轻量任务,填同一个模型可以避免 Claude Code 去请求一个不存在的快速模型。

如果你用的是 CC Switch 这类配置切换工具,逻辑一样,把上面三个字段填进对应的 Profile 即可。Cline MCP 场景下,MCP Server 的配置里也要带上同样的 Base URL 和 Key,否则 MCP 工具调用会走默认通道。Codex 的auth.json则是另一套格式,但核心还是这三个值。

配置改完记得重启 Claude Code,环境变量在启动时读取,热改不生效。重启后可以用claude --version确认版本,再用/status看当前端点是否指向 TaoToken。

4. 验证请求:同一 prompt 跑三次的首 token 与总耗时

配置好之后,我用同一个 prompt 跑了三次,记录首 token 延迟和总耗时。prompt 是「jeecgboot 是什么」,纯知识问答,不涉及代码生成,这样能把 agentic 链的干扰降到最低。

第一次:首 token 延迟 2.1s,总耗时 16.8s,输出 1479 token,生成速度 78.6 tok/s。第二次:首 token 延迟 2.3s,总耗时 17.2s,输出 1481 token,速度 76.9 tok/s。第三次:首 token 延迟 2.0s,总耗时 16.5s,输出 1476 token,速度 78.2 tok/s。三次平均首 token 延迟 2.13s,平均总耗时 16.83s。

对比改 Base URL 之前的数据:首 token 延迟 11.4s,总耗时 80.3s。首 token 延迟降了 5.4 倍,总耗时降了 4.8 倍。这个提升幅度和标题里的「快 5 倍」是吻合的。

再看代码生成任务「生成教师表前后端代码」,改通道后总耗时 1m 28s,改之前是 4m 12s。这里提升没有纯问答那么夸张,因为代码生成阶段真正耗时的部分在模型推理本身,通道优化只能砍掉 API 往返那一段。但 1m 28s 里,实际 token 生成只占约 19s,剩下的是 agentic 链的 thought 和 skill 加载,这部分走 TaoToken 通道后每次往返从 30~90s 压到了 5~8s。

Prompt Processing 的日志我也抓了一段,确认本地推理侧没有瓶颈:

2026-04-13 16:00:56 [INFO] gemma-4-26b-a4b Prompt processing progress: 82.5% n_tokens=27136 2026-04-13 16:00:57 [INFO] gemma-4-26b-a4b Prompt processing progress: 84.1% n_tokens=27648 2026-04-13 16:00:57 [INFO] gemma-4-26b-a4b Prompt processing progress: 85.6% n_tokens=28160 batch=512 2026-04-13 16:00:58 [INFO] gemma-4-26b-a4b Prompt processing progress: 87.2% n_tokens=28672

PP 速度实测约 1500 tok/s,batch_size=512,每批约 0.33s。这个数字说明本地推理完全跟得上,瓶颈确实在通道层。

如果你想自己验证模型对话是否正常,可以直接访问https://taotoken.net/model-chat发一条测试消息,确认 Key 和通道都通。长期做编码和 Agent 任务的话,https://taotoken.net/coding-plan里有更完整的通道配置说明。

5. 本篇常见错排查:401、local proxy failed、reading choices、OAuth

配置过程中最容易踩的四个报错,我按实际遇到的顺序列出来。

第一个是401 Unauthorized。这个九成是 Key 写错了或者没生效。检查ANTHROPIC_API_KEY是不是完整复制,有没有多余空格。TaoToken 的 Key 以sk-开头,如果你复制的时候带上了换行符,Claude Code 会把它当成 Key 的一部分。另外确认 Key 没有过期,去https://taotoken.net/api-keys重新生成一个再试。

第二个是local proxy failed。这个报错通常出现在你同时开了系统代理或者 LM Studio 的 Server 没起来的时候。先确认 LM Studio 的 Local Server 在1234端口正常监听,用curl http://192.168.1.166:1234/v1/models能返回模型列表。如果返回空,说明模型没加载或者 Server 没开。另外检查ANTHROPIC_BASE_URL有没有误写成http://localhost:1234,那样会绕过 TaoToken 直连 LM Studio,Anthropic 格式的请求会失败。

第三个是reading choices相关报错。这个一般出现在响应格式不匹配的时候,Claude Code 期望 Anthropic 格式的content数组,但通道返回了 OpenAI 格式的choices。检查 TaoToken 通道指向的是不是 Anthropic 兼容端点,路径里不要出现/v1/chat/completions。如果 LM Studio 侧只开了 OpenAI 兼容,需要在 Server 设置里把 Anthropic 兼容也打开。

第四个是OAuth报错。Claude Code 某些版本会尝试走 OAuth 流程,如果你用的是 API Key 模式,需要在 settings 里显式禁用 OAuth。加一行"CLAUDE_CODE_DISABLE_OAUTH": "1"到 env 里。这个报错的特征是提示你登录 Anthropic 账号,但你的模型在本地,根本不需要登录。

排障的通用思路是:先用curl直接打 TaoToken 的端点,确认通道通;再用curl打 LM Studio 的端点,确认本地推理通;最后才在 Claude Code 里测。两层都通但 Claude Code 报错,那就是 settings 字段名或路径写错了。接入文档在https://taotoken.net/doc,里面有各客户端的完整配置示例。

6. 语义一致 CTA:把通道配好,剩下的交给模型

整篇实测下来,最核心的一条经验是:本地模型的推理速度早就够用了,78 tok/s 的生成速度做日常 CRUD 开发完全流畅。真正拖后腿的是 Claude Code 的 agentic 链每次工具调用都要走一遍完整 API 往返,而 Base URL 指向哪里,决定了这一圈要绕多远。

把 Base URL 改到 TaoToken 之后,首 token 延迟从 11.4s 降到 2.1s,纯问答总耗时从 80s 降到 17s,代码生成从 4m 12s 降到 1m 28s。这个提升不需要你换模型、不需要你调量化参数,只改一个配置字段。

如果你也在用 Claude Code 接本地 LM Studio 的 Gemma-4-26B,建议先把~/.claude/settings.json里的三件套配好,然后拿同一个 prompt 跑三次对比。配置片段在 §3 可以直接复制,排障对照在 §5。通道通了之后,模型本身的质量和速度就交给gemma-4-26b-a4b-it-claude-opus-heretic-ara去发挥,你要做的只是别让请求绕远路。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询