1. 无 GPU 也能跑大模型:OpenClaw + Ollama 本地离线部署到底解决什么问题
很多人第一次听到「本地离线部署 AI 大模型」,脑子里冒出来的第一反应是:得有一张 RTX 4090 吧?显存不够是不是直接跑不起来?我一开始也这么想,直到把 Ollama 装到一台只有 16GB 内存、核显办公本上,跑通了 Qwen3:0.6b 和 Qwen3.5:cloud,才发现门槛比想象中低得多。
先把概念说清楚。Ollama是一个本地大模型运行与管理工具,你可以把它理解成「模型界的 Docker」——一条命令拉取模型、一条命令启动服务,它负责把模型加载进内存、暴露一个本地 HTTP 接口。OpenClaw则是一个本地 AI 可视化交互界面,作用是把命令行里冷冰冰的>>>提示符,换成类似在线聊天工具的对话框,让你不用记命令也能对话。Qwen3.5:cloud和Qwen3:0.6b是通义千问系列的两个不同定位的模型:前者对话能力更强,作为主力;后者参数量只有 0.6B,内存占用极低,8GB 内存的老机器也能扛住,作为轻量备选。
这套组合适合谁?我总结了三类:一是想学 AI 本地部署但没有任何 GPU 的新手;二是对数据隐私敏感、不希望对话内容上传到任何云端的人;三是学生或开发者,想在自己电脑上搭一个免费、无流量限制、可断网使用的对话助手。它的核心价值就四个字:离线、免费。模型下载完之后,运行时可以完全断网,数据不出本机。
不过这里有个现实问题需要提前说清楚:纯本地模型在低配机器上,能力和速度都有天花板。Qwen3:0.6b 胜在轻,但复杂推理会力不从心;Qwen3.5:cloud 在本地跑虽然流畅,可一旦你想调用更强的云端模型(比如更大的 Qwen 版本、Claude 系列),本地这套是接不上的。所以本文除了讲透本地部署,还会在最后告诉你一个扩展思路:把 OpenClaw 或 Ollama 的 endpoint 指向统一的 API 通道,用同一个 Key 同时管理本地模型和云端模型,需要爆发力的时候切云端,需要隐私的时候切本地。这个通道我用的是 TaoToken,后面会给具体配置。
下面进入实操。整个过程分四步:装 Ollama、拉模型、装 OpenClaw、连起来验证。每一步我都会给完整命令和预期输出,你照着敲就行。
2. 前置准备:Ollama 安装与 Qwen3.5:cloud / Qwen3:0.6b 模型拉取
这一节是整篇的地基,地基没打好,后面 OpenClaw 连不上全是白搭。我踩过的坑基本都集中在这里,所以写得细一点。
2.1 环境要求与 Ollama 安装
先对一下你的机器。操作系统 Windows 10 或 Windows 11 都行,内存最低 8GB,推荐 16GB。不需要独立显卡,CPU 就能跑。硬盘留出至少 10GB 空间给模型文件。网络只在下载模型时需要,运行阶段可以断网。
安装 Ollama 的步骤很直白:打开官网https://ollama.com/,点 Download 下载 Windows 版本,双击安装包一路下一步。安装完成后 Ollama 会自动在后台常驻运行,你会在任务栏右下角看到它的图标。
验证安装是否成功,打开 CMD 或 PowerShell,输入:
ollama --version能打印出版本号就说明装好了。如果提示'ollama' 不是内部或外部命令,说明安装时没把路径写进环境变量,最省事的办法是重启一次终端,或者重新跑一遍安装包。
2.2 拉取并运行 Qwen3.5:cloud(主力模型)
确认 Ollama 在跑之后,直接拉主力模型:
ollama run qwen3.5:cloud第一次执行会自动下载模型文件,下载完成后出现>>>提示符,就代表模型已经加载进内存、可以对话了。你可以直接输入测试:
你好,介绍一下自己模型能正常回答,说明 Qwen3.5:cloud 部署成功。这个模型在低配电脑上运行也比较流畅,日常问答、写文案、解释代码都够用。
2.3 拉取并运行 Qwen3:0.6b(轻量备选)
如果你的机器只有 8GB 内存,跑 Qwen3.5:cloud 时风扇狂转、输入卡顿,那就换超轻量的 Qwen3:0.6b:
ollama run qwen3:0.6b同样,出现>>>就是启动成功。它的内存占用只有 1GB 到 1.5GB 左右,启动速度 1 到 3 秒,非常适合老机器。测试命令和上面一样,输入「你好,介绍一下自己」看它是否正常回复。
两个模型都拉完之后,用一条命令确认它们都在本地:
ollama list输出里应该能同时看到qwen3.5:cloud和qwen3:0.6b两行,以及各自的体积和修改时间。这一步很关键,后面 OpenClaw 找不到模型,八成就是这里没拉全。
2.4 让 Ollama 对外暴露服务(关键配置)
默认情况下 Ollama 只监听127.0.0.1:11434,本机访问没问题。但如果你想让局域网内其他设备、或者容器里的 OpenClaw 也能连上,就需要改一下监听地址。Windows 下通过环境变量设置:
# Ollama 服务配置(Windows 环境变量方式) OLLAMA_HOST=0.0.0.0:11434 OLLAMA_ORIGINS=* OLLAMA_KEEP_ALIVE=5mOLLAMA_HOST改成0.0.0.0:11434表示监听所有网卡;OLLAMA_ORIGINS=*放开跨域限制,避免浏览器端调用被拦;OLLAMA_KEEP_ALIVE=5m表示模型空闲 5 分钟后卸载,省内存。设置完记得重启 Ollama 服务(任务栏右键图标 → Quit,再重新打开)。
注意:
OLLAMA_ORIGINS=*只建议在可信的本地网络里用。如果你把机器暴露在公网,务必收紧这个值,否则任何人都能调用你的模型。
配置改完后,用一条命令验证服务是否正常监听:
curl http://localhost:11434/api/tags返回一段 JSON,里面列出你本地所有模型,就说明 Ollama 服务已经就绪,可以进入下一步接 OpenClaw 了。
3. 可复制配置:OpenClaw 接入 Ollama 与 TaoToken 统一通道
这一节是全文的核心操作区,我会给出 OpenClaw 连接本地 Ollama 的完整参数,以及如何把 endpoint 扩展到 TaoToken 统一 Key/API 通道,让你一套界面同时管本地和云端模型。
3.1 OpenClaw 安装与基础设置
OpenClaw 的发布页在https://github.com/sqzw-x/OpenClaw,找到最新版本的 Windows 安装包,下载后解压或安装,打开软件。首次进入是空的对话界面,右上角进设置。
在设置里,模型来源选 Ollama,地址保持默认:
{ "provider": "ollama", "baseUrl": "http://localhost:11434", "model": "qwen3.5:cloud", "fallbackModel": "qwen3:0.6b", "timeout": 120 }这段 JSON 就是 OpenClaw 连接本地 Ollama 的最小配置。baseUrl必须和 Ollama 实际监听地址一致,多一个斜杠、少一个端口都会连不上。model填主力模型,fallbackModel填轻量备选,主模型加载失败时自动降级。timeout给到 120 秒,是因为低配机器首次加载模型可能比较慢,超时设太短会误报失败。
保存后回到主界面,模型下拉框里应该能选到qwen3.5:cloud和qwen3:0.6b。如果下拉框是空的,先别急着怀疑软件,往下看第 5 节的排查。
3.2 把 endpoint 扩展到 TaoToken 统一通道
本地模型有个绕不开的局限:能力上限就在那。当你需要更强的推理、更长的上下文,或者想用 Claude 系列模型时,本地这套接不上。这时候可以把 OpenClaw 的模型来源从「纯 Ollama」扩展成「Ollama + 云端 API 双通道」。
TaoToken 提供统一的 Key 和 API 通道,Base URL 是https://taotoken.net/api,一个 Key 就能调用多种云端模型。配置片段如下:
{ "provider": "openai-compatible", "baseUrl": "https://taotoken.net/api", "apiKey": "sk-你的TaoToken密钥", "model": "claude-sonnet-4-5", "localFallback": { "provider": "ollama", "baseUrl": "http://localhost:11434", "model": "qwen3:0.6b" } }这里provider选openai-compatible,因为 TaoToken 的接口兼容 OpenAI 格式,绝大多数支持自定义 endpoint 的客户端都能直接接。baseUrl填https://taotoken.net/api,注意不要多加/v1之类的后缀,具体路径以接入文档为准。apiKey换成你在控制台生成的 Key。localFallback是本地兜底,云端不通时自动切回本地 Qwen3:0.6b,保证对话不中断。
如果你用的是 Claude Code 这类工具,配置方式类似,核心三件套永远是:Base URL + API Key + Model ID。三者缺一不可,任何一个填错都会报 401 或模型不存在。
3.3 用 CC Switch 管理多套配置
如果你同时维护本地 Ollama、TaoToken 云端、以及别的通道,手动改配置文件很容易乱。可以用 CC Switch 这类配置切换工具,把每套配置存成一个 profile,一键切换。每个 profile 里同样写全三件套:
# profile: taotoken-cloud base_url = "https://taotoken.net/api" api_key = "sk-你的TaoToken密钥" model = "claude-sonnet-4-5" # profile: local-ollama base_url = "http://localhost:11434" api_key = "ollama" model = "qwen3.5:cloud"本地 Ollama 的api_key随便填一个占位符就行,它不校验。这样你在 OpenClaw 里切换 profile,就等于在本地和云端之间切换,体验很顺。
提示:TaoToken 的 API Key 在控制台的 API Keys 页面生成,模型列表和接入细节看官方文档。地址统一用
https://taotoken.net/api,不要自己拼路径。
配置写完后,OpenClaw 的模型列表里应该同时出现本地模型和云端模型。接下来就是验证它们是否真的能通。
4. 验证请求:逐条命令确认本地与云端模型都能正常响应
配置写完不代表能用,必须逐条验证。这一节我给出一套从底层到上层的验证命令,任何一环出问题都能快速定位。
4.1 验证 Ollama 服务本身
第一步,确认 Ollama 在监听:
curl http://localhost:11434/api/tags返回 JSON 里能看到qwen3.5:cloud和qwen3:0.6b,说明服务正常、模型已注册。
第二步,直接调 Ollama 的生成接口,确认模型能出字:
curl http://localhost:11434/api/generate -d "{\"model\":\"qwen3:0.6b\",\"prompt\":\"用一句话解释什么是大模型\",\"stream\":false}"如果返回的 JSON 里response字段有内容,说明模型推理链路完全打通。这一步绕过了 OpenClaw,能排除界面层的干扰。
4.2 验证 OpenClaw 到 Ollama 的连接
打开 OpenClaw,在对话框输入「你好,介绍一下自己」。预期结果是模型在几秒内开始逐字输出。如果长时间转圈,看第 5 节的local proxy failed排查。
同时观察任务管理器的内存占用:跑 Qwen3:0.6b 时大约增加 1GB 到 1.5GB,跑 Qwen3.5:cloud 时大约 2GB 到 4GB。如果内存占用没变化,说明模型根本没加载,多半是模型名填错了。
4.3 验证 TaoToken 云端通道
切到 TaoToken profile,发一条测试消息。如果返回 401,说明 Key 不对或没带上;如果返回模型不存在,说明 Model ID 写错了。正确的响应应该是正常的对话内容。
你也可以直接用 curl 验证云端通道:
curl https://taotoken.net/api/chat/completions \ -H "Authorization: Bearer sk-你的TaoToken密钥" \ -H "Content-Type: application/json" \ -d "{\"model\":\"claude-sonnet-4-5\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"返回带choices字段的 JSON,就说明云端通道打通了。注意这里的choices是 OpenAI 兼容格式的标准字段,如果报reading choices相关错误,通常是响应体不是预期格式,检查 Base URL 是否写成了别的路径。
4.4 验证本地与云端自动切换
最后测一下兜底逻辑:把网络断开,再发一条消息。如果配置了localFallback,OpenClaw 应该自动切到本地 Qwen3:0.6b 继续回答。这一步验证的是整套方案的鲁棒性——云端不可用时,本地依然能顶上。
到这里,本地离线部署和云端扩展两条链路都验证完毕。你可以根据场景自由切换:处理敏感数据时用本地,需要强推理时切云端。
5. 本篇常见报错排查:401、local proxy failed、reading choices、OAuth
这一节把最容易撞上的四类报错拆开讲,每条都给现象、原因、解决动作。
5.1 401 Unauthorized
现象:调用 TaoToken 云端通道时返回 401。原因通常是三种:Key 没填、Key 填错、或者请求头里没带Authorization。解决动作:检查配置文件里的apiKey字段,确认是sk-开头且没有多余空格;用上面的 curl 命令单独测一次,排除客户端问题;如果 Key 刚生成,确认没有复制漏字符。
5.2 local proxy failed / 连不上 127.0.0.1:11434
现象:OpenClaw 报local proxy failed或连接被拒绝。原因:Ollama 没在运行,或者地址写错。解决动作:看任务栏右下角有没有 Ollama 图标,没有就重新启动;任务栏右键 Ollama → Restart;检查baseUrl是否为http://localhost:11434,注意不要写成https,也不要多加/v1。用curl http://localhost:11434/api/tags确认服务活着。
5.3 reading choices 报错
现象:云端返回解析失败,日志里出现reading choices。原因:响应体不是 OpenAI 兼容格式,通常是 Base URL 路径写错,请求打到了非预期端点。解决动作:确认baseUrl是https://taotoken.net/api,不要自己拼/v1/chat/completions之类的完整路径,具体以接入文档为准;用 curl 直接测一次,看返回 JSON 里有没有choices字段。
5.4 OAuth 相关报错
现象:某些工具(如 Claude Code)提示 OAuth 失败或未授权。原因:这类工具默认走 OAuth 登录流程,而你用的是 API Key 模式,两者冲突。解决动作:在工具设置里切换到 API Key 认证方式,填全三件套 Base URL、API Key、Model ID;如果工具支持auth.json配置,直接写入:
{ "baseUrl": "https://taotoken.net/api", "apiKey": "sk-你的TaoToken密钥", "model": "claude-sonnet-4-5" }5.5 模型列表为空 / 不显示模型
现象:OpenClaw 下拉框里没有qwen3.5:cloud或qwen3:0.6b。原因:模型没拉全,或 OpenClaw 缓存了旧列表。解决动作:命令行跑ollama list确认模型存在;重启 OpenClaw 重新加载;进设置重新选模型并保存。如果还是不行,检查 Ollama 版本是否过旧,升级到最新版。
5.6 内存不足、电脑卡顿
现象:跑 Qwen3.5:cloud 时系统卡死。原因:内存不够。解决动作:关掉浏览器、视频软件、后台下载工具;切换到 Qwen3:0.6b;或者用更小参数的qwen3.5:4b。命令:
ollama run qwen3:0.6b如果 0.6b 还卡,那基本是机器太老,建议直接用 TaoToken 云端通道,把推理放到远端,本地只负责显示。
6. 从本地到云端:一套 Key 打通 OpenClaw 的模型调用链路
把上面几步走完,你手里其实已经有了两套能力:一套是完全离线、数据不出本机的本地模型(Qwen3.5:cloud 主力 + Qwen3:0.6b 备选),另一套是通过 TaoToken 统一通道调用的云端模型。两者在 OpenClaw 里共存,按场景切换。
本地这套的价值在于隐私和免费。模型下载完之后断网可用,对话记录只存在你硬盘上,适合处理合同、代码、个人笔记这类不想外传的内容。Qwen3:0.6b 在 8GB 内存机器上也能跑,启动 1 到 3 秒,日常问答够用。
云端这套的价值在于能力上限。当你需要更强的推理、更长的上下文,或者要用 Claude 系列模型时,把 endpoint 切到https://taotoken.net/api,用同一个 Key 就能调用。配置三件套记牢:Base URL 填https://taotoken.net/api,API Key 在控制台生成,Model ID 按文档填。三者填全,401 和模型不存在的问题基本都能避免。
如果你打算长期做编码或 Agent 类任务,可以考虑 Coding Plan,把云端通道的额度用得更充分;如果只是想先验证模型效果,直接进模型对话页面试几条;接入过程中卡在报错上,去 API Keys 页面重新生成 Key,再对照接入文档逐项核对配置。
最后给一个实用建议:把本地和云端的配置都存成 profile,用 CC Switch 一键切换。日常轻量问答走本地 Qwen3:0.6b,省资源;遇到硬骨头切云端。这样一套界面、一个 Key,本地和云端都不耽误。