- 人工智能
- AI Agent
- Agent 工作流
- Agent 评测
- GUI 自动化
【免费下载链接】LongHorizon-Harness
The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.
LongHorizon-Harness 是一个面向 AI Agent 的长程电脑使用(computer-use)执行框架:你只需给出一次目标,它就能驱动 Claude Code、Codex、OpenCode 或 DeepSeek Harness,跨桌面 App 和终端连续工作数十小时,并且每一步都会在真实环境中被验证、被存档。本文是一份新手友好的快速教程:环境检查 → 一键安装 → 项目初始化 → 在网页工作台或命令行中跑通第一个桌面自动化任务,全程约 10 分钟。
先懂原理:三个角色组成的"执行闭环"
LongHorizon-Harness 的核心思想是Loop Engineering(闭环工程):不训练新模型,而是给现有 Agent 套上一层"规划 → 执行 → 验证 → 保存或恢复"的循环。
它内部有三个职责清晰的分工:
| 角色 | 干什么 | 一句话理解 |
|---|---|---|
| 🧭Manager(调度) | 每轮重建任务全貌,决定下一步做什么 | 项目的"项目经理" |
| ⚡Executor(执行) | 用全新上下文完成一项边界明确的操作(点鼠标、跑命令) | 动手的"执行者" |
| 🔍Auditor(审计) | 独立检查真实文件、界面、日志,不轻信执行者的汇报 | 把关的"质检员" |
只有通过 Auditor 独立验证的进度才会被保存为可信状态;失败的结果只作为证据进入下一轮。这意味着任务即使中途失败或上下文刷新,也能从上一个检查点可靠恢复——这正是"长程桌面自动化"可靠性的来源。
三个角色的完整实现分别在 src/lh_harness/manager.py(Manager 调度逻辑)、src/lh_harness/auditor_agent.py(独立审计),感兴趣的读者可以直接阅读源码。
环境准备:4 项依赖快速清单
开始前,确认电脑上具备以下条件(lh-harness doctor会帮你逐项检查):
| 依赖 | 用途 | 备注 |
|---|---|---|
| Python 3.10+ | 运行框架本体 | uv tool install会自带独立环境 |
| uv(推荐) | 隔离式安装 | 习惯 pip 也可以跳过 |
| 一个 Agent CLI | 实际执行任务 | claude/codex/opencode/dsh任选其一 |
| Node.js 20+ | GUI 电脑操作插件需要 | 任务不碰 GUI 可不装 |
💡 目前官方在 macOS 上测试最充分,Windows 可用但未经完整测试。
一键安装步骤:两行命令搞定
第 1 步:安装 LongHorizon-Harness 本体
uv tool install lh-harness # 或者:pip install lh-harness第 2 步:(可选)安装电脑操作插件
如果你的任务不涉及点击桌面软件(纯命令行任务),可以跳过这步。需要操作 GUI 时,按你使用的 Agent 安装对应插件:
# 使用 Codex lh-harness plugin install codex-computer-use # 使用 Claude Code(或两者都用) lh-harness plugin install open-computer-use插件安装一次即覆盖本机所有项目;macOS 上需要手动到"系统设置 → 隐私与安全性"中授权辅助功能和屏幕录制权限,安装过程会提示。
第 3 步:环境自检
lh-harness doctordoctor是只读检查,会报告 Python 运行时、各 Agent CLI(通过实际执行--version验证而非仅查找路径)、Node.js 和插件状态,有任何一项失败都会给出修复提示。
项目初始化:生成专属配置文件
进入你想让 Agent 操作的项目目录,执行:
cd /path/to/your/project lh-harness init这会在项目下生成./.lh-harness/config.toml(已存在则不覆盖,可用--force重新生成)。配置文件的核心是[run]段:
agent/model:全局默认后端与模型(如codex+gpt-5.6-sol)max_rounds:最多允许的"规划-执行-审计"轮数,默认 30dashboard:是否在每次运行时自动打开网页监控台[run.roles.*]:为每个角色单独指定后端和模型——比如用旗舰模型做 Manager 和 Auditor,用便宜快速的模型做 Executor,按需控制成本
完整的字段说明见 src/lh_harness/config.py 与 README.zh-CN.md 中的"配置参考"章节。
跑通第一个桌面自动化任务(两条路径任选)
路径 A:浏览器工作台(推荐新手)
lh-harness web --workspace-root .浏览器会自动打开http://127.0.0.1:8799/的 Web 工作台。在这里你可以:为每个角色分别选择后端和模型、发起任务、处理审批请求、运行中追加指令、随时停止或重启。工作台前端源码位于 frontend/web/src/,服务端在 src/lh_harness/dashboard/ 和 src/lh_harness/webapi/。
路径 B:命令行直接运行
TASK="检查当前目录并总结其中的文件结构。" lh-harness run --task "${TASK}" --agent codex几个实用细节:
- 命令行参数(如
--agent)会临时覆盖配置文件中的同名字段; - 任务默认作用于你启动命令的目录,
.lh-harness/目录本身受保护,不会把日志误当成任务内容; - 长任务建议写成文件再运行:
lh-harness run --task @task.md; - 每次运行结束后,你会得到一段基于已验证状态的自然语言总结,任务未完成时会直说"未完成"。
运行中你能看到什么
运行期间,控制台按角色逐行打印进展,Dashboard 则展示每一轮的:📋 计划 → ⚡ 执行结果 → 🔍 审计证据 → ♻️ 返工原因。所有运行产物(任务状态、事件流、审计报告、各角色轨迹、最终报告)都保存在./.lh-harness/runs/<run-id>/下,完整报告在logs/report.json,让每一次进度都可检查、可恢复、可复现。
效果实测:同一模型,只换执行框架
LongHorizon-Harness 不是靠个别成功案例撑场面,而是在数百个 GUI + CLI 混合的真实任务上做了规模化评测(同一骨干模型 Qwen 3.7-Plus、同一执行后端,只改变外层框架):
| 基准 | 指标 | Claude Code 裸跑 | LongHorizon-Harness | 提升 |
|---|---|---|---|---|
| WeaveBench(114 个 GUI+CLI 任务) | PassRate | 51.8 | 80.7 | +28.9 |
| OSWorld 2.0(108 个桌面工作流) | 完整完成率 | 2.8 | 8.3 | 3.0× |
| Terminal-Bench 2.1(CLI 长程任务) | 成功率 | 69.7 | 77.2 | +7.5(且 token 少 24%) |
三大基准的完整复现套件随仓库提供,分别位于 eval/WeaveBench-harness/、eval/OSWorldv2-harness/ 和 eval/TB-harness/,每个目录都配有环境配置与启动脚本说明。
源码结构速览与常见问题
核心源码全部在 src/lh_harness/ 下,几个值得关注的入口:
- 命令行入口:src/lh_harness/cli.py
- Agent 后端适配(Claude Code / Codex / OpenCode / DeepSeek):src/lh_harness/adapters/
- 本地执行环境:src/lh_harness/environment/local.py
- 角色提示词:src/lh_harness/role_prompts.py
如果想通读源码,可以克隆仓库浏览:
git clone https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness新手常见卡点排查:
doctor报 Agent CLI 失败 → 常见于 Windows 上 Microsoft Store 安装留下的 0 字节codex.exe别名,按doctor输出的提示重装 CLI 即可;- macOS 上 GUI 操作无反应 → 检查"辅助功能"和"屏幕录制"权限是否已授权;
- 单轮超时 → 运行会保留部分轨迹和已验证状态,下一轮 Manager 会自动从工作区现状中恢复,无需人工干预;
- 版本问题 →
lh-harness check-update可随时检查 PyPI 上的新版本。
写在最后
LongHorizon-Harness 把"让 AI 用一次鼠标"变成了"让 AI 连续可靠地工作数十小时":规划、执行、独立验证、断点恢复,四件事它都替你工程化好了。现在就可以运行uv tool install lh-harness,给自己定一个跨 App 的实际任务,10 分钟后你会拥有一个真正跑起来的桌面自动化系统。🚀
- 人工智能
- AI Agent
- Agent 工作流
- Agent 评测
- GUI 自动化
【免费下载链接】LongHorizon-Harness
The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.
相关推荐
5分钟快速上手Guardian:从安装配置到跑通第一个AI自动化渗透测试
5分钟快速上手Guardian:从安装配置到跑通第一个AI自动化渗透测试 Guardian 是一款 AI 驱动的渗透测试自动化 CLI 工具 :只需安装 Pyt
DLSS Swapper 批量替换 DLSS 文件:7 大平台游戏统一管理 DLSS 版本
DLSS Swapper 批量替换 DLSS 文件:7 大平台游戏统一管理 DLSS 版本 场景切入 你刚给《赛博朋克 2077》调完画质,却发现新版本的 DL
桌面应用Buzz:离线音频转录工具,用 Whisper 在本地完成语音转文字
Buzz:离线音频转录工具,用 Whisper 在本地完成语音转文字 开会录音、播客内容、课程讲解,想转成文字却又不放心把音频传到云端?Buzz 基于 Open
人工智能语音音频本地部署桌面应用
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考