☰
如何 10 分钟上手 LongHorizon-Harness:从安装到跑通第一个桌面自动化任务的快速教程
2026/10/11 12:21:21 网站建设 项目流程
  • 人工智能
  • AI Agent
  • Agent 工作流
  • Agent 评测
  • GUI 自动化

【免费下载链接】LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

项目地址:https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness
点击查看免费下载

LongHorizon-Harness 是一个面向 AI Agent 的长程电脑使用(computer-use)执行框架:你只需给出一次目标,它就能驱动 Claude Code、Codex、OpenCode 或 DeepSeek Harness,跨桌面 App 和终端连续工作数十小时,并且每一步都会在真实环境中被验证、被存档。本文是一份新手友好的快速教程:环境检查 → 一键安装 → 项目初始化 → 在网页工作台或命令行中跑通第一个桌面自动化任务,全程约 10 分钟。

先懂原理:三个角色组成的"执行闭环"

LongHorizon-Harness 的核心思想是Loop Engineering(闭环工程):不训练新模型,而是给现有 Agent 套上一层"规划 → 执行 → 验证 → 保存或恢复"的循环。

它内部有三个职责清晰的分工:

角色干什么一句话理解
🧭Manager(调度)每轮重建任务全貌,决定下一步做什么项目的"项目经理"
⚡Executor(执行)用全新上下文完成一项边界明确的操作(点鼠标、跑命令)动手的"执行者"
🔍Auditor(审计)独立检查真实文件、界面、日志,不轻信执行者的汇报把关的"质检员"

只有通过 Auditor 独立验证的进度才会被保存为可信状态;失败的结果只作为证据进入下一轮。这意味着任务即使中途失败或上下文刷新,也能从上一个检查点可靠恢复——这正是"长程桌面自动化"可靠性的来源。

三个角色的完整实现分别在 src/lh_harness/manager.py(Manager 调度逻辑)、src/lh_harness/auditor_agent.py(独立审计),感兴趣的读者可以直接阅读源码。

环境准备:4 项依赖快速清单

开始前,确认电脑上具备以下条件(lh-harness doctor会帮你逐项检查):

依赖用途备注
Python 3.10+运行框架本体uv tool install会自带独立环境
uv(推荐)隔离式安装习惯 pip 也可以跳过
一个 Agent CLI实际执行任务claude/codex/opencode/dsh任选其一
Node.js 20+GUI 电脑操作插件需要任务不碰 GUI 可不装

💡 目前官方在 macOS 上测试最充分,Windows 可用但未经完整测试。

一键安装步骤:两行命令搞定

第 1 步:安装 LongHorizon-Harness 本体

uv tool install lh-harness # 或者:pip install lh-harness

第 2 步:(可选)安装电脑操作插件

如果你的任务不涉及点击桌面软件(纯命令行任务),可以跳过这步。需要操作 GUI 时,按你使用的 Agent 安装对应插件:

# 使用 Codex lh-harness plugin install codex-computer-use # 使用 Claude Code(或两者都用) lh-harness plugin install open-computer-use

插件安装一次即覆盖本机所有项目;macOS 上需要手动到"系统设置 → 隐私与安全性"中授权辅助功能和屏幕录制权限,安装过程会提示。

第 3 步:环境自检

lh-harness doctor

doctor是只读检查,会报告 Python 运行时、各 Agent CLI(通过实际执行--version验证而非仅查找路径)、Node.js 和插件状态,有任何一项失败都会给出修复提示。

项目初始化:生成专属配置文件

进入你想让 Agent 操作的项目目录,执行:

cd /path/to/your/project lh-harness init

这会在项目下生成./.lh-harness/config.toml(已存在则不覆盖,可用--force重新生成)。配置文件的核心是[run]段:

  • agent/model:全局默认后端与模型(如codex+gpt-5.6-sol)
  • max_rounds:最多允许的"规划-执行-审计"轮数,默认 30
  • dashboard:是否在每次运行时自动打开网页监控台
  • [run.roles.*]:为每个角色单独指定后端和模型——比如用旗舰模型做 Manager 和 Auditor,用便宜快速的模型做 Executor,按需控制成本

完整的字段说明见 src/lh_harness/config.py 与 README.zh-CN.md 中的"配置参考"章节。

跑通第一个桌面自动化任务(两条路径任选)

路径 A:浏览器工作台(推荐新手)

lh-harness web --workspace-root .

浏览器会自动打开http://127.0.0.1:8799/的 Web 工作台。在这里你可以:为每个角色分别选择后端和模型、发起任务、处理审批请求、运行中追加指令、随时停止或重启。工作台前端源码位于 frontend/web/src/,服务端在 src/lh_harness/dashboard/ 和 src/lh_harness/webapi/。

路径 B:命令行直接运行

TASK="检查当前目录并总结其中的文件结构。" lh-harness run --task "${TASK}" --agent codex

几个实用细节:

  • 命令行参数(如--agent)会临时覆盖配置文件中的同名字段;
  • 任务默认作用于你启动命令的目录,.lh-harness/目录本身受保护,不会把日志误当成任务内容;
  • 长任务建议写成文件再运行:lh-harness run --task @task.md;
  • 每次运行结束后,你会得到一段基于已验证状态的自然语言总结,任务未完成时会直说"未完成"。

运行中你能看到什么

运行期间,控制台按角色逐行打印进展,Dashboard 则展示每一轮的:📋 计划 → ⚡ 执行结果 → 🔍 审计证据 → ♻️ 返工原因。所有运行产物(任务状态、事件流、审计报告、各角色轨迹、最终报告)都保存在./.lh-harness/runs/<run-id>/下,完整报告在logs/report.json,让每一次进度都可检查、可恢复、可复现。

效果实测:同一模型,只换执行框架

LongHorizon-Harness 不是靠个别成功案例撑场面,而是在数百个 GUI + CLI 混合的真实任务上做了规模化评测(同一骨干模型 Qwen 3.7-Plus、同一执行后端,只改变外层框架):

基准指标Claude Code 裸跑LongHorizon-Harness提升
WeaveBench(114 个 GUI+CLI 任务)PassRate51.880.7+28.9
OSWorld 2.0(108 个桌面工作流)完整完成率2.88.33.0×
Terminal-Bench 2.1(CLI 长程任务)成功率69.777.2+7.5(且 token 少 24%)

三大基准的完整复现套件随仓库提供,分别位于 eval/WeaveBench-harness/、eval/OSWorldv2-harness/ 和 eval/TB-harness/,每个目录都配有环境配置与启动脚本说明。

源码结构速览与常见问题

核心源码全部在 src/lh_harness/ 下,几个值得关注的入口:

  • 命令行入口:src/lh_harness/cli.py
  • Agent 后端适配(Claude Code / Codex / OpenCode / DeepSeek):src/lh_harness/adapters/
  • 本地执行环境:src/lh_harness/environment/local.py
  • 角色提示词:src/lh_harness/role_prompts.py

如果想通读源码,可以克隆仓库浏览:

git clone https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness

新手常见卡点排查:

  1. doctor报 Agent CLI 失败 → 常见于 Windows 上 Microsoft Store 安装留下的 0 字节codex.exe别名,按doctor输出的提示重装 CLI 即可;
  2. macOS 上 GUI 操作无反应 → 检查"辅助功能"和"屏幕录制"权限是否已授权;
  3. 单轮超时 → 运行会保留部分轨迹和已验证状态,下一轮 Manager 会自动从工作区现状中恢复,无需人工干预;
  4. 版本问题 →lh-harness check-update可随时检查 PyPI 上的新版本。

写在最后

LongHorizon-Harness 把"让 AI 用一次鼠标"变成了"让 AI 连续可靠地工作数十小时":规划、执行、独立验证、断点恢复,四件事它都替你工程化好了。现在就可以运行uv tool install lh-harness,给自己定一个跨 App 的实际任务,10 分钟后你会拥有一个真正跑起来的桌面自动化系统。🚀

  • 人工智能
  • AI Agent
  • Agent 工作流
  • Agent 评测
  • GUI 自动化

【免费下载链接】LongHorizon-Harness

The long-horizon computer-use harness. Run AI agents across desktop apps and the CLI for extended periods while preserving task state and making reliable progress on complex workflows. Features fresh-context execution, durable verified state, independent auditing, recoverable progress, and native Claude Code / Codex / OpenClaw integration.

项目地址:https://gitcode.com/gh_mirrors/lo/LongHorizon-Harness
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询