从Harness of Harnesses看Raven的下一代愿景:自进化多智能体生态架构与22项基准成绩
【免费下载链接】RavenThe Harness of Harnesses: a trusted, persistent, self-evolving multi-agent ecosystem for all-domain collaboration.项目地址: https://gitcode.com/gh_mirrors/raven35/Raven
Raven 是一个自进化多智能体编排生态系统,官方将其定位为 "The Harness of Harnesses"(驾驭框架的框架):作为宿主 Agent,它把研究、编程、设计、无人值守自动化等多个专业 Agent 汇聚到一个统一入口,自动生成 DAG 任务图并协调执行,同时在运行中持续自我改进,覆盖从深度研究到 PPT 生成的 22 项基准成绩表现。本文带你从架构到成绩,一次看懂这套多智能体生态的设计思路。
什么是Raven:一句话看懂 Harness of Harnesses
对新手来说,"Harness(马具/框架)"可以理解为一个 Agent 的"工作骨架":它决定了 Agent 听什么指令、用什么工具、怎样判断任务完成。而 Raven 的野心是做一个"骨架的骨架"——
- 统一入口:你只跟一个界面说话,Raven 负责判断任务该交给谁;
- DAG 编排:把复杂任务拆成有依赖关系的任务图,多个专业 Agent 并行或串行协作;
- 跨会话记忆:由 EverOS 驱动,用户偏好、Agent 经验、领域知识可以跨会话保留;
- 自我进化:harness 本身可以被诊断、打补丁、重新评估,越用越好。
目前 Raven 内置四大 Agent,开箱即用:🦅Raven-Research(深度研究)、Raven-Code(软件开发)、Raven-Design(视觉设计)、Raven-Oncall(无人值守流程自动化)。
架构拆解:自进化多智能体生态的四个关键模块
1. 统一入口 + DAG 任务编排
Raven 接到任务后先生成任务图(Task Graph):哪些节点可以并行、哪些必须等前序结果,一目了然。例如"写一份宋代美学 PPT"会被编排为:三个 Raven-Research 节点并行调研 → 汇聚到综合节点 → 交给一个 Raven-Design 节点产出幻灯片,整个过程成本约 0.8 美元。
2. 运行时自进化:Agent 跑着跑着就会"改自己"
这是 Raven 架构中最值得关注的部分。Agent 的运行循环被拆成Memory(记忆)、Planning(规划)、Capability(能力)、Action(行动)四个解耦的策略模块:
| 模块 | 控制什么 | 能否运行中修改 |
|---|---|---|
| Memory | Agent 收到哪些上下文 | ✅ |
| Planning | 什么算"任务完成" | ✅ |
| Capability | 能用哪些工具 | ✅ |
| Action | 行动前必须通过哪些检查 | ✅ |
修改只作用于当前这个 Agent(一段配置或一小段判断逻辑),无需重启,下一轮对话立即生效。"数字人(Persona)"是它的首个应用:描述你想要的助手,Raven 就会自动装配分工、工具范围与检查规则,并根据你的反馈持续打磨。
3. Evolver:离线"进化引擎",用基准测试驱动改进
如果说运行时自进化是"Agent 改自己",Evolver则是"研发侧的进化流水线":它作为一个独立工具,把 Raven 当库调用,自动执行"诊断失败轨迹 → 设计候选补丁 → 低成本初筛 → K=3 次复测确认 → 三道验证闸门"的漏斗,只有稳定跑赢基线的改动才会被保留为真实的 git 提交。这套流程的方法论写在 docs/specs/self-evolution-loop-sop.md,实现见 evolver/README.md。
4. EverOS 记忆 + SkillForge 技能库
- EverOS Memory:本地优先、Markdown 原生的长期记忆运行时,跨会话召回相关记忆与可复用技能;
- SkillForge:从本地技能库与 SkillHub 目录(11 万+ 技能)中按需检索技能,让 Agent "即需即学"。下图就是技能检索 Demo 的一个输出示例(一只水彩狐狸插画):
22项基准成绩:四大领域实测表现怎么读
Raven 的四个内置 Agent 在各自领域宣称达到业界领先(SOTA)水平。以下是 README.md 中披露的代表性基准成绩,覆盖编排、研究、编码、设计、值守五大方向:
| 领域 | 基准测试 | 关键成绩 |
|---|---|---|
| 多Agent编排 | Multi-Agent Orchestration Benchmark | Node F1、Edge F1、偏序准确率、精确匹配率四项指标领先 |
| 深度研究 | DeepResearch Mixed | 准确率领先,同时输入/输出 Token 与成本更低 |
| 编码 | SWE-bench Pro、SWE-bench Verified、SWE-Refactor、WorkBuddy-Code | 多项编程基准综合表现领先 |
| 数据分析 | DataAgentBench(2026-08-24 Live) | Raven-Code 搭配 Opus-5 取得0.8762 Pass@1,排名第一 |
| 幻灯片生成 | PresentBench | Raven-Design 排名第一 |
| 视觉设计 | ArtifactsBench(Dashboard/SVG)、GDPVal | 与 Claude Code、Hermes 对比领先 |
| AI4AI 自进化 | Nanochat 50M 预训练 | BPB 质量、Token 数与成本全面优于 Claude Code |
| AI4S 科研 | AI4S 内部基准 | 成功率与成本均显著占优 |
| 通用能力 | AppWorld、PinchBench、Proactivity 等 | 评测脚手架见 benchmarks/README.md |
值得一提的是 Raven-Design 的"方法论沉淀":它把设计规则整理成可检索的先例文档,Agent 产出前先对照规则索引,避免"AI 味"模板化设计:
新手上手:Raven多智能体生态的3步体验
第 1 步:一行脚本安装。Linux / macOS / WSL2 或 Windows PowerShell 均有官方一键安装脚本(见 README.md 的 Quick Start 章节);如果只装了 Git 和 Docker,也可以直接克隆仓库后用 Docker Compose 跑起来,仓库地址:
git clone https://gitcode.com/gh_mirrors/raven35/Raven容器方式的说明在 docker/README.md。
第 2 步:打开 WebUI。运行raven web即可在浏览器里获得统一工作台:聊天、跟踪任务进度、查看文件与产出、浏览记忆和技能,全部在一个界面完成。
第 3 步:下第一个多 Agent 任务。直接用自然语言描述目标(例如"调研某主题并做成 PPT"),Raven 会自动生成 DAG、委派 Agent 并整合结果。内置 Agent 的注册机制见 agents/README.md,开发者进阶流程见 docs/dev.md。
⚠️ Raven 目前处于 pre-alpha 阶段,接口与配置可能快速变化,体验前建议留意官方文档的更新说明。
写在最后
Raven 的下一代愿景可以浓缩为一句话:让"框架"本身成为可进化的资产——Agent 在运行中调整策略,Evolver 在离线时基于 22 项基准持续打磨 harness,EverOS 记忆与 SkillForge 让经验跨会话复利。对于想体验多智能体协作、又希望系统"越用越强"的用户来说,这套架构值得放进你的观察清单。
【免费下载链接】RavenThe Harness of Harnesses: a trusted, persistent, self-evolving multi-agent ecosystem for all-domain collaboration.项目地址: https://gitcode.com/gh_mirrors/raven35/Raven
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考