☰
从Harness of Harnesses看Raven的下一代愿景:自进化多智能体生态架构与22项基准成绩
2026/9/25 15:52:16 网站建设 项目流程

从Harness of Harnesses看Raven的下一代愿景:自进化多智能体生态架构与22项基准成绩

【免费下载链接】RavenThe Harness of Harnesses: a trusted, persistent, self-evolving multi-agent ecosystem for all-domain collaboration.项目地址: https://gitcode.com/gh_mirrors/raven35/Raven

Raven 是一个自进化多智能体编排生态系统,官方将其定位为 "The Harness of Harnesses"(驾驭框架的框架):作为宿主 Agent,它把研究、编程、设计、无人值守自动化等多个专业 Agent 汇聚到一个统一入口,自动生成 DAG 任务图并协调执行,同时在运行中持续自我改进,覆盖从深度研究到 PPT 生成的 22 项基准成绩表现。本文带你从架构到成绩,一次看懂这套多智能体生态的设计思路。

什么是Raven:一句话看懂 Harness of Harnesses

对新手来说,"Harness(马具/框架)"可以理解为一个 Agent 的"工作骨架":它决定了 Agent 听什么指令、用什么工具、怎样判断任务完成。而 Raven 的野心是做一个"骨架的骨架"——

  • 统一入口:你只跟一个界面说话,Raven 负责判断任务该交给谁;
  • DAG 编排:把复杂任务拆成有依赖关系的任务图,多个专业 Agent 并行或串行协作;
  • 跨会话记忆:由 EverOS 驱动,用户偏好、Agent 经验、领域知识可以跨会话保留;
  • 自我进化:harness 本身可以被诊断、打补丁、重新评估,越用越好。

目前 Raven 内置四大 Agent,开箱即用:🦅Raven-Research(深度研究)、Raven-Code(软件开发)、Raven-Design(视觉设计)、Raven-Oncall(无人值守流程自动化)。

架构拆解:自进化多智能体生态的四个关键模块

1. 统一入口 + DAG 任务编排

Raven 接到任务后先生成任务图(Task Graph):哪些节点可以并行、哪些必须等前序结果,一目了然。例如"写一份宋代美学 PPT"会被编排为:三个 Raven-Research 节点并行调研 → 汇聚到综合节点 → 交给一个 Raven-Design 节点产出幻灯片,整个过程成本约 0.8 美元。

2. 运行时自进化:Agent 跑着跑着就会"改自己"

这是 Raven 架构中最值得关注的部分。Agent 的运行循环被拆成Memory(记忆)、Planning(规划)、Capability(能力)、Action(行动)四个解耦的策略模块:

模块控制什么能否运行中修改
MemoryAgent 收到哪些上下文✅
Planning什么算"任务完成"✅
Capability能用哪些工具✅
Action行动前必须通过哪些检查✅

修改只作用于当前这个 Agent(一段配置或一小段判断逻辑),无需重启,下一轮对话立即生效。"数字人(Persona)"是它的首个应用:描述你想要的助手,Raven 就会自动装配分工、工具范围与检查规则,并根据你的反馈持续打磨。

3. Evolver:离线"进化引擎",用基准测试驱动改进

如果说运行时自进化是"Agent 改自己",Evolver则是"研发侧的进化流水线":它作为一个独立工具,把 Raven 当库调用,自动执行"诊断失败轨迹 → 设计候选补丁 → 低成本初筛 → K=3 次复测确认 → 三道验证闸门"的漏斗,只有稳定跑赢基线的改动才会被保留为真实的 git 提交。这套流程的方法论写在 docs/specs/self-evolution-loop-sop.md,实现见 evolver/README.md。

4. EverOS 记忆 + SkillForge 技能库

  • EverOS Memory:本地优先、Markdown 原生的长期记忆运行时,跨会话召回相关记忆与可复用技能;
  • SkillForge:从本地技能库与 SkillHub 目录(11 万+ 技能)中按需检索技能,让 Agent "即需即学"。下图就是技能检索 Demo 的一个输出示例(一只水彩狐狸插画):

22项基准成绩:四大领域实测表现怎么读

Raven 的四个内置 Agent 在各自领域宣称达到业界领先(SOTA)水平。以下是 README.md 中披露的代表性基准成绩,覆盖编排、研究、编码、设计、值守五大方向:

领域基准测试关键成绩
多Agent编排Multi-Agent Orchestration BenchmarkNode F1、Edge F1、偏序准确率、精确匹配率四项指标领先
深度研究DeepResearch Mixed准确率领先,同时输入/输出 Token 与成本更低
编码SWE-bench Pro、SWE-bench Verified、SWE-Refactor、WorkBuddy-Code多项编程基准综合表现领先
数据分析DataAgentBench(2026-08-24 Live)Raven-Code 搭配 Opus-5 取得0.8762 Pass@1,排名第一
幻灯片生成PresentBenchRaven-Design 排名第一
视觉设计ArtifactsBench(Dashboard/SVG)、GDPVal与 Claude Code、Hermes 对比领先
AI4AI 自进化Nanochat 50M 预训练BPB 质量、Token 数与成本全面优于 Claude Code
AI4S 科研AI4S 内部基准成功率与成本均显著占优
通用能力AppWorld、PinchBench、Proactivity 等评测脚手架见 benchmarks/README.md

值得一提的是 Raven-Design 的"方法论沉淀":它把设计规则整理成可检索的先例文档,Agent 产出前先对照规则索引,避免"AI 味"模板化设计:

新手上手:Raven多智能体生态的3步体验

第 1 步:一行脚本安装。Linux / macOS / WSL2 或 Windows PowerShell 均有官方一键安装脚本(见 README.md 的 Quick Start 章节);如果只装了 Git 和 Docker,也可以直接克隆仓库后用 Docker Compose 跑起来,仓库地址:

git clone https://gitcode.com/gh_mirrors/raven35/Raven

容器方式的说明在 docker/README.md。

第 2 步:打开 WebUI。运行raven web即可在浏览器里获得统一工作台:聊天、跟踪任务进度、查看文件与产出、浏览记忆和技能,全部在一个界面完成。

第 3 步:下第一个多 Agent 任务。直接用自然语言描述目标(例如"调研某主题并做成 PPT"),Raven 会自动生成 DAG、委派 Agent 并整合结果。内置 Agent 的注册机制见 agents/README.md,开发者进阶流程见 docs/dev.md。

⚠️ Raven 目前处于 pre-alpha 阶段,接口与配置可能快速变化,体验前建议留意官方文档的更新说明。

写在最后

Raven 的下一代愿景可以浓缩为一句话:让"框架"本身成为可进化的资产——Agent 在运行中调整策略,Evolver 在离线时基于 22 项基准持续打磨 harness,EverOS 记忆与 SkillForge 让经验跨会话复利。对于想体验多智能体协作、又希望系统"越用越强"的用户来说,这套架构值得放进你的观察清单。

【免费下载链接】RavenThe Harness of Harnesses: a trusted, persistent, self-evolving multi-agent ecosystem for all-domain collaboration.项目地址: https://gitcode.com/gh_mirrors/raven35/Raven

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询