用 63.4% 修复率锁定自动化代码修复:AgentScope 多智能体协作完整实战
【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope
AgentScope 是一个面向生产的多智能体框架,解决的核心问题是让 agent 的过程看得见、结果信得过。在 SWE-Bench 基准上,它的两阶段协作方案把代码修复率做到了 63.4%。这篇文章带你拆一次完整任务的执行链路,看两个核心模块的关键代码,再用三条命令跑通第一个 demo。
设计思路:两阶段架构为什么这样做 💡
分工逻辑:修复代码和验收代码是两种心智,塞给同一个 agent 容易自我说服。拆成 executor 与 verifier 两个角色后,各自只对自己那一环负责。
通信机制:agent 之间不直接互相调用,而是靠一条事件流传递状态。所有动作变成事件广播出去,任何一环挂掉都不拖垮整条链路。
质量兜底:验收不能靠口头确认,必须落到文件与命令。verifier 与 executor 共享同一 workspace,看到的是磁盘上的真实产物,不是自述。
执行流程:一次自动化代码修复的完整链路 ↓
- 目标下达:你把问题描述交给 pipeline,系统生成标准化目标。产出:一份双方都认的 goal。
↓
- 执行修复:executor 在隔离 workspace 里读代码、改文件、跑命令。产出:一份结构化的执行报告。
↓
- 独立验证:verifier 拿着报告到同一 workspace 实地复查。产出:pass / fail / impossible 的三态判定。
↓
- 反馈迭代:fail 的 message 原文回传给 executor,指明具体文件与位置。产出:下一轮的修正指令。
↓
- 终止结算:pass 即成功,达到 max_iters 上限即止损。产出:最终结果与判定依据。
核心模块拆解:两阶段架构的落地代码 🔧
GoalPipeline:它负责的 执行与验证闭环
GoalPipeline 把任务交给一个执行者和一个验证者,循环跑直到目标达成。executor 产出结构化执行报告,verifier 给出三态判定。fail 时反馈回传,最多跑 max_iters 轮。
pipe = GoalPipeline( executor=executor, # 负责写代码 verifier=verifier, # 负责验收 max_iters=10, ) async for event in pipe.reply_stream(goal_msg): handle(event)这个设计的巧妙之处在于:verifier 就是一个普通 Agent,验收标准全在 prompt 里,换标准不用改任何框架代码。
PermissionEngine:它负责的 工具调用安全边界
PermissionEngine 在每次工具调用前做一次权限裁决,规则分 allow / deny / ask 三种行为。模式从只读探索到完全放行共五档,按命令前缀或文件 glob 匹配。命中安全规则的询问,连 BYPASS 模式都绕不过去。
engine = PermissionEngine( PermissionContext(mode=PermissionMode.DEFAULT), ) engine.add_rule(PermissionRule( tool_name="Bash", rule_content="git:*", behavior=PermissionBehavior.ALLOW, )) decision = await engine.check_permission(tool, tool_input)这个设计的巧妙之处在于:安全边界直接写在代码里,随代码一起 review、随版本一起回溯。
数据说话:SWE-Bench 修复率实测 📊
| 指标 | 基线方案(单智能体) | AgentScope 多智能体 | 变化幅度 |
|---|---|---|---|
| SWE-Bench 修复率 | 42.1% | 63.4% | +21.3% |
| 平均修复时间 | 8.7 分钟 | 5.2 分钟 | -40.2% |
| 回归问题率 | 15.3% | 6.8% | -55.6% |
专业化分工:executor 只写、verifier 只查,验收只认磁盘上的真实文件。判定不听一面之词,回归率因此从 15.3% 压到 6.8%。
结构化判定:pass / fail 走 schema 校验,模型输出跑偏会被强制重试。判定稳定了,整个流程的方差才压得下来。
预算有上限:max_iters 给循环装了天花板,最坏情况的耗时与 token 成本可以提前预估。
快速上手:三步跑通第一个多智能体 demo 🚀
git clone https://gitcode.com/GitHub_Trending/ag/agentscope cd agentscope && uv pip install -e . export DASHSCOPE_API_KEY=sk-... python examples/pipeline/goal/goal_pipeline.py跑通后你应该看到:终端里两个 agent 轮流输出,executor 改完一轮、verifier 验收一轮,直到给出 pass 判定。
调优与常见坑 ⚠️
验证者放水:verifier 轻易给 pass → 让它与 executor 共享 workspace,只认磁盘产物
确认弹窗打断自动化:每个工具调用都要点确认 → 加 allow 规则,或切 BYPASS 模式
迭代不收敛:executor 反复改错烧 token → 调小 max_iters,把 fail 的 message 原文回传
长任务上下文爆掉:多轮后报 context 超限 → 启用框架自带的上下文压缩与工具结果卸载中间件
查看功能演进:docs/NEWS.md
双智能体验证示例:examples/pipeline/goal/goal_pipeline.py
完整 Agent 服务:examples/agent_service/main.py
63.4% 的修复率背后,是执行验收分离、判定结构化、预算有上限这三件小事。如果你要搭可审计、可中断、可回滚的多智能体系统,AgentScope 值得放进你的技术选型清单。clone 下来跑通第一个 demo,只需要 5 分钟。
【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考