☰
用 63.4% 修复率锁定自动化代码修复:AgentScope 多智能体协作完整实战
2026/10/5 10:06:13 网站建设 项目流程

用 63.4% 修复率锁定自动化代码修复:AgentScope 多智能体协作完整实战

【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope

AgentScope 是一个面向生产的多智能体框架,解决的核心问题是让 agent 的过程看得见、结果信得过。在 SWE-Bench 基准上,它的两阶段协作方案把代码修复率做到了 63.4%。这篇文章带你拆一次完整任务的执行链路,看两个核心模块的关键代码,再用三条命令跑通第一个 demo。

设计思路:两阶段架构为什么这样做 💡

分工逻辑:修复代码和验收代码是两种心智,塞给同一个 agent 容易自我说服。拆成 executor 与 verifier 两个角色后,各自只对自己那一环负责。

通信机制:agent 之间不直接互相调用,而是靠一条事件流传递状态。所有动作变成事件广播出去,任何一环挂掉都不拖垮整条链路。

质量兜底:验收不能靠口头确认,必须落到文件与命令。verifier 与 executor 共享同一 workspace,看到的是磁盘上的真实产物,不是自述。

执行流程:一次自动化代码修复的完整链路 ↓

  1. 目标下达:你把问题描述交给 pipeline,系统生成标准化目标。产出:一份双方都认的 goal。

↓

  1. 执行修复:executor 在隔离 workspace 里读代码、改文件、跑命令。产出:一份结构化的执行报告。

↓

  1. 独立验证:verifier 拿着报告到同一 workspace 实地复查。产出:pass / fail / impossible 的三态判定。

↓

  1. 反馈迭代:fail 的 message 原文回传给 executor,指明具体文件与位置。产出:下一轮的修正指令。

↓

  1. 终止结算:pass 即成功,达到 max_iters 上限即止损。产出:最终结果与判定依据。

核心模块拆解:两阶段架构的落地代码 🔧

GoalPipeline:它负责的 执行与验证闭环

GoalPipeline 把任务交给一个执行者和一个验证者,循环跑直到目标达成。executor 产出结构化执行报告,verifier 给出三态判定。fail 时反馈回传,最多跑 max_iters 轮。

pipe = GoalPipeline( executor=executor, # 负责写代码 verifier=verifier, # 负责验收 max_iters=10, ) async for event in pipe.reply_stream(goal_msg): handle(event)

这个设计的巧妙之处在于:verifier 就是一个普通 Agent,验收标准全在 prompt 里,换标准不用改任何框架代码。

PermissionEngine:它负责的 工具调用安全边界

PermissionEngine 在每次工具调用前做一次权限裁决,规则分 allow / deny / ask 三种行为。模式从只读探索到完全放行共五档,按命令前缀或文件 glob 匹配。命中安全规则的询问,连 BYPASS 模式都绕不过去。

engine = PermissionEngine( PermissionContext(mode=PermissionMode.DEFAULT), ) engine.add_rule(PermissionRule( tool_name="Bash", rule_content="git:*", behavior=PermissionBehavior.ALLOW, )) decision = await engine.check_permission(tool, tool_input)

这个设计的巧妙之处在于:安全边界直接写在代码里,随代码一起 review、随版本一起回溯。

数据说话:SWE-Bench 修复率实测 📊

指标基线方案(单智能体)AgentScope 多智能体变化幅度
SWE-Bench 修复率42.1%63.4%+21.3%
平均修复时间8.7 分钟5.2 分钟-40.2%
回归问题率15.3%6.8%-55.6%

专业化分工:executor 只写、verifier 只查,验收只认磁盘上的真实文件。判定不听一面之词,回归率因此从 15.3% 压到 6.8%。

结构化判定:pass / fail 走 schema 校验,模型输出跑偏会被强制重试。判定稳定了,整个流程的方差才压得下来。

预算有上限:max_iters 给循环装了天花板,最坏情况的耗时与 token 成本可以提前预估。

快速上手:三步跑通第一个多智能体 demo 🚀

git clone https://gitcode.com/GitHub_Trending/ag/agentscope cd agentscope && uv pip install -e . export DASHSCOPE_API_KEY=sk-... python examples/pipeline/goal/goal_pipeline.py

跑通后你应该看到:终端里两个 agent 轮流输出,executor 改完一轮、verifier 验收一轮,直到给出 pass 判定。

调优与常见坑 ⚠️

  • 验证者放水:verifier 轻易给 pass → 让它与 executor 共享 workspace,只认磁盘产物

  • 确认弹窗打断自动化:每个工具调用都要点确认 → 加 allow 规则,或切 BYPASS 模式

  • 迭代不收敛:executor 反复改错烧 token → 调小 max_iters,把 fail 的 message 原文回传

  • 长任务上下文爆掉:多轮后报 context 超限 → 启用框架自带的上下文压缩与工具结果卸载中间件

  • 查看功能演进:docs/NEWS.md

  • 双智能体验证示例:examples/pipeline/goal/goal_pipeline.py

  • 完整 Agent 服务:examples/agent_service/main.py

63.4% 的修复率背后,是执行验收分离、判定结构化、预算有上限这三件小事。如果你要搭可审计、可中断、可回滚的多智能体系统,AgentScope 值得放进你的技术选型清单。clone 下来跑通第一个 demo,只需要 5 分钟。

【免费下载链接】agentscopeBuild and run agents you can see, understand and trust.项目地址: https://gitcode.com/GitHub_Trending/ag/agentscope

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询