本文整理自 AICon 上海分享「从「用了 AI」到「AI 原生」——蚂蚁数科企业级 AGI研发体系重塑实战」(演讲者:刘秀婷),通过AI音视频转录总结神器Ai好记进行转录整理,以下为精炼整理后的会议演讲笔记。
组织级AI转型的困境
很多企业的AI转型路径大同小异:给开发者配上AI编程工具,搞几场内部分享,看个人的编码效率提升了多少多少。但一年下来发现,团队整体的交付速度并没有显著变化。
蚂蚁数科经历过同样的困惑。他们发现,大型企业AI转型的真正障碍在于:
| 问题 | 表现 |
|---|---|
| 统一赋能困难 | 不同团队的技术栈、业务领域、人员水平差异大 |
| 提效口径不一 | 各团队说「提效」但衡量标准不统一 |
| 局部到整体的鸿沟 | 单个环节的AI提效无法自动转化为全流程提效 |
这些问题的本质是:把AI当工具用和让AI成为研发体系的核心是两回事。
AGI研发成熟度五级模型
蚂蚁数科提出了一个评估框架——AGI研发成熟度模型,分为L1到L5五个等级:
| 等级 | 名称 | 特征 |
|---|---|---|
| L1 | 工具辅助 | 个人使用AI编程插件,流程不变 |
| L2 | 过程智能化 | AI嵌入部分研发环节(如代码审查、测试生成) |
| L3 | 人机协作 | AI参与需求分析+开发+测试的完整链路 |
| L4 | 团队级AI原生 | 多智能体协同、Loop Engineering、自动闭环 |
| L5 | 组织级AI原生 | 全组织渗透,组织架构随之重塑 |
大多数企业处在L1到L2之间。蚂蚁数科的目标是从L2跨越到L3-L4。
他们还定义了四个度量维度——SIGN:
- S(Scope,领域覆盖):AI在研发全流程中覆盖了哪些环节
- I(Intelligence,智能深度):AI的自主程度和推理能力
- G(Gain,产出增益):AI引入后带来的效率/质量提升
- N(Network,协同网络):AI之间、AI与人之间的协同效率
这套度量体系不只是用来打分的,核心价值在于牵引方向——团队清楚自己当前在哪一级,下一步的目标是什么。
人机协同新范式
蚂蚁数科的核心方法是构建「多智能体协同体系」和「Loop Engineering」。
Loop Engineering的核心
简单说就是把研发流程设计成自动化闭环,让AI Agent在闭环中自主运转,人的角色从「执行者」变成「生产关系的设计者」。
一条典型的Loop路径:
需求输入 → Agent分析需求 → 生成设计 → 编码实现 → 自动测试 → 部署上线 ↑ ↓ └──────── 人机决策点 ────────────┘在关键节点设置人的决策点(授权、确认、异常接管),其余环节由Agent自动执行。
为AI「立守则、明分工」
蚂蚁数科的实践经验中,有一个很关键的认知:AI Agent需要明确的规则和分工,就像团队里的新人一样。
立守则包括:
- 项目规约:编码规范、命名规则、架构约定
- 技能知识库:项目特有的业务逻辑、API文档
- 质量红线:什么级别的决策必须让人介入
明分工包括:
- 什么是Agent可以独立完成的
- 什么是Agent需要交叉验证的
- 什么是必须等人决策的
苏格拉底模式:多模型交叉验证
为了解决AI编码的质量问题,蚂蚁数科引入了「苏格拉底模式」——让多个模型或多个Agent对同一任务的结果进行交叉验证和自我追问。
比如一个Agent生成了代码,另一个Agent扮演审查角色,对前者的输出提出质疑,直到双方达成一致或有明确的争议点留给人来判断。
这种模式的好处是:代码质量不是靠「事后审查」来保证的,而是在生成过程中就通过对抗机制不断优化。
组织架构的同步进化
AI原生不只是技术问题,更是组织问题。蚂蚁数科做了几项关键调整:
岗位融合
打破传统的前后端、测试分离的「墙」。以前一个需求从评审到上线,需要产品→前端→后端→测试→运维的串行流转。AI原生模式下,这些角色融合成一个「交付团队」,Agent在团队内完成跨环节的任务。
FDE(前线交付工程师)
设立了一个新角色——前线交付工程师。让工程师带着AI能力直接面对客户,快速理解需求、快速出原型、快速迭代。缩短反馈回路,从「需求-开发-测试-发布-反馈」的冗长链条变成「即时沟通-即时交付」。
角色的进化方向
| 传统角色 | 传统职责 | AI原生职责 |
|---|---|---|
| 开发者 | 写代码 | 定义问题+调度Agent+验证结果 |
| 测试工程师 | 手动测试+写用例 | 设计测试策略+Agent测试结果仲裁 |
| 架构师 | 设计系统架构 | 设计人机协同架构+Agent工作流 |
质量与工程债务的控制
AI引入最让人担心的就是代码质量下降和工程债务累积。蚂蚁数科通过几个实践来应对:
Harness工程约束:在AI生成代码的外围建立一套规则体系,约束和引导模型输出。包括:
- 编码规范前置
- 生成代码的自动化检查
- 与公司现有代码库的对齐
失败自愈:当Agent发现自己的生成内容有问题时(比如没通过自动化测试),不是等人来修,而是自动分析失败原因,自主尝试修复。
专家经验的Code Review Skill:把资深开发者的代码审查经验和知识总结成规则,融入到Agent的审查流程中。
效果与价值
| 指标 | 传统模式 | AI原生模式 |
|---|---|---|
| 代码产能 | 基线 | 提升3-4倍 |
| 交付周期 | 3周 | 1周甚至日更 |
| 线上问题率 | 基线 | 持平或下降 |
但更重要的价值不在这些数字里——AI原生的核心理念是将AI融入产品本身,创造新的商业价值。当研发团队自身就是AI原生的实践者时,他们对客户输出AI产品的能力也会更强。
核心观点总结
- AI原生不是「买了工具就行」,是研发流程、组织架构、工程范式的系统性重构
- 人机协同的关键不是「AI有多强」,而是「分工有多清晰」
- 人的价值从「生产代码」上移至「设计人机协同系统」和「做关键决策」
- Code is cheap, vision is valuable——真正稀缺的是靠谱的端到端交付能力和对业务愿景的洞察
FAQ
Q:AI原生转型适合所有企业吗?
A:适合有研发团队且希望系统性提升效能的企业。小团队可能不需要这么重的体系,个人用AI编程工具就够了。
Q:多模型交叉验证会不会增加成本?
A:会。需要根据任务的重要性分级——核心功能用多模型验证,边缘任务用单Agent处理。
Q:工程师对AI原生有抵触怎么办?
A:蚂蚁数科的实践表明,关键在于让工程师看到AI不只是替代他们编码的工具,而是能帮他们从低价值工作中解放出来,去做更有创造性的事情。
以上内容由 Ai好记 转录整理。
Ai好记是一款音视频转图文笔记的AI音视频总结助手,支持解析B站、抖音、小红书、小宇宙等平台链接及本地音视频文件,视频转文字后自动生成精华速览、要点总结、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。