AI 写代码的速度至少是人的 10 倍。90% 的代码由 AI 产出之后,理论上效率提升应该是数倍甚至一个数量级。10 倍和 1.6 倍之间消失的那部分,才是 AI Coding 落地的真实成本区。
一、一个刺眼的数字:10 倍生成速度,1.6 倍交付效率
某头部互联网大厂披露的一组数据:过去一年,其 AI 代码贡献率增长超 6 倍,AI Coding 的 tokens 消耗增长 5 倍,AI 代码合入率增长超 2 倍。单看任何一项,都足以写进年度喜报。
但另一组数据,才是真正值得行业停下来思考的:
其内部最激进的 AI Coding 团队(本身就是做 AI Coding 工具的团队),过去半年超过 90% 的代码由 AI 生成,而人均需求吞吐率只提升了 60%,即 1.6 倍。
AI 写代码的速度至少是人的 10 倍。90% 的代码由 AI 产出之后,理论上效率提升应该是数倍甚至一个数量级。10 倍和 1.6 倍之间消失的那部分,才是 AI Coding 落地的真实成本区。
这直接引出第一个判断:AI 代码贡献率是一个容易失真的虚荣指标。当团队把它定为 KPI 并围绕它优化时,优化动作会滑向"多用 AI、多生成代码",而不是"全局交付效率是否真的提升"。数字快速上涨时,人很容易自我感觉良好,但代码生成量的膨胀与交付效率之间,从来不是线性关系。
二、900 次实验:正确率及格了,工程交付全军覆没
为了量化 Vibe Coding 的真实水位,该团队做了一个在公开分享中相当罕见的实验:
选取 3 个主流 Coding 模型 × 3 个主流 Agent 框架,两两组合成 9 组,针对一个中等复杂度的真实业务需求(C 端产品的创作页视频预览与调整功能),用相同 Prompt 各跑 100 次,共 900 次。
结果分两层看:
功能满足度层面,9 组组合正确率全部超过 80%。如果评测到此为止,结论是"Vibe Coding 已经可用"。
可交付性层面,画风急转直下。UI/交互易用、可靠性、可维护性、兼容性、性能效率五个工程维度,得分普遍跌到 40~60 分的不及格区间,且表现出极强的随机性:异常处理不规范、不复用仓库已有组件、改动击穿历史功能、实现方式偏离团队工程规范。
这个实验的价值在于,它用数据说清了一个行业心照不宣的事实:"功能跑通"和"达到上线标准"之间,隔着一整套软件工程。企业需要的不是能跑的 Demo,而是长期稳定、可维护、可演进的系统。Vibe Coding 让你感觉快了,但感觉快不等于真的快,补坑的时间,往往被忽略在体感之外。
三、Harness:可交付性的最后一公里
这是最值得关注的部分,也是与当前行业讨论最错位的地方。
2026 年谈 Harness,多数人的注意力还在 Agent 框架和工具调用能力上。但一线实践指向另一个结论:真正决定 AI 能不能落地的,是更基础、更工程化的"基建"问题。这套基建可以拆成三件事:搭环境、说意图、建闭环:
- 上下文工程(Agent 怎么知道该做什么):L0–L4 五层渐进式披露的文档体系(路由/架构/模块/参考文档/操作手册/Skill),加上 ExecPlan 执行计划,设计文档、施工蓝图、进度日志、决策记录,边干边更新的活文档。
- 架构约束(Agent 怎么不出错):确定性 Hook + 测试分层防御(L0 文件卫生 → L1 语言质量 → L2 AI 专属防御),覆盖率门禁与录制回放;DDD 分层、IDL 驱动、前端边界,本地可运行 + 秒级反馈。
- 垃圾回收(Harness 怎么不腐化):技术债扫描与文档新鲜度巡检,机械 + 语义双维度定期自动修复;Push 前自动检查、完成即归档、周期性清理。
把这套基建接入之前的实验后,同一批模型 + 框架组合的结果发生了质变:正确率从 80% 提升到接近 90%,而可交付性从 40~60 分的不及格线,整体跃升到 80 分的可交付区。
注意这个对比的含义:模型没变,框架没变,Prompt 没变,唯一改变的是 Harness 基建。更严格的约束,换来更多的自治能力,最终换来更高的可交付性。这条因果链,是对"换更强的模型就能解决问题"这种线性思维的直接反驳。
四、当人人都是程序员:协作关系的重构
AI 把代码生产能力普及给了所有人,协作问题随之而来。
一个真实案例:一位产品同学用 Vibe Coding 自己做出了需求,页面能看、流程能跑,然后不解,为什么研发还要排期几天?为什么不能直接给我仓库权限自己上线?
研发的评审结果是:能跑,但性能不达标、扩展性没考虑、存在权限安全问题。
这个案例的两面都要承认:一面,非工程角色把想法直接变成可交互的原型,沟通更直接、验证更快,这是真实的价值,不能一刀切地禁止;另一面,代码生成门槛的下降,不等于系统复杂度的下降。真实业务系统里,代码要嵌入既有架构、与存量模块协同、通过安全与性能的考验。
所以出路不是"谁写谁上线",也不是"非工程师的代码一概不用",而是建立统一的架构、规范和交付流程,让更多角色的产出汇入同一条工程河道,这正是治理(Governance)要解决的问题。
五、三条落地路径
围绕指标、治理、协作三个命题,一线团队的实践沉淀出三个方向:
- 原型驱动开发,替代文档驱动开发。 过去 PRD → 设计稿 → 技术方案 → 代码的链式流程,问题在文档阶段读起来都合理,做出来分歧才暴露。AI 把产品原型的制作成本打到极低,静态文档变成动态的、可交互的、与真实场景高度拟合的东西,所有人围着原型讨论和体验。连设计环节都在被重估,过去前端同学要花 60% 时间做视觉还原,未来设计师可以直接产出带代码的高保真原型。
- 系统化 AI Development:让 AI 进入全流程,而不是只写代码。 实践中常见的断层是:Coding 环节用 AI,其余环节还是传统流程、人工介入。解法是让 AI 基于 Context 编写 Spec,功能实现后通过 Browser Use 能力自动打开浏览器验证正确性、自动 Bugfix,确认无误后自动提交并发布上线。齿轮要嵌合,AI 必须钻进研发流程的每一道齿缝。
- 组织化建设:从个体超能力到团队基础设施。 早期 AI Coding 的红利集中在少数会写 Prompt、懂上下文管理、会拆任务、会验证结果的高水平个体身上。组织要做的是把这些个体实践沉淀为标准、工具和技能,最好的方式是产品化,把能力沉淀进工具里开放给全员共创。该大厂的 AI Coding 工具过去一年日均 Token 消耗达 5.6 万亿,同比增长 50 倍;用户结构也在泛化,越来越多非技术背景用户用它完成日常工作,泛办公场景的企业版能力也随之推出。
六、结语:瓶颈已经转移
这场实践复盘最值得记住的,是一个行业级的信号:
AI Coding 的瓶颈,已经从"模型能不能生成代码",转移到"工程体系能不能接住生成的代码"。
代码贡献率、采纳率、生成量,这些第一代指标正在失效;正确率之外的可交付性五维:易用、可靠、可维护、兼容、性能,才是第二代度量体系的起点;而支撑这一切的 Harness 基建:上下文工程、架构约束、垃圾回收,正在成为企业 AI Coding 的分水岭。
模型能力会继续趋同,框架会不断换代,但工程基建的厚度,决定了 AI 生产力兑现的成色。对所有正在落地 AI Coding 的团队来说,真正的命题不是"用不用 AI",而是:你的 Harness,准备好了吗?