☰
AI 工程闭环的自动化趋势与质量把控边界
2026/10/7 21:22:15 网站建设 项目流程

本文字数:2811;估计阅读时间:8分钟

作者:Lotte Verheyden

编者按:本文译自 Langfuse 原博客。 原文围绕「探讨 AI 工程闭环中自动化与人工干预的平衡点」展开。技术上实现无人值守的 AI 工程闭环已无障碍,但盲目追求全盘自动化易导致质量失控。开发者应在关键环节保留人工审阅,以确保系统的真实表现符合预期。

如今,全自动化的 AI 工程闭环在技术上已成为可能。但这并不意味着我们应该完全放手。关于哪些任务该交给 Agent,哪些该由人类把控,以下是我们的见解。

AI Agent 几乎能独立完成 AI 工程闭环中的每一个环节。工具链已经成熟,上下文也已齐备,实现无人值守的闭环并非难事。

这也是行业目前的发展方向,通常被称为“持续学习”(continual learning):

这种方向大体没错,但若将闭环全盘托出则是误区。一旦自动化程度超过了你对质量的把控底线,最终产出的只会是一堆Agent 废料(agent slop)。

什么是 AI 工程闭环?

结合行业现状与用户反馈,我们将持续优化 AI Agent 的过程提炼为“AI 工程闭环”。我们在 academy 中对此有详细介绍。

闭环中的一部分在线上实时运行。Trace(追踪数据)从生产环境持续流入,监控系统则负责发现值得深挖的异常。亲自审阅 Trace 也是监控中不可或缺的一环,它能让你直观感知系统的真实脉搏,是整个流程中价值极高的步骤。

其余环节则发生在开发阶段(即发布变更前)。你需要构建一个贴近真实生产场景的数据集,以便系统性地测试变更并不断调优。如果某项变更表现更优,就将其部署上线。这是一个循环往复的过程。

你可以将这一切自动化

梳理上述步骤可以发现,从技术角度看,没有任何环节必须依赖人工。现在,Agent 已经能完全自主地完成应用插桩(instrumenting)。至于其他步骤,各大平台通常也提供了 API 或 CLI 供 Agent 直接调用。

任务

是否已有自动化工具

查看 Trace,发现所有异常并打标签

✅

基于生产环境报错和合成用例构建数据集

✅

运行实验并得出新思路,根据评估结果不断优化

✅

测试新发布的模型,并提交包含适配 Agent 的 PR

✅

...

...

既然每一步都能自动化,理论上循环就能自行运转。然而,技术可行性并不等同于工程合理性。将人类完全排除在闭环之外是有代价的,这个代价就是:agent slop(智能体废料)。

这会制造出 agent slop

Agent slop:由其他 AI 智能体批量生产的低质量 AI 智能体。通常是智能体基于不完美的评估标准和数据集进行盲目优化所致。

你一定希望 Agent 的行为符合你的标准,并能体现你在意的细节。这些细节存在于你的直觉中,且会随着你认知的提升而演进。如果将整个循环完全自动化,Agent 就会朝着一个不完整的目标进行优化,其行为也会随着时间推移而逐渐掉队。

这会导致 Agent 的表现虽在指标上“达标”,但在实际感官上却差强人意。用户理应获得更优质的体验,而守住质量底线正是开发者的责任。

哪些需要自动化,哪些需要人工介入

我们预见在未来,这个循环的大部分环节能够自行运转。但你必须谨慎选择哪些部分可以交给 Agent 负责,并在那些“判断力即产品”的环节中保持人工参与。

把握好这个平衡,产品质量就会提升,因为你将有精力去专注那些原本无暇顾及的高杠杆工作。但如果过度追求自动化,就会面临产生agent slop的风险。

坚持人工查看 traces

AI 应用的行为往往难以预料。如果只关注 Agent 或评估器自动标记的 Trace,你看到的只是预设好的局部。为了捕捉那些意料之外的瑕疵,必须定期抽样并亲自研读 Trace。这是你建立直觉、形成判断标准的过程。

在形成判断的同时,你会在这些 Trace 上留下反馈,供 Agent 后续学习。这些修正操作会将 Agent 重新引向你认为正确的方向。

此外,隐式用户信号(implicit user signals)也至关重要。虽然处理过程是自动的,但信号源头依然是真实的人类。这是挖掘那些未被规则覆盖、却极具研究价值的 Trace 的绝佳途径。

将剩余环节自动化

其他所有工作都可以交给 Agent 处理,前提是它具备足够的上下文来胜任这些工作。

应用该实现什么功能、什么样的回答算优秀、哪些行为不可接受:这些都只能由你来教给 Agent。这种上下文需要通过具体的形式传达:比如审阅 Trace 时留下的反馈,以及设定的评估维度。在此基础上,你就能和 Agent 共同构建数据集和评估器。

步骤

人工

自动化

理想平衡

Trace

-

一次性配置;trace 自动流入。

自动化。

监控

逐条手动查看 trace。结论深刻,但难以持续。

Agent 标记已知规则和明显错误;质量很容易触及天花板。

自动化,但保持对 trace 的抽样,以捕捉预期之外的行为。

构建数据集

手动挑选所有样本。具备代表性,但维护效率低。

Agent 根据自身标签构建数据集;其质量上限取决于你的监控程度。

通过监控反馈保持数据集的多样性与代表性。

实验

手动测试各个变体。细致但覆盖范围有限。

Agent 生成并运行变体,从而提升指标。

默认自动化;视情况人工介入。

评估

手动为运行结果打分并构建评估器。准确但繁琐。

评估器自动更新;明显错误修复后,质量便不再提升。

抽样审查,让 Agent 根据你的反馈校准标准。

随着应用逐渐成熟,这类上下文会越来越多地涉及一些主观的细节判断,而这些只有你能敏锐捕捉。这一切都建立在你亲自查看 Trace 的基础上;你提供的上下文越清晰,就能将循环中越多的环节安全地交托出去。

你的品味即优势

循环中的机械性重复正逐渐被 Agent 接管,这其实是件好事:它能让你从琐事中抽身,专注于打磨 Agent 的独特性。当基础劳动力趋于同质化时,真正让你的 Agent 脱颖而出的,将是你对“优秀”的审美力,以及在调优过程中倾注的匠心。

关于我们

ClickHouse(clickhouse.com) 是面向 AI 时代打造的高性能实时分析数据库,能够以极致性能处理海量数据分析任务。凭借高并发、低延迟和云原生架构,ClickHouse 广泛应用于可观测性、数据仓库、实时分析及 AI 数据基础设施等场景。我们致力于帮助企业在公有云平台上构建安全、弹性且高性价比的实时分析与 AI 数据平台,加速释放数据价值,推动智能化创新与数字化转型。目前,Trip.com、DiDi、Meta、Sony、Netflix、Deutsche Bank、Sierra、Cloudflare 等全球领先企业均在使用 ClickHouse 支撑其关键业务和数据分析平台。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询