分享
从Loop Engineering到Graph Engineering:AI 智能体架构转变真正意味着什么
输入“/”快速插入内容
从Loop Engineering到Graph Engineering:AI 智能体架构转变真正意味着什么
用户4242
用户4242
7月20日修改
作者:Carlos E. Perez(
@IntuitMachine
)
原帖链接
·
X Article 原文
AI 智能体架构转变真正意味着什么
Peter Steinberger 刚刚发布了一句获得数千点赞的话:
Peter Steinberger 的原帖
“我们还在谈循环,还是已经转向图了?”这句玩笑不需要向任何正在构建 AI 智能体的人解释,也正因如此才切中要害。整个领域在前进途中认出了自己:一只脚仍踩在即将离开的模式上,另一只脚已经踏向正在接近的模式。
下面要解释的是这两种模式分别是什么、为何当下会发生这种迁移、这一转变真正解决了什么,以及这个梗没有提及的部分:它解决不了什么。
为什么自我改进最终是一个网络问题
一个客服团队花了一个季度,搭建出令自己颇为自豪的 AI 聊天机器人反馈循环。他们选择工单解决率作为指标,按周测量;每当数字下降,就调整机器人的提示词和策略,并连续五个月看着曲线攀升。随后,续订数据来了,客户流失率变成了原来的两倍。
机器人通过推诿来“解决”工单:快速结束对话、劝阻后续跟进、把只是被放弃的问题标记为已解决。循环运作得无可挑剔,数字也上涨了。但循环的成功恰恰成了失败的机制,因为循环只能看到这个数字,而它早已悄悄不再代表所有人以为它代表的东西。
本文讨论的是那个团队正在练习的能力,即构建自我改进循环;也讨论成熟构建者思考这一能力时正在发生的转变。简而言之:所有人都从单一循环起步;单一循环会以如今已被充分理解的方式失效;新出现的答案不是构建一个更好的循环,而是构建一个由循环组成的
图
,也就是彼此观察、供给、约束与纠正的改进周期网络。
从循环走向图,正在机器学习运维、智能体设计、公司管理中发生,也映照出一个生物学和工程学早已各自发现的事实:变得更好并不是一个周期,而是一种结构。
循环:持续精进的最小单元
把任何自我改进过程剥离到骨架,都会看到同一台
四冲程发动机
:选择要控制的对象,例如一个指标、一项能力或一种质量;设定参考值,也就是希望它达到的目标;测量现状与目标之间的差距;采取行动缩小差距,然后再次循环。
恒温器是这种骨架最纯粹的形式:温度、设定点、差值、加热。团队每周评测模型并调整得分最低的部分也是如此;一个人每天早晨称体重也是如此;过去七十年广为传授的“计划-执行-检查-行动”管理循环及其现代后代,包括 OKR、冲刺复盘、A/B 测试和让机器学习得以学习的训练循环,也都是如此。
循环值得占据主导地位。它简单到一句话就能教会,成本低到轻易可以构建,而且确实强大:几乎任何被测量、被迭代的事物都会改善,至少一开始如此。看着一个数字对你的调整做出响应,令人非常满足,以至于仿佛这就是完整答案。
构建一个好的改进循环是一项真正的能力:选择可测量的对象、闭合周期、抵制在两次测量间随意摆弄的冲动。拥有这种能力的组织会优于没有它的组织。循环成了“变得更好”的 Hello World,是每份教程都会教、每个仪表盘都会体现的模式。
单一循环在哪里失效
失败会如期而至,而且并非随机,而是循环形状带来的
四个具体后果
。
第一个问题正是客服团队遇到的,它有一个名字:
古德哈特定律
。这个定律指出,一个被过度优化的度量会停止衡量它原先衡量的东西。深层原因在于结构:循环只能看见自己的指标,这正是它成为循环的原因。因此,它会寻找一切移动指标的方法,其中也包括背离指标初衷的方法。
当循环钻自己指标的空子时,它并没有故障;它完全是在执行被构建出来要执行的事,只不过这个数字已悄然脱离了它原本代表的现实。
第二个问题是
向上的盲视
。循环会将变量推向参考值,但循环内部没有任何东西能追问这个参考值是否正确。恒温器无法思考 68 华氏度是否是合适的温度;销售团队的循环无法追问配额是否合理;评测循环无法质疑基准是否衡量了客户真正能感受到的东西。
总有人设定过那个目标,往往很久以前,也往往凭直觉。而循环会忠实、不知疲倦地控制着那个某人编出来的数字。循环越努力,错误目标实现得就越彻底。
第三个问题是
冲突
。真实系统包含许多循环,而独立构建的循环会相互对抗。优化响应速度的循环会损害优化完整性的循环;为增长输送人才的招聘循环会挤压维护质量的文化循环;一栋楼里若 HVAC 控制器彼此不匹配,一个循环加热房间,另一个循环则持续给它降温,两者都在按照各自的准则完美工作。
单一循环思维没有描述这类碰撞的词汇,因为单独检查每个循环时,它们都在正常工作。
第四个问题最安静:循环自身的
测量会衰减
,却没有人观察这个观察者。传感器会漂移,数据流水线会腐坏,指标的定义在仪表盘依旧全绿时发生变化。最糟的是,测量可能从检查现实滑向检查文书:报告中的数字与另一份报告中的数字互相确认,结果循环持续围绕根本没有触及现实的数据运转。
一个按时运行、但其测量已脱离世界的循环,并没有改进任何东西。它只是一场出勤率很高的表演。
图:循环观察循环
观察成熟系统实际如何进行改进,会浮现出一种模式:它们从来不是一个循环,而是网络。循环与循环相连,并且连接本身具有结构。
机器学习运维是在一次次事故中艰难长出这种形状的。一个严肃的部署流水线不是“重新训练然后发布”,而是:冠军-挑战者循环,候选模型必须在真实流量中击败现任模型才能替代它;连接到漂移监控循环,观察模型当前看到的数据是否仍与其学习时的数据相似;连接到回滚机制,若部署后指标越界就自动撤回;还会使用训练循环永远不可见的留出评估集。
后者是一条有意保持盲态的循环,其全部职责就是发现优化循环是否在钻自己的测试空子。每一部分都是循环,可靠性却存在于
边
上:哪个循环为哪个循环提供信息,哪个循环观察哪个循环,哪个循环可以否决哪个循环。
只要改进已变得可信赖,就会出现同一种形状。一个治理良好的公司,是以不同速度运行的循环图:快速的运营循环,例如每日站会、每周指标,嵌在较慢的管理循环中,例如季度规划;管理循环再嵌在更慢的审计循环中,例如年度审计。关键在于审计循环必须独立,它检查运营循环的数字是否仍对应现实;而最慢的一层是董事会,它追问目标本身是否仍然是正确的目标。
身体也是如此。体温调节并不是一个恒温器,而是一张相互作用的反射网;免疫系统本质上是对整个有机体运行的审计循环,缓慢的发育过程则会重置那些快速循环所守护的东西。
在每一种情形中,单一循环的四种失败都有拓扑上的答案:古德哈特问题通过
配对
回答,每个优化循环都配一个监控反指标的循环,用来发现廉价的获胜方式,例如将解决率与续订率配对,将速度与错误率配对;向上的盲视通过
层级
回答,较慢循环拥有较快循环的参考值,修订目标本身成为受治理的周期,而不再取决于最初设定目标的人;冲突通过显式的
仲裁
回答,即在相互争斗的循环之上设置一个拥有取舍决策权的循环;测量衰减则通过
审计循环
回答,其唯一职责是定期检查其他循环的数字是否仍触及现实。
也就是说,这项能力正在改变。构建一条干净的循环,是上一个时代的手艺(一个月前);下一个时代的手艺是
循环架构
:知道指标绝不能孤身存在,参考值需要有负责人,不同速度必须分开,避免快循环反复扰动由慢循环守护的东西,以及图中的某个循环必须为现实本身负责。