分享
7.20—7.26|本周Top 10 AI 论文
输入“/”快速插入内容
🥇
7.20—7.26|本周Top 10 AI 论文
用户4242
用户4242
7月27日修改
作者:DAIR.AI(
@dair_ai
)
原帖链接
本周值得关注的 AI 论文,覆盖智能体运行框架、记忆与技能、长程任务、模型可解释性、评测、结构化输出和机器人等方向。
1. Harness Handbook
如今,团队开始让智能体自行演化自己的运行框架(harness)。但框架一旦长成庞大的代码库,要找到“某个行为究竟由哪些文件决定”,往往比真正动手修改更难。Harness Handbook 想解决的正是这个问题:把运行框架变成一张以行为为中心、并且始终能追溯到源码的地图。
•
自动生成,而非人工维护。
它通过静态分析和 LLM 辅助的结构化处理,从运行框架代码库中生成 Handbook。框架代码一有变化,地图就可以重新生成。
•
从全局到源码的三级地图。
L1 展示架构、执行模型和数据流;L2 描述各组件的职责、输入、输出与状态;L3 则落到有源码依据的单元细节。配合导航面板,用户可以跨阶段追踪一条行为链路。
•
行为引导的渐进式披露(BGPD)。
智能体先从高层行为出发,逐步定位相关实现,再根据当前源码验证候选位置。这样修改能落到真正正确的文件,而不是“看起来像对”的地方。
•
为什么值得关注。
当运行框架开始自我改进,瓶颈会从“怎么写改动”转成“改动应该写在哪里”。一份可读、可导航、可编辑的表示形式,能让开发者和智能体共享同一张地图,更稳妥地演化生产系统。
论文
·
相关帖文
2. From Memory to Skills
许多智能体记忆系统只是把过去的执行轨迹作为被动上下文取回来。那些来之不易的经验并不会自动变成智能体可以直接调用的能力。MSCE 是一个无需训练的“记忆与技能协同演化”框架,专门处理长程 LLM 智能体如何把经验沉淀为可执行技能。
•
受治理的三级记忆。
L1 保存贴近执行过程的步骤轨迹,L2 形成可复用的程序性策略,L3 则记录对环境的陈述性认知。智能体面对的不再是一份扁平日志,而是一套有层次的经验库。
•
带证据的技能。
预期收益为正的 L2 策略,会固化成可调用的技能卡。技能卡保留证据链接、适用边界、决策指引、验证规则和可靠性估计,让智能体知道何时可以信任这项技能。
•
用反思回填经验价值。
框架会把稀疏的最终反馈,经由更密集的局部自我反思向前传播,得到与证据相匹配的轨迹价值,再据此决定记忆和技能如何演化、何时退役。
•
为什么值得关注。
在 EvoAgentBench 和 LoCoMo 上,MSCE 超过了当前最强的技能增强型和记忆驱动型基线,并表现出较好的跨领域迁移能力。它指向一种更有积累感的智能体:经验不会在每次会话结束后重新归零。
论文
·
相关帖文
3. PRO-LONG