《LLM 为什么缓存 K 和 V,却通常不缓存 Q?》KV 缓存让模型保留了一部分已经完成的计算。 但它为什么保留 K 和 V?同样参与 attention 的 Q,为什么通常可以用完就放下?这篇就来讨论这个问题,帮你理解 KV缓存。
◦
《9.7—9.13|本周顶级 AI 论文》Agent 做长任务容易跑偏,读长文漏掉关键证据,多开几个助手又越来越费钱——本周精选的10篇 AI 论文,集中回应了这些实际难题。用程序图帮助 Agent 安排步骤,利用文档目录提高检索准确率,通过并行阅读和精简协作方式提升效率;还有只改设计文档、让 AI 重新生成代码的尝试,以及智能体群体作弊的案例。在做Agent、知识库或 AI 产品的,可以从自己遇到的问题切入,找找下一步值得尝试的方法。