你一定有过这种体验:天天用的AI助手,纠正它多少次,下次还是从零开始。它不记得你的偏好,不记得你教过的流程,也不记得上次犯的错。
"越用越聪明"听起来是卖点,但真是这样吗?普林斯顿大学团队参与的新论文 PAST-Bench,第一次用严格方法测了这件事。它测的学术名字叫"递归自我改进"——AI用自己运行中产生的经验,改进自己未来的表现。这是通向更强AI的关键一步,而个人助手是它最现实的试验场。
结论比想象中有意思:AI确实能越用越好,但"能"和"稳定做到"之间,隔着比多数人想象更大的鸿沟。
测什么:经验能否变成能力
图注:PAST-Bench 把"越用越聪明"拆成四个维度,共26个任务场景、204个回合(来源:PAST-Bench论文,arXiv:2608.04003)
PAST-Bench 的测试对象是"个人AI智能体"——有记忆、有技能、有会话历史、跨会话工作的助手。它把"越用越聪明"拆成四种能力:记住偏好(记忆,占19.2%)、复用流程(程序复用,占30.8%)、查过往信息(信息搜集,占23.1%)、更新旧信息(更新,占26.9%),合计26个任务场景、204个回合。
测法是配对对照:同一组任务流,"记忆开启"跑一遍、"记忆关闭"跑一遍,两次分差才是经验带来的真实增益。7个主流模型、4个智能体框架全部参测。这个设计直指要害:分数高不代表经验有用,可能是模型底子好,也可能是碰巧。
结论一:都受益,但吃法不同
图注:七个模型开启记忆后整体得分全部提升,总增益Δ在+0.13到+0.24之间,但增益分布差异巨大(来源:论文Table 2)
数据显示,开启记忆后七个模型得分全部提升,整体增益Δ在+0.13到+0.24之间。但细看分布,各模型的"长进点"完全不同:GPT-5.4增益最均衡,总Δ +0.24全场最高;Kimi K2.6近一半增益集中在记忆;GLM-5.1则把近半力气花在更新旧信息上。
也就是说,经验不是补药。它能补哪块,取决于模型自己的底子——模型擅长的能力,恰恰是经验最能帮上忙的地方。
换个角度看框架,结论同样重要。固定 MiniMax-M2.7 一个模型,换四个智能体框架跑:nanobot 总增益+0.13,ZeroClaw +0.12,Hermes +0.13,而 Agent-Zero 是−0.08(来源:论文Table 3)。同一个"大脑",换不同的"记忆系统",效果天差地别。模型和运行时框架,各占一半责任。
结论二:同分不同路,记忆也可能帮倒忙
更值得警惕的是隐藏陷阱:同样的分数提升,机制可能完全不同。nanobot 和 Hermes 总增益都是+0.13,但机制证据分一个0.57、一个0.64——前者的提升更像碰巧答对,没有"先保存、再检索使用"的完整链路。
这就像两个考生同分,一个真会,一个背答案。只看分数,你分不清谁可靠。所以 PAST-Bench 要求同时报告"机制证据":增益是否真的走了保存、检索、更新的正道。
还有反面教材:Agent-Zero 开启记忆后总增益为−0.08,四项能力三项退步。记忆不是天然有益——存错信息、检索无关记忆、复用过期流程,都会让助手越用越笨。这对企业用户是实打实的提醒:给助手开记忆,不等于给助手加能力,开不好是减能力。
结论三:病根找到,药方也开了
图注:Hermes+ 在智能体循环中插入五个干预:规划先查记忆、记忆存成可用形式、回答前先检索、纠错后覆盖旧值(来源:论文Figure 3)
研究团队逐条诊断失败轨迹,归纳出五类病根:规划时不看已存信息、信息存成不可用的形式、成功流程没沉淀进技能库、回答前不检索、纠错后不覆盖。对症给 Hermes 打了五个补丁(Hermes+)。
效果明确:"更新旧信息"一项增益从+0.12升到+0.24,机制证据分从0.64升到0.73。单机制消融也验证了药方对症:记忆结构化(E2)把记忆项得分推到0.80,回答前检索门(E4)让信息搜集增益+0.17,纠错覆盖(E5)让更新增益+0.16(来源:论文Table 4)。
但论文也很诚实:整体增益+0.13到+0.15的提升小于运行间波动,不能算稳定收益;换到五个模型上,三个持平或提升,两个略退步。药方有效,但不是万能钥匙。
源势AI观点:企业智能体需要"经验审计"
我们在企业智能体落地中看到的是同一问题。许多企业助手演示惊艳,上线三个月后员工评价却是"越用越不想用"。根因往往不是模型不够聪明,而是经验闭环没建:记忆没人治理、流程没有沉淀、旧信息没有覆盖机制。
源势AI做智能体落地,把"记忆与技能治理"当作交付标准:存什么、怎么存、何时取、何时覆盖,都要有明确规则,可审计、可追溯。具体说,就是三件事:一是给记忆分级,偏好、流程、事实分开存,过期自动失效;二是把成功流程沉淀成可复用的技能,而不是留在聊天记录里;三是建立纠错覆盖机制,用户改过的信息必须替换旧值。
PAST-Bench 的价值,是把这种工程直觉变成了可测量的标尺——以后选助手,别只看它第一次对话的表现,要看它第一百次。
越用越聪明的助手,不是魔法,是工程。而工程,是可以学会、可以交付、可以验收的。