判断两个Agent谁更强,方法很原始:让它们反复对局,直到技术差距大到能压过运气。问题是每打一局都在烧钱。清华大学最新研究把这个成本砍掉了98.7%。

赌局和算力账单

评估Agent强不强,本质是一个统计问题。每局结果都有随机性,你必须打够局数才能确认差距真实存在。打少了,可能只是运气好;打够了,钱又花超了。

成本有多真实?论文引用了PokerSkill框架的数据,在完整扑克对局中部署LLM Agent推理,每局花费0.07到0.30美元。人类对局更贵——Libratus与职业选手打了12万局、历时20天,奖金池20万美元,最终以99.98%的置信度赢下比赛,优势为每局147毫大盲(来源:Brown & Sandholm, Science, 2018)。

关键在于,这12万局的对局数量是事先固定好的。哪怕第2万局结果已经板上钉钉,剩下的10万局照样要打完、付完钱。固定预算评估要么在结果已经确定后还在继续花钱,要么在能区分出差距之前就停手。

那能不能边打边看,证据够了就收手?统计学会拦住你。普通置信区间不允许"偷看"——如果你在每次对局后都检查一下是否显著,然后在第一次看到结果有利时就停手,95%置信区间的实际假阳性率会飙到61.35%。论文的模拟实验直接验证了这一点:2000次零效应模拟中,偷看式停手有1227次(61.35%)错误地声称发现了差异(来源:arXiv:2608.06362,清华大学,2026年8月7日)。

AV-AIVAT三项核心指标

图注:方差降低54.4倍、停局减少74.17倍、偷看假阳性率61.35%三项核心数据

AIVAT:给扑克结果降噪

解决方案的第一块拼图叫AIVAT(Action-Informed Value Assessment Tool),一种方差缩减技术。它的原理是:已知每个决策点的期望价值,就能算出每局结果中有多少是纯运气、多少是技术差异,然后用条件均值为零的修正把运气部分抵消掉。

这不是新东西。Libratus的评估就用了AIVAT,把标准差降低了85%,从而减少了44倍所需对局数(来源:LessWrong对Libratus评估的解读,引用Bowling et al. 2015原始论文)。Pluribus的多玩家扑克评估也用了同样的技术(来源:Brown & Sandholm, Science, 2019)。

AV-AIVAT论文在这个基础上把实验做得更彻底。在15个LLM Agent配置、71,439局单挑无限制德州扑克(HUNL)的评测语料上,AIVAT的方差降低中位数达到54.4倍,范围从24.2到86.0倍(来源:arXiv:2608.06362)。

15个HUNL评估的逐配置方差比

图注:15个Agent配置的方差比和停局比,蓝点为各配置实测值,虚线为中位数

置信序列:合法地提前收手

AIVAT只降噪,不告诉你什么时候停。论文的第二块拼图是置信序列(Confidence Sequences),一种在连续监测下仍能保持名义置信水平的统计工具。

把AIVAT和置信序列结合后,效果惊人。在±1大盲的目标精度下,原始结果需要的手局数是AIVAT修正后结果的中位数74.17倍,范围54.53到97.62倍。换句话说,达到同样的判断精度,所需对局数砍掉了98.7%。

在更严格的±0.5大盲目标下,15个原始评估全部在可用手局范围内被截断(打完了还没分出胜负),而AIVAT修正后的中位数仅需56.5局就能停止(来源:arXiv:2608.06362)。

按每局0.07到0.30美元的推理成本算,74倍缩减意味着一个预算问题变成了一次日常开销。原来需要花7万美元才能确定的结论,现在不到1000美元就能解决。

不是无限提速,有地板价

74倍是渐进筛查的中位数,不是保证值。论文很诚实地划了一条线:精确有限样本认证用的是Empirical-Bernstein置信序列,它有一个由赌注上限和有界性条件决定的地板价(width floor),实际停局比中位数只有1.365倍。

这意味着方差缩减能转换为更早停局的前提是,修正后收益的有界性条件要足够紧。在Leduc扑克的精确全树实验中,这个条件可以结构性地满足;但在真实HUNL中,精确认证仍是开放问题。

论文把两种置信序列分工明确:AsympCS做渐进筛查,快速但只有渐近保证;EB-CS做精确认证,严格但更保守。一个用来实际决策,一个用来出具审计证明,互不混淆。

连续监测假阳性率对比

图注:固定样本CI偷看式停手假阳性率61.35%,置信序列监测将其降至0%(EB-CS)

源势AI怎么看

我们做Agent落地,最头疼的不是跑起来,是评估。一个客服Agent上线后到底比之前好还是差,一个金融研判Agent的准确率波动是运气还是真改进,这些问题在企业场景里天天遇到。

AV-AIVAT给了一个启发:评估不该是固定预算赌一次,而该是持续监测、证据够了就停。论文的可复现协议尤其打动我们——修正后的结果前缀加上停局元数据,第三方无需重跑就能验证结论。这在需要向客户交付评估报告的商业场景中,价值不亚于省下的74倍成本。

扑克只是测试场。背后那套"降噪+合法提前停止+可审计"的评估框架,对任何需要反复实验才能得出结论的Agent场景都适用。评估成本降下来,迭代速度才能提上去。