香港浸会大学、中科大、港科大团队的一篇新论文 EvolveNet(arXiv:2608.04968)做了个反直觉的实验:模型权重完全冻结,只改模型外围的"Harness",Agent 在五项任务上的成绩全面提升,最大涨幅 33.4 个百分点。
更有意思的是涨法。没有中央大脑统一学习,多个 Agent 各自在家学,学完只把经验凑到一起。
图注:左为传统顺序进化,右为 EvolveNet 协作进化——共享 harness 广播下发,各客户端本地进化,只回传程序改动。
Harness 是什么
论文里的 Harness,指模型外围那套可执行程序:构建上下文、调用工具、校验中间结果、决定失败后怎么恢复。模型是发动机,Harness 是司机加导航加维修工。
这个方向不算新。提示词优化、DSPy,调的都是模型外围的东西。新的是两件事:调优对象变成完整的可执行程序,学习材料变成真实执行轨迹,包括失败的那些。
同一台发动机,换不同的司机,跑出的成绩完全不一样。harness 进化就是从这里下手:发动机不动,练司机。
数据不出门,经验走天下
传统做法先把各处的执行日志收拢到中心,再让一个优化器统一学习。问题很现实:企业不愿交数据,医院、银行不会把日志传上云。最值得学的经验,恰恰是没法集中管理的经验。
还有一个前提常被忽略:整个进化过程模型权重一个字节都不动。这意味着什么?模型可以锁版本、过审计,所有改动都发生在可读、可 diff、可回滚的程序代码里。对要过合规审查的企业系统,这比"模型自己变聪明了"好交代得多。
EvolveNet 把顺序倒过来:共享 harness 广播到各个客户端,各自在自己的数据上进化,产出"专家程序";回传的不是数据,是程序改动;服务器把改动合并成新的共享 harness,再广播回去。数据全程不出本地,跨过边界的只有经验。
图注:协作进化后,共享 harness 在五项留出任务上全面提升,竞技编程 LiveCodeBench 涨幅最大,达 33.4 个百分点(来源:论文 Table 1)。
数字说话。在 text-to-SQL、数据科学代码、竞技编程、软件工程、Agent 工作流五项任务上,共享 harness 的留出准确率分别提升 13.4、13.0、33.4、20.0、8.3 个百分点,全部通过配对显著性检验。
拆细了看更有意思。DS-1000 按库拆开,Matplotlib 从 76.7% 升到 83.3%,Sklearn 从 45.8% 升到 58.3%(来源:论文 Table 2)。弱项补得多,强项也没丢。
合并不是 averaging
程序不能像模型参数那样求平均。两个客户端各改一行代码,合并结果可能直接跑崩。EvolveNet 的办法是作用域分类加证据引导:一个机制若有多领域证据支持,就提升为全局行为;若只在某领域有效,就留在该领域的条件分支里。
效果用两个数字衡量。DS-1000 上,五个客户端一共新解出 20 道题,合并后的 harness 留住 18 道,保留率 90%。还有两道题,合并 harness 解出来了,但任何一个单独客户端都解不出——组合产生了任何父本都没有的新能力。
一个计划外收获:Pytorch 只出现在验证集和测试集,没有任何客户端拿它训练过。未进化 harness 解对 15 题里的 8 题,合并版解对 10 题。别处学到的东西能在这里用上,说明迁移的是机制,不是答案。
是合并,不是路由
审稿人最容易问的问题,论文自己先问了:这会不会只是保留了 K 个专家、按领域派单?DS-1000 上的对照实验给出了否定答案(来源:论文 Table 3)。
派单制(保留全部客户端程序、按库分发)得分 64.0%;只做全局合并、禁止写领域条件的版本 66.5%;完整的 EvolveNet 68.5%。合并本身贡献了大头,领域条件再加 2 个点。
还有一个更硬的对照:服务器不合并、只保留验证集得分最高的客户端,得分 59.5%。而论文发现,验证集总分最高的客户端,留出成绩反而比合并版差 9 个点。用验证集挑冠军这件事本身就不靠谱,逐项看行为变化才稳。
模型换了也成立。整套流程从 deepseek-v4-flash 换成另一家的推理模型 MiMo-V2.5,定性行为全部复现:该接受的合并接受,有害的合并被闸门拦下回滚,最终合并版 72.7%,高于选最优客户端的 72.0% 和未进化的 62.7%。方法不挑模型。
合并有闸门,失败就回滚
合并可能引入退步。EvolveNet 用一块独立验证切片逐项对比:新解对的题数不少于新解错的题数,新版本才提交;不通过允许修改一次,再不过就回滚到上一版共享 harness。曲线只许走平,不许往下掉。
并行也顺带赚到了。客户端阶段比串行快 1.9 到 5.4 倍(K=2 到 7 的实测),搜索的串行深度被压了下来。
图注:左图为提交后的共享 harness 逐轮上升、不回落;右图为客户端越多,单轮完成越快(来源:论文 Figure 2、Figure 3)。
源势AI 观点
我们看到的是对一条路线的确认。做企业 Agent 落地,真正的差距往往不在模型,而在 Harness:上下文怎么构建、工具怎么编排、结果怎么校验、失败怎么恢复。模型选型可以标准化,这一层必须逐个场景打磨。我们给客户交付智能体,交付物里最厚的部分就是这一层。
EvolveNet 给了这种打磨一个组织形态:每个客户的数据不出门,各自进化出专家 harness,聚合沉淀的是跨客户经验。企业数据合规的现实正是如此:能源、金融客户不会把数据送出来,但经验可以共享。
另一个启示是成本。Agent 进化的成本正在从"训练"转向"运营":不需要动权重,需要执行轨迹、验证切片和一个敢回滚的合并闸门。这套基础设施,比再微调一次模型更值钱。
论文里 K=5 跑完三轮完整进化是 6110 秒,不到两小时。这个成本,已经是一次 CI 流水线的量级。