Agili 的 AI Paper Digest:递归方法提升AI系统可靠性与性能
今天的研究论文聚焦于如何通过递归方法解决AI系统中的长期任务处理、信用分配和信任决策问题。这些研究展示了递归框架在降低训练成本、提高模型性能和增强系统可靠性方面的潜力。
递归合成降低长期任务训练成本
高质量长期任务的挑战
高质量长期终端代理的训练数据生产成本高昂,每个任务可能花费数百至数千美元。这是因为任务必须保持指令、环境、参考解决方案和验证器之间的相互一致性。人工编写无法规模化,而使用大型语言模型(LLMs)直接生成往往会破坏这些依赖关系。
递归验证合成框架
研究人员提出了递归合成终端任务(RST),这是一种递归验证合成框架,用于大规模构建长期终端代理任务。从已验证的种子任务开始,RST扩展参考解决方案,重新对齐验证器和指令到新工作流,在新的沙盒环境中验证结果,并将接受的任务作为后续轮次的种子。
成本效益与难度递增
在十五个递归轮次中,RST以每个任务约0.05美元的成本生成了37,484个合成的终端代理任务。任务难度随轮次显著增加:参考解决方案的中位数从67行增长到374行,执行命令的中位数从40个增加到244个,DeepSeek-V4-Pro的pass@4从第一轮的90%下降到第15轮的2.5%。
实际训练效果
在合成的任务上收集拒绝采样的Qwen3.5轨迹进行监督微调,使Qwen3.5-27B和Qwen3.5-122B-A10B在三个基准测试上提高了最多10个百分点。智能体PPO将Qwen3.5-27B提升到三个基准测试上的49.44%、32.00%和22.07%,相比基础模型分别有20.0%、41.2%和21.9%的相对提升。
递归自蒸馏解决强化学习信用分配
长周期任务中的信用分配问题
强化学习在可验证奖励的情况下构建轨迹级优势估计,但在长周期、多回合智能体任务中,往往无法为决定结果的少数关键决策提供信用。最近的工作引入了特权自蒸馏进行信用分配,但尚不清楚这些局部信号应如何表示顺序信用。
AgentOPSD方法
研究人员提出AgentOPSD,一种无critic、用于智能体强化学习中回合级信用分配的递归方法。该方法将token级的教师-学生对数概率差距聚合为回合级证据,并在对数赔率空间中递归更新贝叶斯信念状态。这产生了一个合理的重加权方案,将稀疏的结果监督转换为回合级信用信号。
识别关键回合
通过连续状态之间的边际信念修订,AgentOPSD能够识别关键回合。该方法完全兼容标准策略优化,不需要额外的critic或额外的rollouts。
实验结果
在ALFWorld、WebShop和Search-QA上使用两种规模(3B和7B)的Qwen2.5模型评估,AgentOPSD优于GRPO和强自蒸馏基线,使用Qwen2.5-7B在ALFWorld上达到89.1%的成功率。消融研究将增益归因于回合级聚合和历史依赖的递归信念更新。
选择性信任优化提升模型抗干扰能力
语言模型的信任困境
语言模型越来越多地依赖外部信号来生成答案,但一个误导性的信号就可能将正确答案变为错误。传统的抵抗误导信号训练方法存在一个缺陷:完全忽略上下文的模型虽然看似鲁棒,但在上下文值得信任时变得无用。
重新定义问题
研究人员将问题重新定义为"选择性信任"问题,并引入了MIST基准数据集,该数据集包含四种匹配条件下的推理项目:干净条件、误导性条件、正确上下文条件和无关上下文条件。同时提出了SC2W指标,用于计算误导信号将正确答案变为错误答案的频率。
SCOPE方法
基于对模型脆弱性的观察,研究人员提出了SCOPE方法,该方法挖掘干净正确/误导错误的失败案例,并在所有四种条件下平衡地优化直接偏好优化(DPO)目标,而非仅针对误导性项目进行优化。
实验效果
实验表明,SCOPE方法显著降低了SC2W指标,同时在添加的上下文干净、正确或无关时保持了模型准确性。这项研究强调,评估模型应基于其选择性信任能力,而非单纯的抵抗误导能力。
播客全文
女:Hello 大家好,欢迎收听 Agili 的 AI Paper Digest,我是莓莓。
男:大家好,我是阿迪。
女:今天咱们聊几个挺有意思的话题。阿迪,你最近有没有关注到那些训练AI智能体的高质量任务数据怎么来的?
男:当然有。这个问题确实挺关键的。高质量长期终端代理的训练数据生产成本非常高,每个任务可能要花几百到几千美元,因为任务必须保持指令、环境、参考解决方案和验证器之间的相互一致性。人工编写无法规模化,而用大型语言模型直接生成又容易破坏这些依赖关系。
女:听起来就像做一道复杂的菜,每一步都要精确配合,稍微差一点味道就全变了。那有什么好办法解决这个成本问题吗?
男:有的,最近有个研究提出了递归合成终端任务(RST),这是一种递归验证合成框架,专门用来大规模构建长期终端代理任务。他们从已验证的种子任务开始,扩展参考解决方案,重新对齐验证器和指令到新工作流,在新的沙盒环境中验证结果,然后把接受的任务作为后续轮次的种子。
女:这个递归的概念很有意思,就像滚雪球一样,越滚越大?
男:没错。在十五个递归轮次中,他们以每个任务约0.05美元的成本生成了37,484个合成的终端代理任务。最关键的是,任务难度随轮次显著增加:参考解决方案的中位数从67行增长到374行,执行命令的中位数从40个增加到244个,DeepSeek-V4-Pro的pass@4从第一轮的90%下降到第15轮的2.5%。
女:哇,成本从几百几千降到几分钱,同时难度还越来越高,这确实很厉害。那这些合成任务训练出来的模型效果怎么样?
男:效果相当不错。他们在合成的任务上收集了拒绝采样的Qwen3.5轨迹,用于监督微调。在这些轨迹上进行微调后,Qwen3.5-27B和Qwen3.5-122B-A10B在三个基准测试上提高了最多10个百分点。另外,智能体PPO将Qwen3.5-27B提升到三个基准测试上的49.44%、32.00%和22.07%,相比基础模型分别有20.0%、41.2%和21.9%的相对提升。
女:这个提升幅度还是很明显的。而且他们提到经过15轮递归后,过程未见上限,合成产量和验证率保持稳定,同时难度持续攀升,这意味着这个方法可以继续扩展下去。
男:是的,这解决了长期任务数据生成的规模化问题。不过说到训练智能体,另一个关键问题是信用分配,特别是在长周期、多回合任务中。
女:信用分配?这是什么概念?
男:简单说,就是如何确定在一系列决策中,哪些决策对最终结果贡献最大。在强化学习中,传统方法往往无法为决定结果的少数关键决策提供信用。最近的工作引入了特权自蒸馏进行信用分配,提供更密集的监督,但尚不清楚这些局部信号应如何表示顺序信用。
女:听起来就像是团队项目中,要找出哪些关键步骤真正影响了最终成果。
男:没错。针对这个问题,研究人员提出了AgentOPSD,一种无critic、用于智能体强化学习中回合级信用分配的递归方法。它将token级的教师-学生对数概率差距聚合为回合级证据,并在对数赔率空间中递归更新贝叶斯信念状态。
女:这个递归更新听起来很复杂,能简单解释一下吗?
男:可以把它想象成是一个不断调整判断的过程。模型会根据每个token级别的表现,逐步更新对整个回合重要性的判断。这产生了一个合理的重加权方案,将稀疏的结果监督转换为回合级信用信号,并通过连续状态之间的边际信念修订识别关键回合。而且这种方法完全兼容标准策略优化,不需要额外的critic或额外的rollouts。
女:听起来确实很实用。那他们在实验中验证了效果吗?
男:有的。他们在ALFWorld、WebShop和Search-QA上使用两种规模(3B和7B)的Qwen2.5模型评估AgentOPSD。结果显示AgentOPSD优于GRPO和强自蒸馏基线,使用Qwen2.5-7B在ALFWorld上达到89.1%的成功率。消融研究将增益归因于回合级聚合和历史依赖的递归信念更新。
女:这个效果提升还是很明显的。不过说到智能体和外部信息,我突然想到一个问题:现在的语言模型越来越多地依赖外部信号来生成答案,但如果信号是误导性的怎么办?
男:这是个很实际的问题。一个误导性的信号就可能将正确答案变为错误。传统的抵抗误导信号训练方法存在一个缺陷:完全忽略上下文的模型虽然看似鲁棒,但在上下文值得信任时变得无用。
女:这确实是个两难境地,完全不用外部信息会限制模型能力,但用了又可能被误导。
男:没错。研究人员将问题重新定义为"选择性信任"问题,并引入了MIST基准数据集,该数据集包含四种匹配条件下的推理项目:干净条件、误导性条件、正确上下文条件和无关上下文条件。同时提出了SC2W指标,用于计算误导信号将正确答案变为错误答案的频率。
女:这个"选择性信任"的概念很有意思,就像我们日常生活中要学会辨别信息的真伪一样。
男:是的。通过全面的基准研究,他们观察到这种脆弱性在模型中普遍存在。基于这一发现,他们提出了SCOPE方法,该方法挖掘干净正确/误导错误的失败案例,并在所有四种条件下平衡地优化直接偏好优化(DPO)目标,而非仅针对误导性项目进行优化。
女:这样模型就能学会在什么情况下该信任外部信号,什么情况下不该信任了。那实验效果怎么样?
男:实验表明,SCOPE方法显著降低了SC2W指标,同时在添加的上下文干净、正确或无关时保持了模型准确性。这项研究强调,评估模型应基于其选择性信任能力,而非单纯的抵抗误导能力。
女:这确实是个重要的研究方向,毕竟在真实应用中,模型需要能够判断何时应该使用外部信息,何时应该依靠自己的知识。
男:是的,这三篇论文虽然关注不同的问题,但都体现了AI系统在实际应用中的关键挑战:如何高效构建训练数据、如何进行有效的信用分配、以及如何做出合理的信任决策。这些都是让AI系统更加可靠和实用的关键。
女:确实如此。从任务生成到训练方法再到决策机制,这些研究共同推动了AI智能体向更实用、更可靠的方向发展。
男:没错,而且这些方法都强调了递归和迭代的重要性,无论是RST的递归任务生成,AgentOPSD的递归信念更新,还是SCOPE的平衡优化,都体现了这种思路。
女:时间过得真快,今天的分享就到这里吧。希望大家对这三个研究方向有了更深入的了解。
男:感谢大家的收听,我们下期再见。
女:别忘了在泛用型播客客户端订阅我们的节目,获取更多AI前沿研究解读!
