<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0" xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd" xmlns:psc="http://podlove.org/simple-chapters" xmlns:podcast="https://podcastindex.org/namespace/1.0"><channel><title><![CDATA[Agili 的 AI 论文速读]]></title><description><![CDATA[每日精选 arxiv AI/ML 论文中文解读]]></description><link>https://hacker-podcast.sydneiholdengi87033.workers.dev/columns/ai-paper-digest</link><generator>Agili 的 AI 论文速读</generator><lastBuildDate>Sat, 08 Aug 2026 16:17:57 GMT</lastBuildDate><atom:link href="https://hacker-podcast.sydneiholdengi87033.workers.dev/columns/ai-paper-digest/rss.xml" rel="self" type="application/rss+xml"/><author><![CDATA[Agili 的 AI 论文速读]]></author><pubDate>Sat, 08 Aug 2026 16:17:57 GMT</pubDate><language><![CDATA[zh-CN]]></language><managingEditor><![CDATA[hacker-podcast@agi.li]]></managingEditor><webMaster><![CDATA[hacker-podcast@agi.li]]></webMaster><ttl>60</ttl><category><![CDATA[technology]]></category><category><![CDATA[news]]></category><itunes:author>Agili 的 AI 论文速读</itunes:author><itunes:summary>每日精选 arxiv AI/ML 论文中文解读</itunes:summary><itunes:owner><itunes:name>Agili 的 AI 论文速读</itunes:name><itunes:email>hacker-podcast@agi.li</itunes:email></itunes:owner><itunes:explicit>false</itunes:explicit><itunes:category text="Technology"/><itunes:category text="News"/><itunes:image href="https://hacker-podcast.sydneiholdengi87033.workers.dev/columns/ai-paper-digest.png"/><item><title><![CDATA[Agili 的 AI Paper Digest 2026-08-07]]></title><description><![CDATA[递归合成终端任务让AI训练成本从几百美元降至5美分，同时任务难度持续攀升。AgentOPSD实现无critic的回合级信用分配，SCOPE教会模型选择性信任外部信息。这三项研究共同推动AI智能体更高效、更可靠的发展。]]></description><link>https://hacker-podcast.sydneiholdengi87033.workers.dev/columns/ai-paper-digest/2026-08-07</link><guid isPermaLink="false">/columns/ai-paper-digest/2026-08-07</guid><dc:creator><![CDATA[Agili 的 AI 论文速读]]></dc:creator><pubDate>Fri, 07 Aug 2026 14:56:53 GMT</pubDate><enclosure url="https://hacker-podcast.sydneiholdengi87033.workers.dev/static/2026/08/07/production/ai-paper-digest-podcast-2026-08-07.mp3?t=1786114613560" length="2732976" type="audio/mpeg"/><content:encoded><![CDATA[
      <div><h1>Agili 的 AI Paper Digest：递归方法提升AI系统可靠性与性能</h1>
<p>今天的研究论文聚焦于如何通过递归方法解决AI系统中的长期任务处理、信用分配和信任决策问题。这些研究展示了递归框架在降低训练成本、提高模型性能和增强系统可靠性方面的潜力。</p>
<h2><a href="https://arxiv.org/abs/2608.05466">递归合成降低长期任务训练成本</a></h2>
<h3>高质量长期任务的挑战</h3>
<p>高质量长期终端代理的训练数据生产成本高昂，每个任务可能花费数百至数千美元。这是因为任务必须保持指令、环境、参考解决方案和验证器之间的相互一致性。人工编写无法规模化，而使用大型语言模型（LLMs）直接生成往往会破坏这些依赖关系。</p>
<h3>递归验证合成框架</h3>
<p>研究人员提出了递归合成终端任务（RST），这是一种递归验证合成框架，用于大规模构建长期终端代理任务。从已验证的种子任务开始，RST扩展参考解决方案，重新对齐验证器和指令到新工作流，在新的沙盒环境中验证结果，并将接受的任务作为后续轮次的种子。</p>
<h3>成本效益与难度递增</h3>
<p>在十五个递归轮次中，RST以每个任务约0.05美元的成本生成了37,484个合成的终端代理任务。任务难度随轮次显著增加：参考解决方案的中位数从67行增长到374行，执行命令的中位数从40个增加到244个，DeepSeek-V4-Pro的pass@4从第一轮的90%下降到第15轮的2.5%。</p>
<h3>实际训练效果</h3>
<p>在合成的任务上收集拒绝采样的Qwen3.5轨迹进行监督微调，使Qwen3.5-27B和Qwen3.5-122B-A10B在三个基准测试上提高了最多10个百分点。智能体PPO将Qwen3.5-27B提升到三个基准测试上的49.44%、32.00%和22.07%，相比基础模型分别有20.0%、41.2%和21.9%的相对提升。</p>
<h2><a href="https://arxiv.org/abs/2608.05987">递归自蒸馏解决强化学习信用分配</a></h2>
<h3>长周期任务中的信用分配问题</h3>
<p>强化学习在可验证奖励的情况下构建轨迹级优势估计，但在长周期、多回合智能体任务中，往往无法为决定结果的少数关键决策提供信用。最近的工作引入了特权自蒸馏进行信用分配，但尚不清楚这些局部信号应如何表示顺序信用。</p>
<h3>AgentOPSD方法</h3>
<p>研究人员提出AgentOPSD，一种无critic、用于智能体强化学习中回合级信用分配的递归方法。该方法将token级的教师-学生对数概率差距聚合为回合级证据，并在对数赔率空间中递归更新贝叶斯信念状态。这产生了一个合理的重加权方案，将稀疏的结果监督转换为回合级信用信号。</p>
<h3>识别关键回合</h3>
<p>通过连续状态之间的边际信念修订，AgentOPSD能够识别关键回合。该方法完全兼容标准策略优化，不需要额外的critic或额外的rollouts。</p>
<h3>实验结果</h3>
<p>在ALFWorld、WebShop和Search-QA上使用两种规模(3B和7B)的Qwen2.5模型评估，AgentOPSD优于GRPO和强自蒸馏基线，使用Qwen2.5-7B在ALFWorld上达到89.1%的成功率。消融研究将增益归因于回合级聚合和历史依赖的递归信念更新。</p>
<h2><a href="https://arxiv.org/abs/2608.06377">选择性信任优化提升模型抗干扰能力</a></h2>
<h3>语言模型的信任困境</h3>
<p>语言模型越来越多地依赖外部信号来生成答案，但一个误导性的信号就可能将正确答案变为错误。传统的抵抗误导信号训练方法存在一个缺陷：完全忽略上下文的模型虽然看似鲁棒，但在上下文值得信任时变得无用。</p>
<h3>重新定义问题</h3>
<p>研究人员将问题重新定义为&quot;选择性信任&quot;问题，并引入了MIST基准数据集，该数据集包含四种匹配条件下的推理项目：干净条件、误导性条件、正确上下文条件和无关上下文条件。同时提出了SC2W指标，用于计算误导信号将正确答案变为错误答案的频率。</p>
<h3>SCOPE方法</h3>
<p>基于对模型脆弱性的观察，研究人员提出了SCOPE方法，该方法挖掘干净正确/误导错误的失败案例，并在所有四种条件下平衡地优化直接偏好优化(DPO)目标，而非仅针对误导性项目进行优化。</p>
<h3>实验效果</h3>
<p>实验表明，SCOPE方法显著降低了SC2W指标，同时在添加的上下文干净、正确或无关时保持了模型准确性。这项研究强调，评估模型应基于其选择性信任能力，而非单纯的抵抗误导能力。</p>
<hr/><p><b>相关链接：</b></p><ul><li><a href="https://arxiv.org/abs/2608.05466" title="Recursive Synthesis for Long-Horizon Terminal Tasks">Recursive Synthesis for Long-Horizon Terminal Tasks</a></li><li><a href="https://arxiv.org/abs/2608.05987" title="AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning">AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning</a></li><li><a href="https://arxiv.org/abs/2608.06377" title="Learning When to Trust via Selective Context Preference Optimization">Learning When to Trust via Selective Context Preference Optimization</a></li></ul></div>
      
    ]]></content:encoded><itunes:summary>递归合成终端任务让AI训练成本从几百美元降至5美分，同时任务难度持续攀升。AgentOPSD实现无critic的回合级信用分配，SCOPE教会模型选择性信任外部信息。这三项研究共同推动AI智能体更高效、更可靠的发展。</itunes:summary><itunes:explicit>false</itunes:explicit></item></channel></rss>