Xingjian Wang
Papers - 2026-07-04Blur image

Agent Training and Evaluation#

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

这篇工作提出了 AgenticSTS,一个面向长时程 LLM 智能体的受限记忆测试平台,用来研究不同记忆层对决策的影响。它采用“按决策重建提示”的方式,通过类型化检索组装每一步输入,不再把原始跨步轨迹直接拼接进上下文,从而让提示长度保持有界,并支持对单个记忆组件做独立消融。作者把该框架落到《Slay the Spire 2》这类高随机性、长回合策略游戏中,构建了可重复的评测流程和条件标注轨迹数据。实验显示,在启用策略技能层后,固定消融设置下胜率从 3/10 提升到 6/10,说明显式记忆层确实会影响长时程决策,但该样本量下统计显著性仍有限。

EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments

这篇论文提出 EvoPolicyGym,用来评估智能体在固定交互预算下对可执行策略系统进行迭代改进的能力。作者将这一问题定义为 Autonomous Policy Evolution,并在一组紧凑的交互式强化学习环境中构建了基准,观察智能体如何根据反馈持续编辑和调优策略。该基准不仅看最终分数,还提供轨迹级诊断,用来分析预算分配、反馈转化和参数调整过程。实验结果显示,GPT-5.5 在该套件上取得了最强的总体排名分数,并在 16 个环境上都进入前两名。

AgenticDataBench: A Comprehensive Benchmark for Data Agents

这篇工作提出了 AgenticDataBench,用于系统评测数据智能体在真实数据科学工作流中的能力。作者从15个垂直领域收集真实任务,并引入数据科学技能与层级聚类来去重、补全和量化基准覆盖度,同时还为缺少真实任务的领域生成高质量合成任务。基准提供细粒度标注,能够分别分析智能体在技能选择、流程执行和任务组合等环节的表现。实验表明,该基准能更全面地区分不同数据智能体的能力差异,并给出更细的技能级诊断信息。

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

这篇工作针对医学多模态推理中的失败级联问题,提出了 MRPO,一种步骤感知的强化学习算法。作者发现很多错误来自早期推理步骤的失误,因此在最终答案错误时,对更早的无效推理 token 施加更强惩罚,以打断错误传播。该方法使用过程级奖励而不是只看最终结果,从而更好地优化临床视觉问答中的推理过程。实验表明,MRPO 在三个多模态骨干上都优于标准 GRPO 和近期 RL 基线,并且显著降低了早期推理失败率。

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

这篇论文提出 SkillCoach,用自演化的 rubric 来评估和增强智能体的技能使用能力。作者从真实 rollout 中自动归纳出与技能相关的过程评分标准,分别衡量技能选择、技能遵循、技能组合和基于技能的反思,而不是只依赖最终结果是否成功。这样可以把“碰巧做对”和“真正按流程做对”区分开来。实验显示,演化后的 rubric 能更好暴露被最终准确率掩盖的失败,并为训练轨迹筛选提供更强的过程监督信号。

Multimodal World Model#

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

这篇论文提出 WorldDirector,一个强调可控性和持久动态记忆的视频世界模型框架。方法上,它将语义级运动编排与像素级视频生成解耦,先用LLM协调3D轨迹与相机运动,再把这些轨迹作为生成控制信号,从而维持物体身份稳定并支持长时间离开视野后的再次出现。作者还借助这种编排机制实现了更自由的视角探索和更长、更复杂事件的合成。实验结果显示,该方法在控制性、外观一致性和动态对象记忆方面优于现有世界模型。

Papers - 2026-07-04
https://themaoqiu.github.io/blog/papers-2026-07-04
Author 猫柒-
Published at July 4, 2026