Xingjian Wang
Papers - 2026-06-30Blur image

Multimodal Agent#

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

这篇论文提出 ProMSA,用于知识增强的视觉问答任务,目标是在推理过程中动态决定调用图像搜索、文本搜索还是停止。方法上,智能体在显式工具调用预算约束下迭代检索,并通过去重机制避免重复搜索;训练阶段先用 rejection-sampling SFT 学习合法的工具调用格式,再用 TN-GSPO 做序列级强化学习优化。作者在 E-VQA 和 InfoSeek 上验证了该方法,相比强基线在检索质量和端到端准确率上都有稳定提升。

Embodied Agent#

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

这篇工作研究如何把人类操作数据更有效地迁移到双臂平行夹爪机器人。作者提出 bridging action 表示,只保留相机初始坐标系下的腕部相对平移,把它作为人类和机器人共享的动作空间,从而避免直接使用噪声较大的 6DoF 人体动作。为处理不同具身之间动作成分缺失的问题,方法还构建了一个带交错动作 token 和 attention masking 的 π0 风格视觉-语言-动作模型。在一组新设计的双臂操作任务上,该方法比用噪声 6DoF 人类动作迁移效果更好,并且随着人类数据量增加性能继续提升。

SimFoundry: Modular and Automated Scene Generation for Policy Learning and Evaluation

SimFoundry 提出了一套从视频自动构建仿真场景的模块化系统,用于机器人策略学习与评测。方法上,它能够生成可直接仿真的数字孪生,并支持对象、场景和任务编辑,从而自动构造保留可供性但具有变化的数字 cousin 场景。实验显示,在 7 个操作任务和 5 种策略架构上,SimFoundry 的仿真评测与真实世界表现高度一致,平均 Pearson 相关系数达到 0.911,最大排序违背仅为 0.018。进一步将对象、场景和任务 cousin 用于仿真训练后,零样本迁移到真实机器人任务的成功率分别平均提升 17%、21% 和 40%。

Vesta: A Generalist Embodied Reasoning Model

Vesta 提出了一种统一的具身通用模型,用单一基础模型整合定位、空间推理、导航和长程规划能力。方法上,作者使用大规模且多样化的精心构建语料来强化空间 grounding,并引入一个简单的多模态记忆机制来支持跨长时间跨度的推理。实验结果表明,Vesta 在多个基准上平均比单项 SOTA 基线高出 20% 以上,也比按类别拼接的最优专家集成高出 10% 以上。对真实机器人任务的测试进一步显示,它在需要记忆和推理的场景中将任务成功率提升了 35% 以上。

Agent Training and Evaluation#

GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems

这篇工作提出 GBC(Gradient-Based Connections),用于对多智能体系统进行细粒度归因与优化。方法上,作者把多智能体流程建模为计算图,在 token 级别通过梯度连接权重衡量上游智能体输出对下游结果的影响,并据此构建归因图、反向传播任务损失来定位错误来源。为了高效实现,论文还设计了 AgentChord,利用基于前缀的梯度计算降低开销。实验在 MultiWOZ 和 τ-bench 上表明,GBC 能稳定提升多智能体性能,并且更高质量的归因与更好的优化效果相关。

AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents

该文提出 AgentOdyssey,一个面向测试时持续学习智能体的评测框架,用于自动生成开放式、长时程的文本游戏环境。方法上,它结合本体约束下的 LLM 实体与规则合成、程序综合修复,以及可扩展的任务生成机制,来构造丰富实体、动态世界和多阶段目标。作者还设计了多维评测指标,不仅看游戏进度,还诊断世界知识获取、情景记忆、探索、多样性和模型成本。实验表明,现有不同智能体范式在关键能力上仍有明显短板,虽随更强基座模型而提升,但最佳系统距离人类表现仍有很大差距,短期记忆对多种方法都有明显帮助。

Multimodal World Model#

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

这篇工作提出 PhysisForcing,一个面向机器人操作的视频世界模拟训练框架,用来提升生成结果的物理一致性。作者分析了物体形变和接触阶段不合理的时空关联是主要失稳来源,因此分别设计了像素级轨迹对齐损失和语义级关系对齐损失,去约束 DiT 特征在物理信息区域的表现。实验在 R-Bench、PAI-Bench 和 EZS-Bench 上都显示出稳定提升,其中在 R-Bench 上相较 Wan2.2-I2V-A14B 和 Cosmos3-Nano 基座分别提升 22.3% 和 9.2%。在 WorldArena 闭环动作规划协议下,闭环成功率也从 16.0% 提高到 24.0%,说明物理对齐的视频模型能带来更强的机器人操作表征。

Papers - 2026-06-30
https://themaoqiu.github.io/blog/papers-2026-06-30
Author 猫柒-
Published at June 30, 2026