

Papers - 2026-07-10
吾能观之数千而面色如故
Embodied Agent#
Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
这篇工作提出 LaMem-VLA,将历史经验直接编码为潜在记忆 token,并与当前观测和指令在同一连续表示空间中交织推理。方法上,它包含 short-term/long-term 两个记忆库,以及 curator、seeker、condenser、weaver 四个模块,分别负责整理、检索、压缩和注入记忆信息。实验在 SimplerEnv 和 LIBERO 上验证了该框架,相比现有记忆增强 VLA 方法取得了更好的长程任务表现,说明统一的潜空间记忆有助于复杂机器人操作。
Automating the Design of Embodied Agent Architectures
本文研究如何自动搜索具身智能体的架构设计,而不是依赖人工经验决定感知、记忆、规划和行动模块的连接方式。作者提出 AgentCanvas 作为可编辑的 typed-graph 运行时,并设计 KDLoop 搜索流程,在 proposal、critique、experiment 与 distillation 之间循环,并在卡住时触发反思。实验覆盖四种具身执行器、三类任务场景,结果显示架构级搜索能够带来可部署且方向一致的成功率提升。与此同时,论文也指出具身场景中的 rollout 噪声、局部编辑盆地和信用分配不足会限制自动搜索效果。
OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies
本文提出 OmniTacTune,用于把触觉反馈以残差修正的方式接入预训练视觉策略,从而提升接触丰富的真实机器人操作能力。方法上,它采用与具体策略无关的两阶段 real-world RL 流程,先利用基础策略自主 rollout 进行触觉感知预热,再学习轻量级触觉残差策略进行在线适配。实验显示,该方法能在四个真实接触任务上,将视觉基线策略的成功率从 5% 到 40% 提升到 85% 到 100%。作者还证明了该方法可以跨视觉基础策略、触觉表示和任务类型泛化。
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
这篇论文提出 RoboTALES,用任务对齐的模拟未来来学习具身机器人策略。方法上,它用分层 LLM 规划器把复杂任务拆成子目标,引导视频生成模型想象更符合任务意图的未来轨迹,并结合 VLM critic 通过奖励反馈持续校正内部表示。整个框架以单阶段方式训练,使生成的未来在时间上更一致、动作更可执行,从而更适合用于策略学习。作者在 RoboCasa 和 LIBERO10 的多种操作任务上进行了评测,结果显示该方法整体优于现有方法,尤其在长时程任务上提升更明显。
Spatial Intelligence (Image/Video)#
WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence
这篇论文提出了 WildCity,一个面向真实城市尺度的多模态测试平台,用于渲染、仿真和空间智能研究。作者通过自动驾驶车队采集了 18 条长轨迹,平均每条 83.7 公里,覆盖了动态物体、光照变化和相机位姿不完美等真实世界难点。论文还给出了一个面向城市的重建基线,并将重建结果转换为闭环模拟器,支持在城市级环境中测试空间理解与交互能力。实验与分析表明,该基线能够在复杂城市场景中工作,但要走向可扩展、可外推的城市数字孪生,仍需解决尺度、泛化和不确定性三方面挑战。
Agent Training and Evaluation#
RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
这篇工作提出 RoboDojo,一个统一的仿真与真实世界基准,用来系统评估通用机器人操作策略。它包含 42 个仿真任务和 18 个真实任务,覆盖泛化、记忆、精度、长时程执行和开放词汇指令跟随等多个维度,并提供基于 Isaac Sim 的并行仿真与可远程访问的真实评测系统。作者将 30 个策略接入 XPolicyLab 进行测试,建立了公开排行榜并给出了对当前策略能力的系统分析。
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
本文提出 Single-rollout Asynchronous Optimization(SAO),用于更稳定地训练面向智能体任务的异步强化学习。方法上,它用“每个提示只采样一个 rollout”的单轨迹采样替代 GRPO 常见的组内采样,并配合值模型训练设计与严格的双侧 token 级裁剪来降低 off-policy 偏差、提升优化稳定性。实验表明,SAO 可以稳定训练一千步,并在 SWE-Bench Verified、BeyondAIME、IMOAnswerBench 等编码与推理基准上持续优于 GRPO 及其变体。作者还展示了单 rollout RL 在模拟在线学习场景中对动态环境适应的优势。
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
本文提出 AgentLens,一个面向编码智能体的生产评测基准,强调对完整交互轨迹而非单一成败标签进行评估。方法上,它把形式化验证与 LLM 撰写的轨迹审查、以及并列对比结合起来,让每次运行都能输出可读的评分理由,并用于诊断模型行为和产品回归。实验与实践表明,这种轨迹级评审能更细致地区分模型版本,适合在夜间评测流水线中持续监控。作者还将该基准开源,便于后续研究复用。
Multimodal World Model#
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
这篇工作提出 LingBot-Video,一个面向具身智能的视频预训练框架,用于弥合通用视频生成与机器人控制之间的领域差异。方法上,它采用 MoE 架构提升模型容量与推理效率,并通过数据 profiling 扩充机器人相关视频,同时引入多维奖励系统约束物理合理性和任务完成度。作者称该模型是开源的大规模 MoE 视频基础模型,综合评测显示它在性能和效率上都适合作为具身场景的视频世界模型底座。
Infinite Worlds with Versatile Interactions
这篇工作提出 LingBot-World 2.0,目标是在世界模型中实现无限交互时长、稳定画质和更丰富的可交互元素。方法上,它通过因果预训练支持长时序生成,并蒸馏出一个实时版本以支持 720p、60 fps 的推理,同时加入 pilot agent 和 director agent 的协同机制来规划角色行为并动态生成环境元素。实验和系统展示表明,新版本相比前代具备更长的交互 horizon、更快响应速度和更强的多用户交互能力。