Xingjian Wang
Papers - 2026-07-31Blur image

Embodied Agent#

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with ▲ )

这篇工作提出了 TurboVLA,一种面向机器人操控的实时 vision-language-action 模型。它放弃了传统 LLM 中心的 V→L→A 路径,改为直接从视觉和语言到动作的映射,并通过轻量级双向视觉-语言交互和紧凑解码器输出连续动作块。这样可以显著降低推理开销和显存占用。在 LIBERO 上,该方法用仅 0.2B 参数达到 97.7% 平均成功率,推理延迟 31.2 ms、显存占用 0.9 GB,性能接近或超过更大的策略模型。

HumanCLAW: Can Vision-Language Models Act Through a Body?

这篇工作提出 HumanCLAW,用于评估视觉语言模型是否能够通过具身身体进行行动决策。它将高层决策与底层执行解耦,让模型每一步只发出原子技能指令,再映射到短时连续全身动作,从而把平衡和运动控制等执行噪声从评测中分离出去。基于该框架,作者构建了 HumanCLAW-Bench,包含 41 个室内场景中的 1,218 个长程、第一视角的找路-交互任务。实验测试 9 个最新 VLM,结果显示没有模型能真正解决该基准,最好成绩只有 16.8%,主要失败点在于具身自我感知不足。

Agent Training and Evaluation#

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

这篇工作提出 CLBench-V,用于评估多模态上下文学习能力,重点覆盖从 grounding 到新信息应用和新知识学习三个维度。作者将公开基准与新构建的数据集结合,覆盖科学、金融、长文理解、空间推理和网页视觉问答等场景,并通过自动化构建与过滤降低数据制作成本。整个基准共包含 3,443 个样本,6 个最新多模态模型的最好总体分数只有 0.2847,说明该能力仍远未饱和。实验还显示不同模型在上下文 grounding、新信息应用和新知识学习上各有优势,作者进一步分析了判分器可靠性、上下文长度和图片数量等因素。

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

这篇工作提出 CAST,用游戏求解器的状态价值变化来为长时序 LLM Agent 提供更密集的 turn-level 信号,从而缓解仅依赖最终奖励的稀疏信用分配问题。方法上,它把求解器价值差转化为 solver advantage,并将其注入 RLVR 训练;在软最优求解器假设下,这一目标还可等价为仅需标量价值的 on-policy distillation。作者在 Sokoban、Minesweeper 和 Rush Hour 上验证了该方法,CAST 在所有游戏、域内和更难设置下都优于已训练基线。它在 ALFWorld 和 WebShop 上也取得了最高的零样本平均性能,说明该思路能稳定提升 Agent 的决策学习效果。

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

这篇论文提出 SkillRise,用统一的强化学习框架来学习跨任务可迁移技能。它把相关任务组织成逐步变难的序列,并让同一个策略交替执行任务解答与技能文档整理,把生成的技能直接传给后续任务。训练时采用分离的信用分配:当前任务结果监督求解,折扣后的后续结果监督技能整理。作者在 ALFWorld、WebShop 和 ScienceWorld 上实验,SkillRise 的 Pass@1 在对比方法中最强,较最强基线提升 2.3 到 8.5 个百分点,同时还能降低多阶段技能流水线的运行开销。

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

这篇工作提出 MindForge,把开源命令行程序自动转换为只暴露可执行文件和文档的无源码训练环境,用于从零构建软件程序的训练。它基于这些环境收集由 GLM-5.2 作为教师的程序合成轨迹,再用这些轨迹微调 Qwen3.6-27B。实验显示,微调后模型在 ProgramBench 上的平均通过率从 37.98% 提升到 49.51%,接近更大规模的前沿模型。作者还在七个未见软件工程基准上报告了稳定收益,包括仓库生成、翻译、缺陷修复、特性实现和跨语言问题解决。

SpecFirst: Behavioral Specification Elicitation as a First-Class Step in Agent-Based Program Synthesis from Scratch

这篇论文提出 SpecFirst,强调在从零生成程序时应先做行为规格提取,再进入代码合成。它把流程拆成两阶段:先由 spec agent 结合文档和二进制交互探测,整理出结构化规格;再由代码合成 agent 依据该规格实现程序。这样可以先消解文档歧义,并在后续编码阶段保持稳定的行为参照。作者在 ProgramBench 的 200 个样本、四个模型上评估,结果显示 SpecFirst 相比单循环基线可将测试通过率提升 6.9% 到 21.3%,同时显著提高二进制探索覆盖率。

Can AI agents conduct open-ended AI research? Early evidence from two case studies

这篇工作提出了“shadow evaluations”来评估 AI 代理是否真的能做开放式 AI 研究。方法上,代理接手一篇未发表高质量论文的核心研究问题,由原作者对输出进行评分,并在两篇 NeurIPS 2026 未发表投稿上测试了前沿代理,给了它们 6 天和大量算力。结果显示,代理可以独立完成全部工程实现,但无法在研究问题上取得实质性进展,最终两篇论文都被作者明确拒稿。作者还总结了五类常见失败模式,包括对发表门槛判断失准、面对设计缺陷缺乏创造性、遇到死胡同时回退能力差、资源意识不足和指令漂移。

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

这篇工作提出了 OmegaUse-OfficeVal,用于评测大模型代理在长程办公套件任务中的表现,并把经济成本纳入评价。数据集包含 100 个由从业者提出并经过隐私保护改写的办公任务,每个任务都标注了人力工时和任务价格代理,从而可以直接比较人工成本与模型推理成本。方法上,作者构建了基于细粒度评分标准的代码验证器,保证评测更稳定、可复现。实验结果显示,尽管所测前沿模型在速度和成本上显著优于人工,但任务产出质量仍未达到人类水平。

Multimodal World Model#

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

这篇工作提出 StatePlay,一种状态感知的游戏世界模型,目标是在生成视觉 rollout 的同时保持游戏机制一致性。方法上,它联合预测视觉内容与内部状态,如生命值、技能条和计时器,并采用类似 MoT 的架构保留视觉与状态的专门表示,同时允许跨模态交互,让状态预测反过来引导帧生成。作者还为不同模态设计了各自适配的优化目标。实验结果表明,StatePlay 的状态预测平均归一化 L1 误差低于 0.06,并且相较于不显式建模状态的模型,生成 rollout 的机制忠实度提升了 18.6%。

Papers - 2026-07-31
https://themaoqiu.github.io/blog/papers-2026-07-31
Author 猫柒-
Published at July 31, 2026