Xingjian Wang
Papers - 2026-08-04Blur image

Embodied Agent#

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

这篇工作提出了 N0-VTLA,一个融合视觉、触觉、语言和动作的基础模型,面向接触丰富的机器人操作任务。方法上,作者设计了包含大规模视触觉预训练、分阶段触觉路径融合,以及基于优势条件的离线策略改进 ALTER 的训练流程,以把触觉信息转化为更精细的动作调整。模型还引入预测式触觉分支,用来蒸馏接触模式并服务下游操作控制。实验显示,N0-VTLA 在九个真实机器人任务上全部优于基线,在 20 个仿真任务上取得 63.8% 的平均成功率,显著高于最强基线的 44.0%,使用 ALTER 的策略在三个长时程真实任务上也达到 75% 到 95% 的成功率。

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

这篇工作提出了 $N_0$-TWAM,一个面向接触丰富操作任务的触觉原生世界-行动模型。它把触觉信号作为核心输入来建模物体接触与操作过程,并通过规模化训练提升在复杂操控中的泛化能力。方法上,论文围绕触觉表征、世界状态预测与动作生成进行联合学习,以适配高频接触和细粒度力反馈场景。实验表明,随着模型规模扩大,系统在多种接触密集的操作基准上取得更好的成功率和稳定性。

Agent Training and Evaluation#

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

这篇工作提出了从 RLVR 到 RLSVR 的任务变换框架,目标是把原本依赖人工偏好或判官的开放式任务,改造成可自验证奖励的训练环境。作者用 SpyRL 作为具体实现,让多个智能体在带有不对称信息的同一任务中协作,并通过识别预设的“间谍”来生成完全可验证的奖励信号。方法上,它利用任务内在规则把监督从外部评估器转移到环境本身,从而降低评测偏差和推理成本。实验在文本摘要、创意写作和数学推理上验证了该方法,结果显示 SpyRL 在不可验证任务上优于现有自我改进方法,并且在可验证推理任务上也带来稳定收益。

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

这篇论文研究编码助手在跨会话场景下如何根据用户的长期偏好自适应歧义澄清。作者构建了一个用于评测个性化歧义适应能力的基准,重点考察助手在不同会话中是否能减少不必要的追问并提升代码补全质量。方法上,论文通过跨会话记忆和偏好建模来分析模型对模糊指令的处理策略,并系统比较不同助手的行为差异。实验表明,具备个性化适应能力的系统能够显著减少澄清次数,同时在代码生成质量上取得更好的整体表现。

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

这篇工作提出 SAF-OPD,用稳定的优势融合机制结合 RLVR 与 on-policy distillation。作者指出,直接用固定系数融合两类优势会因幅度失配和时间失配导致熵坍塌,进而限制训练稳定性与探索能力。为此,方法在 OPD 优势上引入稀疏化-压缩和预热-退火两阶段控制,并可按阶段独立启用,几乎不增加额外开销。实验在 7 个数学推理和代码生成基准上验证了该方法,相比固定系数的 GRPO+OPD 融合取得了更稳定训练和 0.51 到 2.70% 的综合提升。

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

这篇论文提出了 ExtractBench,一个面向企业文档的 schema-guided 抽取基准,用来评测代理在给定文档和用户定义 schema 时的抽取能力。作者同时衡量值准确率、记录完整性、grounding 和成本,并构建了覆盖 370 份企业文档、4869 页、8 个业务领域和 67 种文档类型的数据集与评测流程。数据构建采用真实文档的一致性筛选、合成列表的已知值注入,以及表单的人类核验来保证标注质量。实验显示,商用 VLM 在短文档上表现较好,但在长文档中容易截断记录列表;编码型代理准确率更高但成本显著更大。LlamaExtract Agentic Plus 在三项核心指标上排名第一,在接近编码代理的准确率下实现了更低成本。

Multimodal World Model#

QQWorld: Quantile-Quantile Matching for World Model Regularization

这篇论文提出 QQWorld,用分位数-分位数匹配来正则化世界模型训练。核心思路是通过匹配预测分布与目标分布的分位数关系,缓解世界模型中常见的分布偏移和不稳定问题。方法上,作者把 QQ 匹配项作为额外约束加入训练目标,从而提升模型对未来状态或动态演化的刻画能力。实验结果显示,该方法在多个世界模型相关任务上带来更稳定的训练过程和更好的预测表现。

Papers - 2026-08-04
https://themaoqiu.github.io/blog/papers-2026-08-04
Author 猫柒-
Published at August 4, 2026