Xingjian Wang
Papers - 2026-08-05Blur image

Grounding-driven Visual Reasoning#

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

这篇工作提出 VAD,用反事实目标重建来区分多模态 on-policy distillation 中哪些教师纠错真正来自视觉证据。方法是在学生生成前缀上,比较同一教师在“保留相关证据”和“移除相关证据”两种条件下的输出差异,并用中心化对数概率差构造视觉可归因方向。随后将原始纠错投影到该方向上,得到与介入一致的监督目标,并让教师只作为弱正则项参与训练。作者在 6 个细粒度视觉基准上、4B 和 9B 规模均验证了该方法优于直接的 privileged-view distillation 和 visual-advantage weighting,且在 token 级分析中能更好聚焦任务相关视觉修正。

3D/Space Reasoning#

CADENA: Stepwise CAD Reverse Engineering

这篇工作提出了 CADENA,用逐步生成的方式把 3D 网格逆向还原成可编辑的参数化 CAD 程序。方法上,它不像多数一次性生成整段程序的模型,而是按操作序列逐步扩展,并在每一步将目标几何与当前预测结果进行对比。作者还构建了 CADENA-Bench,用于评测机械零件逆向建模能力。实验表明,CADENA 在 CADENA-Bench 以及 DeepCAD、Fusion 360 和 MCB 数据集上都优于此前方法。

Agent Training and Evaluation#

SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

这篇工作提出了 SKT,一套通过验证合成数据来规模化训练技能使用能力的流水线。方法上,系统从大量 agent skills 中选择单技能和多技能配置,再用规则验证与 agent 验证生成可执行任务轨迹,并通过反馈修复保留真正有效、且确实用到所需技能的样本。作者基于 2000 个公开技能构建了 4000 个任务包和 27164 条已验证轨迹,同时还发布了用于评测技能使用的 SkillEval。实验显示,用 SKT 生成的轨迹做监督微调,能在多种模型、基准和 agent 框架上稳定提升技能使用表现,且收益依赖高质量验证数据并会随技能覆盖面扩大而增强。

Papers - 2026-08-05
https://themaoqiu.github.io/blog/papers-2026-08-05
Author 猫柒-
Published at August 5, 2026