Xingjian Wang
Papers - 2026-06-23Blur image

Grounding-driven Visual Reasoning#

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

这篇工作提出 PerceptionDLM,用多模态扩散语言模型来做高效的并行区域感知。方法上,它基于 PerceptionDLM-Base,引入高效提示和结构化注意力掩码,使模型能够在序列级和 token 级同时描述多个被遮挡区域。作者还构建了 ParaDLC-Bench,把单图多区域标注扩展为可同时评测多个区域的基准。实验显示,模型在区域描述质量上保持有竞争力,同时在多区域感知场景中获得显著推理加速。

Thinking with Images#

Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

这篇工作提出 Reflective Masking,通过轻量后训练让 Mask Diffusion Models 具备多轮反思式修正能力。方法上,它利用掩码扩散天然支持的局部编辑特性,在测试时反复回看并修订前一轮输出,并加入 History Reference 来复用中间去噪状态中的信息。作者强调该方法不需要改模型结构,可以直接适配现有的 MDM。实验覆盖文本生成、数独和图像编辑等多种任务,结果显示该方法普遍优于标准掩码基线,并能稳定提升多轮修正效果。

Multimodal Agent#

MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision

这篇工作提出 MemSlides,用层次化记忆框架支持个性化演示文稿生成和多轮局部修改。方法上,它把长期记忆拆成用户画像记忆和工具记忆,再配合工作记忆来保留会话中的活跃偏好与约束。系统还采用 slide-local revision,让修改尽量作用于最小受影响区域,而不是反复重生成整套幻灯片。实验表明,用户画像记忆能提升多 persona、多意图场景下的匹配度,工具记忆能改善闭环修改行为,定性案例也展示了工作记忆对偏好延续的作用。

3D LLM#

WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents

To assist humans over extended periods in real homes, embodied agents must remember user routines, world states, and past interactions. Existing long-term memory benchmarks mainly evaluate language-centric retrieval and question answering, while embodied benchmarks often focus on short-horizon task execution without testing long-term memory use in dynamic environments. We introduce WorldLines, a project-driven benchmark for long-horizon embodied household assistance. It constructs temporally extended household traces with dialogues, actions, execution feedback, object and device state changes, and converts them into evidence-linked samples for Memory QA and Embodied Task Planning. We further propose ObsMem, an observer-grounded memory framework that maintains visibility-aware memories and action-native state trails for state-aware decisions. Experiments reveal persistent challenges in partial observability, overwritten world states, and translating long-term memory into embodied plans, while ObsMem offers a stronger reference architecture for this setting.

Embodied Agent#

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

这篇工作面向通用视觉-语言-动作系统的机器人规划,目标是同时提升三维几何证据和可复用的长期记忆。作者提出 GeoFuse-MV3D,用几何先验引导的多视图重建分支来验证外部几何线索,并结合软视觉壳约束、轴向细化和几何/外观分离融合,减少单目重建的幻觉问题。与此同时,他们把 KnowledgeBank 升级为带有质量、置信度、生命周期、验证器和冲突元数据的受治理长期记忆系统,以支持更精确的检索与决策。实验在 GSO-30、Terminal-Bench 2.0 和 SWE-Bench Verified 上验证了方法有效性:重建分支在 CD、LPIPS、PSNR、SSIM 上相对基线都有稳定改进,记忆模块也在任务成功率和修复率上优于 ReasoningBank。

4D Understanding and Generation#

SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction

这篇论文提出 SpatialAvatar-0,用于从一张或少量人像生成高质量的 4D 头部头像。方法以 FLAME 网格绑定的 Gaussian 表示为核心,设计了参数自由的 K 源 mean-pool,以及从单目时序到多视图空间的两阶段训练策略,避免身份先验塌缩;随后又加入 1 万步的布局保持式个体精修流程,冻结绑定与高斯数量,并用三项抗尖峰正则替代传统 densification。作者在 VFHQ/HDTF 跨域零样本测试中,即使未在目标域训练,也比 in-domain 的 GAGAvatar 高出 1.5 dB PSNR。 在 SplattingAvatar 单目基准上,该方法在所有报告指标上都取得最好结果,相比 30 万步的 GeoAvatar 最高快约 60 倍,同时 PSNR 还提升了 1.3 dB。

Agent Training and Evaluation#

GateMem: Benchmarking Memory Governance in Multi-Principal Shared-Memory Agents

这篇工作提出 GateMem,用于评测多主体共享记忆智能体中的记忆治理能力。论文的重点不是单纯提升记忆容量,而是刻画多个主体共享同一记忆空间时,系统如何控制访问、写入和隔离。作者构建了专门的基准与治理维度,用来比较不同记忆管理策略在共享环境中的表现。实验表明,该基准能够有效区分各类方法,并暴露出记忆污染、越权写入和跨主体干扰等问题。

Papers - 2026-06-23
https://themaoqiu.github.io/blog/papers-2026-06-23
Author 猫柒-
Published at June 23, 2026