文档MLLM的关系型隐私泄露:当视觉证据消失,模型靠记忆联合泄密
本文揭示文档MLLM在视觉证据缺失时会依赖记忆的字段关联联合泄露多个敏感字段,并提出动态关系解耦遗忘框架DRUF及基准DocPrivacyBench来缓解该风险。
本文揭示文档MLLM在视觉证据缺失时会依赖记忆的字段关联联合泄露多个敏感字段,并提出动态关系解耦遗忘框架DRUF及基准DocPrivacyBench来缓解该风险。
Mr3D-VL是一个40亿参数的多参数3D MRI视觉-语言基础模型,通过共享3D编码器、4D旋转位置编码和多分辨率特征注入策略,在报告生成和视觉问答任务上显著超越现有通用及医学专用模型。
StreamTTT通过将长期历史写入注意力上下文之外的在线更新快权重(TTT分支),同时保留短滑动KV缓存专用于近期证据,从而在流式VLM中同时保持实时感知精度并提升回溯记忆能力。
LocusGS为每个高斯查询token引入显式3D锚点状态(中心+支撑半径),在解码过程中逐步细化并用于引导跨视图特征聚合与锚点中心化高斯生成,从而提升前馈3DGS的重建质量与空间组织性。
论文提出SCIFIGBENCH基准与A-R-I行为框架,联合评估VLM在科学图表理解中的感知、推理与不确定性下的行为可靠性,揭示高感知能力模型(如GPT-5.2)仍可能成为“自信的编造者”。
提出PatternEval基准与PatternRM/PatternRL训练框架,诊断并缓解混合思考MLLM在思考与非思考推理模式间用户可见响应模式失配问题。
DreamX-Phi 1.0 是一个基于 Wan2.2-TI2V-5B 的动作条件视频世界模型,通过 PRoPE 几何注意力、深度监督和对象一致性约束,在给定单帧观测和双手动作轨迹时预测未来视频,并在 WorldArena 2.0 上取得 Track 1 第一、Track 2 并列第二。
本文提出因果世界模型(CWM)的形式化定义,将观测、关系变量、动作、转移与效用耦合为结构化决策模型,并以组件级可识别性框架阐明各组件可从数据中恢复的等价类及接口兼容条件。
PlayWorld 提出用多模态 Agent Player 以长程目标驱动闭环交互来评测视频世界模型,覆盖几何一致性、交互保真度、视野外演化与洞察演化四个维度。