人工智能
CoverPrune:用最优传输把3D VLM的视觉token剪枝从“挑多样”变成“保覆盖”
CoverPrune将3D VLM推理时的视觉token剪枝重新定义为最优传输覆盖最大化问题,以保留代表性视觉证据而非最大化多样性,在激进剪枝下保持空间推理性能。
SPARED:让检测器与伪造者互相训练,能否打破AI图像检测的三大捷径?
SPARED的核心判断是:来源捷径、模板化解释和静态决策边界,这三个问题看似独立,其实都源于同一个根源——训练数据的构造方式。如果真实图和假图来自不同渠道,检测器就学会分辨渠道;如果解释语料是模板生成的,检测器就学会背模板;如果训练集固定不变,检测器的边界就静止不动。所以关键不是换更大的模型,而是换一种造数据的方式。
HandsOnWorld:相机解耦手部控制的非受限第一人称视频生成
提出EgoVid-Pro数据集与Plücker Hand Map表示,实现从非受限单目视频训练、相机与手部运动解耦的3D手部控制第一人称视频生成。
免调优语义引导:多模态扩散Transformer的概念擦除
提出一种免训练、免调优的语义引导方法,通过在MM-DiT中间块文本分支提取目标概念与安全概念的表示差构建steering vector,并注入连续早中期块,实现名人、艺术风格和裸体等概念擦除。
EgoMonth:月级第一视角视频如何暴露多模态模型的长期记忆断层
EgoMonth 提出首个跨 20–120 天、301 小时第一视角日常视频的月级基准,用 1,443 个人工 QA 和 14 任务三层认知框架评估 MLLM 的长期时空记忆,发现最强模型 Gemini 2.5 Pro 仅 71.8%,比人类低 22.4 个百分点。
HPSD:把TI2V模型的条件激发能力内化到基础T2V模式
HPSD提出混合策略自蒸馏框架,让TI2V模型在教师特权条件轨迹上锚定、按学生自身策略演化子轨迹并接受速度级监督,从而将条件激发的生成能力内化到基础T2V模式中。
几何基座统一3D感知:GeoUP如何让一个骨干同时支撑深度、检测与占用
GeoUP将VGGT的重建导向潜在表示适配到标定流式多相机驾驶场景,通过时序-视角注意力分解与raymap注入,以单一架构支持深度估计、3D检测与语义占用预测。
HounsWorld:把CT理解与生成统一为隐式患者状态预测
HounsWorld 将 CT 中心临床智能统一为共享隐式患者状态下的状态依赖预测问题,通过 Joint Understanding-Generation Learning 同时支持读取、重建与模拟。