生成式视频编码首次实时解码!ReGenVC 如何用蒸馏与8卡并行突破时延壁垒

方法贡献:蒸馏与并行协同

生成式视频编码能在超低码率下合成清晰视频,但扩散解码器太慢,一直无法实时运行。ReGenVC 针对说话人头像场景,将 20 步扩散教师蒸馏为 4 步学生,再通过 8 路统一序列并行、空间分割 VAE 和三级重叠流水线,在 8 张 RTX 5090D 上实现 24 fps 稳态解码,总码流仅约 26 kB。系统留有约 28 ms 余量,但余量较窄,且目前仅在单人固定镜头场景下验证,通用性有待扩展。

跨具身迁移的隐式钥匙:行为对齐表征如何让机器人共享技能

研究空白与本文贡献

不同机器人的观测和动作空间差异巨大,如何让一个模型从多种机器人数据中学习并迁移到新机器人?本文提出行为对齐表征——一种跨具身不变且能预测动作的中间表示。通过在VLA模型中联合预测末端执行器轨迹、语言动作和边界框,隐式对齐异构数据。实验表明,末端执行器轨迹是最有效的单一表征,联合表征在模拟和真实机器人迁移中均显著提升性能,且表征的增益随跨具身数据规模扩大而增强。但需注意,模拟环境中的高度对齐可能高估了迁移效果,表征选择也依赖于具体任务和具身差异。

TARS:无3D重建的视频重拍,时间步感知如何让数据规模化?

方法:时间步感知的数据规模化

视频重拍摄想让镜头动起来,但3D重建又慢又容易崩,配对数据又太少。TARS发现了一个关键洞察:扩散模型去噪时,高噪声步管全局结构和视角,低噪声步管纹理细节。于是它用单视频切两段做自监督学习,大规模训练重拍先验,再只在最关键的高噪声步用少量配对数据微调。结果在相机精度和视角控制上大幅超越3D方法和配对学习方法。当然,极端动态场景下的表现和MLLM生成描述的精度仍是潜在瓶颈。

FaithEyes:多智能体自评判框架,让VLM不再“假装”看图

FaithEyes 的核心设计

Agentic VLM 在调用裁剪等工具时,常产生与问题无关的装饰性过程图像,模型实际依赖先验知识而非工具输出,导致计算资源浪费和推理不可靠。FaithEyes 提出多智能体自评判框架,让模型自身作为子智能体判断每张过程图像是否有助于回答问题,并将判断结果同时注入工具观察和用于缩放工具奖励,从推理上下文和优化目标两个层面联合抑制奖励黑客行为。实验表明,FaithEyes 在多个感知和推理基准上超越现有 agentic VLM,工具忠实度大幅提升。注意,该方法在密集数值逻辑推理任务上提升有限,且自判断能力受限于模型自身容量。

Rest2Art:仅凭静止状态,如何重建铰接物体的3D结构与运动?

从静止到运动:视频扩散模型提供假设

我们日常见到的柜子、抽屉、冰箱,大多处于闭合状态。如果只给你看一张闭合柜门的照片,你能准确说出里面有几个抽屉、门往哪边开吗?这正是Rest2Art要解决的核心问题:从物体的静止状态观测中,重建出完整的部件级几何和关节运动参数。现有方法要么需要多个运动状态作为输入,要么依赖已知的部件数量,而Rest2Art通过三个关键设计突破了这些限制:首先,让视觉语言模型和分割模型相互“挑错”,在迭代协同优化中自动发现部件;然后,利用视频扩散模型合成可能的铰接运动,从中提取运动轨迹;最后,用网格几何约束来筛选和精化关节参数。实验表明,该方法在合成和真实数据集上均能有效恢复铰接结构,但也存在视频生成可能失败、微

思考一次足矣:中间层证据路由如何让高分辨率VQA不再遗忘已捕获的细节

研究空白与核心区分

高分辨率视觉问答中,模型在视觉编码阶段已经捕获的细粒度证据,为什么在后续推理时反而被丢弃了?这篇论文发现,问题不在于证据缺失,而在于已编码的证据被冗余背景信息稀释。Thinking-Once方法在中间层利用问题条件化的注意力分布,独立地为每个实体和全局查询选择最小覆盖的核心证据,同时用网格池化压缩背景上下文,将这两部分证据路由到更深层网络。在五个主流MLLM上,三个HR-VQA基准平均提升约3个点,峰值内存降低约4GB,推理时间仅为DeepScan的2.8%。但该方法无法恢复视觉编码器已不可逆丢失的信息,且效果依赖于注意力分布能可靠定位证据。

JigShape:用拼图锁扣给大模型做几何推理体检,结果发现一道悬崖

矩形拼图的陷阱

视觉语言模型看图说话很厉害,但空间推理到底行不行?JigShape 基准用带凹凸锁扣的拼图来测试,发现所有模型在 8×8 网格上性能集体崩塌。问题出在哪?模型过度依赖几何形状线索,却无法有效整合视觉内容进行推理。本期视频带你拆解这个“悬崖”背后的真相。

阴性对照揭示影像组学与AI特征中的体积陷阱

研究空白与框架创新

许多看似强大的影像组学签名,可能只是肿瘤体积的替代品。本期解读的论文提出READII-2-ROQC框架,通过生成体积不变的阴性对照图像,系统检验了传统影像组学特征和最新成像基础模型FMCIB特征对空间结构的真实依赖性。研究发现,多个已发表的总生存期预测签名在图像纹理被完全破坏后性能不变,其预测能力与仅使用体积的模型相当。更令人警醒的是,FMCIB深度学习特征主要从肿瘤边界或背景区域提取信息,而非肿瘤内部纹理。该框架为影像标志物研究提供了关键的混杂因素审计工具,但其目前尚未涵盖采集参数等上游变异。

ScaFE:不直接看图的LLM,如何用临床知识程序超越视觉模型?

现实困境与直觉

从临床照片区分瘢痕疙瘩和增生性瘢痕,面临专家标注稀缺和跨医院采集差异大的双重挑战。ScaFE提出了一种新思路:不让大语言模型直接看图诊断,而是让它检索临床证据,生成可本地执行的特征测量程序。这些程序在本地处理图像,仅将聚合验证统计量反馈给LLM进行迭代修复,最终选出的程序用随机森林分类。在三个医院的留一站点外评估中,ScaFE以10%的数据量领先最强基线BiomedCLIP达11.8个百分点。该方法不依赖海量标注,保护数据隐私,且每个特征都有可溯源的证据记录。但研究为回顾性、二分类设计,需前瞻性临床验证。