CodeShrink:自适应视觉压缩如何让代码图像比纯文本更高效
提出自适应视觉压缩框架CodeShrink,通过空白去除渲染、主导令牌选择和强化学习驱动的自适应压缩配置,在多种代码理解任务中大幅降低视觉令牌消耗并保持或超越未压缩文本输入的性能。
提出自适应视觉压缩框架CodeShrink,通过空白去除渲染、主导令牌选择和强化学习驱动的自适应压缩配置,在多种代码理解任务中大幅降低视觉令牌消耗并保持或超越未压缩文本输入的性能。
提出OASIS,一个面向单张图像的手部化身重建框架,通过几何对齐的视觉证据令牌和可见性条件注意力解决自遮挡问题,并利用Mesh特征表示提升非刚性变形下的渲染质量。
提出TraceViT,通过构建语义单调的变换链作为中间目标,并引入任务参考和对象工作空间进行根基化,结合软轨迹对齐,在ARC-AGI基准上实现了紧凑视觉推理模型的领先性能。
提出HierDoc框架,将长文档证据获取建模为从页面到区域的连续结构化集合预测,通过阶段式GRPO优化页面和区域策略,在多个长文档VQA基准上取得领先性能。
问题的根源在于一个矛盾:评论家需要时序信息来应对部分可观测性,但稀疏的奖励信号不足以驱动它从高维视觉历史中提取有用的时序表征。现有方法要么回避这个矛盾——只用单帧,要么天真地拼接多帧却缺乏有效的学习驱动力。这里存在一个明确的研究空白:如何为评论家提供一个密集的、自监督的学习信号,迫使它真正理解场景的动态变化?
工业界存有大量数字化前积累的栅格二维CAD图纸,如何让AI自动从中恢复三维参数化模型?Drawing-Recode提出了一种新思路:不再将几何形状和尺寸标注混在一起处理,而是分别提取,再通过交叉注意力机制将标注信息“接地”到对应的几何区域。核心创新在于标注接地损失(AGL),它显式地约束模型去学习“这条尺寸线对应的是哪个面”。实验表明,这种显式对齐策略在代码准确率和三维重建精度上均优于现有方法,且在模拟扫描噪声条件下仍保持稳健。不过,当前方法基于DeepCAD数据集,建模操作有限,尚未在真实工业扫描图纸上验证。