跳至内容

pchao.org

Qwen2.5-VL

Qwen-3D:打破3D语言模型的几何信息瓶颈

5 8 月, 2026 作者 PengChao
论文代表图:figure-01-p002-01

Qwen-3D通过3D旋转位置编码和基于掩码的解码器,将多视图几何信息直接融入Qwen视觉语言模型,在统一的架构中实现了领先的3D和2D视觉语言任务性能。

分类 CVPR三分钟 标签 3D RoPE、 CVPR三分钟、 Qwen-3D、 Qwen2.5-VL、 人工智能、 深度学习、 计算机视觉 发表评论
© 2026 pchao.org • Built with GeneratePress