一个模型统一检测、分割和3D几何?SenseNova-Vision解读

方法概述

传统视觉任务需要不同结构和预测头。SenseNova-Vision尝试把检测、OCR、分割、深度、法线和多视图几何统一成文本、图像或混合生成。本期重点看统一接口、语料构建、各任务实验,以及评估协议与复杂场景失败案例。