Motto:用思维令牌统一感知与推理
现有多模态大模型在定位任务中难以兼顾精细感知与复杂推理。Motto提出Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens,通过动态切换感知与推理模式,在PR-Bench等基准上实现SOTA。视频解析其核心机制与实验证据,并指出计算开销等局限。
现有多模态大模型在定位任务中难以兼顾精细感知与复杂推理。Motto提出Spatially-Grounded Thought Tokenization和Context-Adaptive Chain-of-Tokens,通过动态切换感知与推理模式,在PR-Bench等基准上实现SOTA。视频解析其核心机制与实验证据,并指出计算开销等局限。