GARFIELD:如何用概率潜变量解决场景运动预测的延迟与多模态难题
现有视频世界模型生成像素级未来帧,计算成本高且未显式建模运动分布。GARFIELD 提出一种结构化时空潜变量方法,利用稀疏目标条件实现高效轨迹采样与确定性密度解码。实验表明,该方法在开放集运动规划中实现 SOTA 性能,并显著降低延迟。注意:行人轨迹预测在零样本设置下落后于专用模型。
现有视频世界模型生成像素级未来帧,计算成本高且未显式建模运动分布。GARFIELD 提出一种结构化时空潜变量方法,利用稀疏目标条件实现高效轨迹采样与确定性密度解码。实验表明,该方法在开放集运动规划中实现 SOTA 性能,并显著降低延迟。注意:行人轨迹预测在零样本设置下落后于专用模型。
长 horizon 机器人规划常因语义与几何脱节而失败。APIVOT 通过自适应交错语言推理与视觉思维(Visual Thoughts),在内部验证几何可行性。实验显示其在 KitchenWorlds 中成功率显著优于 Gemini-ER-1.5 等基线,且在复杂几何场景下优势更明显。需注意其目前仅在模拟器中验证,且自适应行为基于 SFT 学习。