FOLIO:无需训练的流式视频聚焦语义记忆系统
本文介绍FOLIO系统,一种面向流式视频理解的无训练方法。针对流式场景中记忆成本随视频增长及冗余细节保留的问题,FOLIO采用动态焦点状态引导记忆写入,区分重要实体与上下文。系统包含短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。实验显示,在OVO-Bench上Perception达82.0%,在StreamingBench上整体准确率达74.5%。需注意记忆写入成本随视频长度线性增长,且错误多源于检索证据区分度不足而非记忆缺失。
本文介绍FOLIO系统,一种面向流式视频理解的无训练方法。针对流式场景中记忆成本随视频增长及冗余细节保留的问题,FOLIO采用动态焦点状态引导记忆写入,区分重要实体与上下文。系统包含短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。实验显示,在OVO-Bench上Perception达82.0%,在StreamingBench上整体准确率达74.5%。需注意记忆写入成本随视频长度线性增长,且错误多源于检索证据区分度不足而非记忆缺失。