三分钟导读:FOLIO提出了一种无需训练的流式视频理解系统,通过动态焦点状态引导记忆写入,结合短期视觉缓冲与长期实体中心语义记忆,实现了高效且高精度的在线视频问答。
英文题目:FOLIO: Focused Semantic Memory for Streaming Video Understanding
论文出处:arXiv 每日论文精选 · arXiv:2607.13298
原始论文:PDF / 论文页面
对应视频标题:FOLIO:无需训练的流式视频聚焦语义记忆系统|推荐指数:★★★★★
这篇论文解决什么问题?
流式视频理解中,视频帧持续到达且查询随时可能发起,系统需在未知未来帧和查询的情况下,决定保留哪些信息并组织历史记忆,以解决记忆成本随流增长及冗余细节保留的问题。
核心创新
- 提出无需训练的聚焦语义记忆系统,通过动态焦点状态优先处理重要实体/动作,保持上下文紧凑。
- 设计混合记忆架构,结合短期视觉缓冲与长期实体中心语义记忆,并链接视觉证据缓存。
- 引入多轮交互条件焦点机制,利用前一轮查询更新焦点状态,指导后续记忆构建。
- 实现轻量级混合检索,结合结构化记忆直接匹配与语义查询扩展。
方法概览
FOLIO采用分段级在线记忆构建,利用动态焦点状态(Focus State)指导记忆写入:重要实体和动作记录详细细节,周围上下文保持紧凑。混合记忆包括短期视觉缓冲、长期语义记忆(实体账本)及视觉证据缓存。查询时采用轻量级混合检索,结合直接匹配与语义查询扩展。
逐图理解论文
FOLIO系统架构概览

FOLIO提出一种无需训练的聚焦语义记忆系统。其核心在于分段级的在线记忆构建,利用动态焦点状态指导记忆写入。系统混合了短期视觉缓冲、长期实体中心语义记忆及视觉证据缓存。查询时采用轻量级混合检索,结合直接匹配与语义查询扩展,实现高效的信息链接。
动态焦点状态引导写入

FOLIO的关键创新是动态焦点状态。对于每个视频片段,Writer VLM根据焦点状态决定记录详细程度。重要实体和动作记录详细细节,而周围上下文保持紧凑。在多轮设置中,前一轮查询会更新焦点状态,从而指导后续的记忆构建,确保系统关注用户可能关心的实体。
OVO-Bench单轮查询性能

在OVO-Bench单轮查询流测试中,FOLIO表现优异。使用Qwen3-VL-8B作为基座模型时,Perception任务准确率达到82.0%,Backward任务达到69.1%。这表明系统能够有效利用聚焦语义记忆,在复杂视频场景中准确识别实体和动作,并回答相关查询。
StreamingBench多轮查询性能

在StreamingBench多轮查询流测试中,FOLIO整体准确率达到74.5%。多轮交互条件焦点机制显著提升了性能,因为前一轮查询帮助系统更新焦点,更准确地构建后续记忆。消融实验表明,移除交互焦点会导致准确率下降,证明多轮增益不仅来自暴露历史查询,更来自其对记忆构建的指导。
系统成本与效率分析

FOLIO在效率上表现良好。Writer延迟约为每视频分钟7.5次调用,存储成本约为每视频分钟151-156 KB(未合并)。尽管采用了压缩策略,记忆写入成本仍随视频长度线性增长。实体级合并后的记忆库大小显著小于分段级记录,评估时需区分两者。
实验与关键结果
- 在OVO-Bench上进行单轮查询流测试。
- 在StreamingBench上进行多轮查询流测试。
- 进行记忆写入成本诊断、系统成本分析及组件消融实验。
- 在StreamingBench子集上进行长期在线记忆诊断和多轮焦点状态更新诊断。
- 在OVO-Bench上进行单轮查询流测试。
- 在StreamingBench上进行多轮查询流测试。
- 进行记忆写入成本诊断、系统成本分析及组件消融实验。
- 在StreamingBench子集上进行长期在线记忆诊断和多轮焦点状态更新诊断。
阅读时需要注意
- 错误主要源于检索到的证据不足以区分答案选项(如情绪、误导上下文、计数问题),而非记忆缺失。
- 在OVO-Bench的EPM和ASI任务中,相关实体常被检索但未能直接确立查询的过去状态或动作顺序。
- 移除交互焦点会导致准确率下降,表明多轮增益不仅来自暴露历史查询,更来自其对记忆构建的指导。
- 记忆写入成本随视频长度线性增长,尽管采用了压缩策略。
- 语义查询扩展在直接匹配不足时触发,增加了查询时的计算开销。
- 实体级合并后的记忆库大小显著小于分段级记录,评估时需区分两者。
关联工作
展开:论文全文中文翻译
以下译文用于快速探索和学习,技术术语按需要保留英文;正式引用和精确表述请以原论文为准。
第 1 页
FOLIO:面向流式视频理解的聚焦语义记忆
Haoyang Fan1 Dhruv Parikh1 Anvitha Ramachandran1 Sameh Gobriel2 Nilesh Jain2 Rajgopal Kannan3 Viktor Prasanna1 1南加州大学 (USC),美国加利福尼亚州洛杉矶 2英特尔实验室,美国 3美国陆军研究办公室DEVCOM {haoyangf,dhruvash,alramach,prasanna}@usc.edu
{sameh.gobriel,nilesh.jain}@intel.com
rajgopal.kannan.civ@army.mil
摘要 54, 80, 81, 85],但离线评估假设模型在回答前可以检查完整视频。流式视频理解则暴露了一种在线设置2026,其中视频流随时间到达,用户可以在任何时刻发起单轮或多轮查询。 在在线流式视频理解中,视频流持续到达,且查询可能在任何时间发出。 这种设置出现在自动驾驶 [46]、机器人辅助 [4] 以及增强现实/可穿戴智能体 [13] 等应用中,在这些场景中,系统必须在场景仍在展开时对其进行解释。14 由于流式帧的数量无限增长,系统必须持续压缩并保留来自已观测视频前缀的信息,而未来帧和未来查询仍然未知。核心挑战在于决定保留哪些信息以及如何组织维护的历史记录:随着历史记录随流式数据增长,记忆成本增加,且保留了许多冗余的视觉细节,而后续查询往往依赖于特定实体、动作及其时间变化。为了解决这一挑战,我们引入了 FOLIO,这是一种无需训练的聚焦语义记忆系统,它以更高的细节记录流式数据中的重要部分,同时保持周围上下文的紧凑性。随着流式数据的到达,FOLIO 在片段级别更新记忆,由动态焦点状态指导,将短期视觉缓冲区与围绕已观测实体组织并链接到视觉证据缓存的长期语义记忆相结合。在查询时,轻量级的混合检索将结构化记忆上的直接匹配与语义查询扩展相结合。FOLIO 在 OVO-Bench 上达到了最先进的性能,使用 Qwen3-VL-8B 时感知/回溯准确率分别达到 82.0/69.1,在 StreamingBench 上总体准确率达到 74.5,同时通过为聚焦实体保留详细记录并紧凑存储周围上下文,大幅降低了维护流式记忆的成本。 最近的基准测试 [18, 31, 40, 66, 68] 通过实时感知、回溯追踪和上下文多轮交互使这一约束显式化,其中模型必须回答可能已不可见的信息。 最近的工作通过改进视觉历史的保留、压缩或调度来解决这一挑战:近期窗口基线 [44]、令牌/缓存压缩 [8, 9, 21, 25, 48, 56, 63, 71, 78]、场景/事件/层次记忆 [29, 35, 58, 60, 74] 以及主动对话系统 [5, 10, 12, 26, 49, 55, 69, 73, 83]。这些方法通过压缩或调度视觉输入来避免保留所有传入帧,但其记忆单元通常是帧、令牌、缓存、窗口、场景或事件。首先,随着流式数据的持续,维护的历史记录继续增长,即使原始帧被压缩,记忆写入和后续检索也可能变得昂贵。其次,后续查询通常是稀疏且针对特定的,依赖于特定的实体、动作、事件及其随时间的变化,而非整个流式数据。第三,保留的历史记录通常围绕帧、窗口或事件组织,这会将与目标相关的信息分散在时间上,并迫使查询时
1
第 2 页
FOLIO:面向流式视频理解的聚焦语义记忆 来自 StreamingBench SQA 的样本(569 秒视频) 结合混合短期与长期语义记忆的焦点引导式写入 1 流式视频与记忆写入 2 FOLIO 长期语义记忆(对象账本) 3 轻量级混合检索与回答
对象 账本(记忆单元为对象) Causal observation Persistent Name Aliases Attributes Location chain Action chain Q3 @ t = 228s 上一问题中提到的人的对手目前的比赛得分是多少? shirt with front of table ○Ma → → servereturn Options: A. 2 B. 3 C. 1 D. 8 L. MaLong black“Ma Long CHN”, behind table Long → wipe / →drink paddle, mask bench (break) Player t = 40s t = 120s t = 272s t = 352s writer fires Question Router (semantic parse) shirt with foreground ○Fan time Z.D. FanZhengdong blue“Fan Z.D. CHN”, far Zhengdong (both fire per chunk, in sequence; subset shown here) score (integer) selection writing side of court→ → receiveserverally →→ Target:
paddle table • keyframe • memory Anchors: opponent, person in last question Player Adaptive keyframe selection (chunk = 8 s, up to 4 frames) Verbs: scored leaderboard OCR text, score dis- bottom-left ○Scoreboard Temporal: now = causal prefix up to t = 228s play, player names screen/text bottom-center→ [SCORES]FAN:0|MA:1 Ma Long Turn-state: Q2.subject = FAN, MA → Candidates: A.2 B.3 C.1 D.8 FAN:3|MA:1
→ ¼ Paddle TT paddle redblackrubber,handle held by both players heldstroke → Object Evidence Routing t = 196s ( visual change low ) t = 200s ( OCR change ) t = 228s ( action change ) wiped From Evidence Cache ball white, round over table ¼ From Ledger Ping pong TT Memory Writer (VLM, writer at t = 224s) on table → bounces,served, Cached Scoreboard frames, opponent(Ma Long)
Resolve returned Selected keyframes + focus state / compact object records = Fan Z.D. (relations graph) →detailed t ≤228s TT table red and white, center of court ready ¼ Table Latest [SCORES]: with net (static) in use →
Focus State (dynamic) Current Scene Concepts (aggregated, at t = 224s) MA:1 | FAN:3 | MA:1 | FAN:0 = 3 priorities (top-k, at Object Chains / Structured View t = 228s t = 200s players in foreground, holding paddles ⇒FAN t = 224s): • ○Ma L. 0.94 Scoreboard: bottom-left Ma L.: table Fan Z.D.: foreground Location chain: →bottom-center; →bench; →table scoreboard visible at bottom-left ○Fan Z.D. 0.91 • ○Scoreboard 0.87 Ma L. serves Z.D. receives L. rallies Z.D. serves Action chain: ¼ Olympic rings + TOKYO 2020 sign →Fan →Ma →Fan Paddle 0.62 Answer
生成器 • ¼ 乒乓球 球 0.48 马 L. Z.D. (对手),马 L.,范 Z.D. – 球拍 (持有),球拍 – 乒乓球 (击打) 关系:↔范 ¼ 范振东的当前比分是 3。 选中:B. 3 ¥ 正确 回合进行中;发球 乒乓球 0.40 • → 回球 ¼ 焦点层级:○ 焦点 支持
FOLIO 的不同之处 4 针对多轮流的交互条件焦点
FOLIO( ours ) [ 混合记忆:短期 先验事件记忆 先验 token / KV 记忆 视觉上下文 + 长期 结构化语义记忆 压缩视觉 token 或将流分割为事件 或 结构化的语义记忆(以实体为中心)并总结每个事件。 维护窗口化 KV 缓存。 Q1 @ t = 14s Q2 @ t = 202s Q3 @ t = 228s 丢失细粒度对象状态 “谁正在准备” “Q1 中的人现在的比分是多少?” “对手的比分 难以通过语义检索 •
焦点状态指导写入细节,将实体坍缩为事件,以服务于“现在球在哪里?”或“Q2中的人物是谁?”等问题。
• 转态:主语 = Ma L. • 难以在长视距下追踪对象(焦点状态 vs 紧凑状态) • 转态:主语 = – • 转态:主语 = Fan Z.D.
Q2 后的焦点状态: • 长视距下的实体身份、别名、位置/动作链、关系 • 视觉证据不可寻址 • 记分板(焦点状态,保留) • 每对象 Ma L.(焦点状态,0.94) • Fan Z.D.(焦点状态,…)
Q1 后的焦点状态: • 无明确的实体身份 • ↑OCR
Q3 后的焦点状态: • 示例:QueryStream, …
↑shifted) [SCORES] MA:1 (evidence) recoverable keyframe evidence Paddle (support, 0.62) Scoreboard (focus) examples: OASIS, StreamForest, • • • FluxMem, ReKV, InfiniPot-V [SCORES] FAN:3 pong ball (support, 0.48) (support) (evidence) •per entity EventMemAgent • Ping • Paddle • Table (context, 0.40) Ma L. (support, demoted) question time: lightweight hybrid • • •retrieval
上一轮问题中的术语会提升匹配对象的焦点分数;下一块内存写入器接收该提升后的状态,并为问题所引用的实体写入更丰富的细节。
图 1. FOLIO 概览。一种用于流式视频理解的免训练聚焦语义记忆系统。(1)在线逐段关键帧选择为聚焦引导的记忆写入提供视觉证据。(2)混合记忆将短期视觉缓冲区与链接到视觉证据缓存的长期语义记忆相结合。(3)在查询时,FOLIO 使用轻量级混合检索将查询与相关记忆和证据关联起来。(4)在多轮设置中,前一轮的查询会更新聚焦状态,以指导后续的记忆写入。
检索以重建相关的时间链,增加延迟和检索噪声。多轮交互进一步放大了这些问题,因为后续的查询是在更长的时间范围内提出的,并且可能会回到几轮之前引入的目标或事件。
为了解决这些问题,我们引入了 FOLIO,这是一种用于流式视频理解的免训练聚焦语义记忆系统(图 1)。其核心思想是聚焦记忆构建:重要的实体、动作和事件以更丰富的细节进行记录,而周围上下文则保持紧凑。随着数据流的到来,FOLIO 在段级别更新混合记忆,并由动态聚焦状态引导。混合记忆结合了短期视觉缓冲区(保持最近的观测结果可用)和长期语义记忆(实现为以实体为中心的结构化记忆)。长期记忆存储随时间变化的目标状态、位置、关系及相关事件,并将这些语义记录链接到视觉证据缓存,以便在需要时恢复相关帧。在查询时,FOLIO 使用轻量级混合检索,将结构化记忆上的直接匹配与语义查询扩展相结合。由于多轮查询通常围绕相同的实体或动作展开,前一轮的查询会更新聚焦状态,以便后续的记忆构建能够继续跟踪正在讨论的目标。FOLIO 在 OVO-Bench 和 StreamingBench 上提高了准确性和记忆写入效率,特别是在需要长时域定位、多轮指代消解或过滤视觉上合理的干扰项的查询中。我们的贡献如下:
- 我们将流式视频理解的在线记忆构建形式化为在未知未来查询的情况下,决定保留哪些信息以及如何组织已维护的历史记录。
- 我们引入了一种免训练的聚焦语义记忆系统,其动态聚焦状态优先为实体和动作提供更丰富的记忆更新,保持周围上下文紧凑,并提高多轮查询流中前一轮提及的目标的优先级。
- 我们设计了一种混合记忆和检索管道,结合了短期视觉缓冲区、长期以实体为中心的语义记忆、视觉证据缓存以及带有语义查询扩展的轻量级混合检索。
- 我们在 OVO-Bench 和 StreamingBench 上验证了 FOLIO,结果显示在显著提高准确性的同时,大幅降低了维护流式记忆的成本。
2
第 3 页
2. 相关工作 视频流。设 $V = \{f_t\}_{t \ge 1}$ 为视频流。在查询时间 $t_r$,系统仅能使用已观察到的前缀 $V_{\le t_r}$。我们将第 $r$ 个查询记为 $q_r = (u_r, Y_r, t_r)$,其中 $u_r$ 是自然语言查询,$Y_r = \{y_{1r}, \dots, y_{Kr}\}$ 表示可用时的答案选项。在多轮流中,该查询之前的对话历史为 $H_{r-1} = \langle(q_1, a_1), \dots, (q_{r-1}, a_{r-1})\rangle$。因此,在线答案必须基于已观察到的前缀和之前的对话历史生成,而不能使用未来帧或未来查询。
对于在线记忆构建,我们遵循常见的流式视频协议,将已观察到的视频视为片段流 [29, 50, 60]。随着帧的到来,记忆系统将固定持续时间的一组帧缓冲为下一个片段,并在该片段到达后更新记忆。这在形式上类似于离线视频分块,但在工作流程上有所不同:每个片段是在视频流展开过程中、在完整视频可用之前在线形成和处理的。设 $C_{1:T} = \langle C_1, \dots, C_T \rangle$ 表示有序片段流,其中每个片段 $C_i$ 是连续的一帧块。在处理片段前缀 $C_{1:i}$ 后,基于记忆流的系统维护一个在线记忆状态 $M_i$。此处,片段级构建指的是在线更新的粒度,而非要求长期记忆存储为片段笔记的扁平库。
在此设置下,FOLIO 实例化了聚焦语义记忆系统(图 2)。它通过片段级写入循环维护在线记忆状态 $M_i$ 和在线焦点状态 $F_i$。一旦片段 $C_i$ 到达,FOLIO 便从该片段中选择关键帧 $K_i$。给定之前的记忆 $M_{i-1}$ 和焦点状态 $F_{i-1}$,它分配写入级别:选定的实体和动作接收更详细的记录,而周围上下文则紧凑写入。基于选定的关键帧和写入级别,写入器 VLM 生成结构化记录,这些记录被合并到持久化记忆链中。写入器 VLM 仅负责记录生成;写入级别分配、实体合并和焦点状态更新由记忆系统处理。算法 1 总结了这一在线构建循环。
视频-LLM 和长视频理解。视频-LLM [2, 3, 11, 23, 24, 30, 38, 51, 52, 54, 62, 75, 81, 85] 和长视频系统 [1, 17, 27, 37, 41–43, 45, 47, 53, 59, 80] 通常假设在选择证据之前可以访问完整视频或查询;FOLIO 从已观察到的前缀在线写入记忆。
流式视频理解和交互。流式基准 [18, 31, 40, 66, 68, 70, 73] 和在线/主动/流式推理系统 [5, 6, 10, 12, 14, 16, 19, 20, 26, 32–34, 36, 49, 50, 55, 57, 61, 65, 69, 77, 79, 82, 83] 研究了在线观察、何时发言以及流式推理。这些系统探讨如何高效处理流、如何将训练与流式推理对齐,或模型应在何时响应。FOLIO 具有互补性:它探讨应保留哪些信息、如何组织这些信息,以及交互如何影响后续记忆构建。
流式视频的记忆、检索和压缩。先前的工作通过视觉 token、特征或 KV 缓存压缩 [7–9, 21, 25, 39, 48, 56, 63, 67, 71, 76, 78] 或最近帧窗口 [44] 来保留历史。另一类方法将历史组织为时间、场景、事件或分层记忆:OASIS 维护短和中等视觉窗口以及按需分层事件格式;StreamForest 构建持久的事件记忆森林;EventMemAgent 在事件中心记忆上添加自适应工具使用;而 Vista、Event-VStream 及相关系统使用场景或事件单元作为在线记忆抽象 [15, 29, 35, 58, 60, 74, 84]。
我们的区别。Token 和缓存方法保留计算状态,而场景和事件记忆保留时间单元。FOLIO 则围绕已观察到的实体组织长期语义记忆,随时间累积其状态、位置、关系、动作和相关事件,并将记录链接到视觉证据缓存。焦点状态进一步决定在在线写入期间哪些实体或动作获得更丰富的记忆更新,之前的轮次可以更新相同的焦点状态以供后续视频流片段使用。在查询时,FOLIO 使用轻量级混合检索,结合对结构化记忆的直接匹配和语义查询扩展(当直接匹配不足时)。这使得检索与结构化记忆保持关联,同时与最近的视觉上下文和事件级历史互补。对这四个领域的完整讨论见附录 C。
3. 方法
3.1. 问题设置与在线记忆构建
在线流式视频理解考虑随时间展开的视频,在任意时间发出查询。
3.2. 用于记忆写入的焦点状态
在写入器 VLM 为片段 $C_i$ 生成记录且记忆系统将其合并到 $M_i$ 后,FOLIO 为每个观察到的实体或动作 $o$ 更新焦点分数 $p_i(o)$。更新使用之前的焦点分数、当前片段中观察到的证据以及之前轮次的交互信号:
$$ p_i(o) = \text{clip}_{[0,1]} \left( \gamma p_{i-1}(o) + \alpha^\top \phi^+_i(o) – \beta^\top \phi^-_i(o) \right) \quad (1) $$
正特征 $\phi^+_i(o)$ 捕捉可见性、重新出现、状态或位置变化、事件参与,以及在多轮设置中来自之前轮次的交互相关性。负特征 $\phi^-_i(o)$ 捕捉消失和静态
第 4 页
回答:切碎的洋葱 问题@60s:在加入绞肉之前,平底锅里炒的是什么?
0s 8s 16s 24s 32s 40s 48s 54s 60s
a. 在线记忆写入 焦点状态 详细记录 b. 提问时检索 + 回答 当前 焦点 解析 查询 意图 𝐹𝐹𝑖𝑖−1 焦点 片段 支持 目标 炒 蔬菜 𝑧𝑧𝑞𝑞: Ψ𝑅𝑅 上下文 查询 编码器 紧凑 锚点 平底锅, 洋葱, 肉 Λ𝑖𝑖=焦点预算分配 𝐹𝐹𝑖𝑖−1 记录 𝐶𝐶𝑖𝑖 𝑞𝑞 洋葱) 𝑞𝑞=(语义 𝑢𝑢,解析器 𝑌𝑌𝑞𝑞, 𝑡𝑡𝑞𝑞→𝑧𝑧𝑞𝑞解析) 回答 合并与 对齐 VLM 视觉 焦点 动词 炒, 加入 解析 查询意图 LLM 到 预算
最终 𝑂𝑂𝑡𝑡 时间 之前/之后 记忆 𝑧𝑧𝑞𝑞 DropUpdateFocus 𝐹𝐹𝑖𝑖 (已分割 直接 写入器 读者 ො𝑦𝑦= 交互 类型 正 信号 计算 视觉编码器 分词器 记录 证据 缓存 (可见的, 外观, 等) 焦点 排序, 保留 候选项 A/B/C/D 选择 𝜒𝜒𝑞𝑞 𝜙𝜙+ →负 信号 信号 链接器→𝑅𝑅𝑜𝑞𝑞 近期𝑆𝑆𝑡𝑡 大语言模型 (缺失, 消失, 等) Top-𝐾𝐾 𝐵𝐵𝑡𝑡 长期 ∅或 帧 洋葱 𝜙𝜙−→ 关键帧 语义 链接 (VLM) 用于记忆写入的关键帧 写入器 VLM 𝑜𝑜1 𝑂𝑂𝑞𝑞=ifunresolved 目录映射 组装的证据块 命名 实体状态,动作链,
时间锚点,缓存帧引用 Ψ𝑊𝑊 pan Cached𝐵𝐵𝑡𝑡 target VLM辅助 𝐸𝐸𝑞𝑞: 𝐾𝐾𝑖𝑖 证据 长期记忆 短期视觉缓冲区 𝑜𝑜2 位置 链 动作链 名称 状态 编码器 分词器 视觉 𝑂𝑂𝑡𝑡 排序 LLM 排序后的实体 𝑆𝑆𝑡𝑡 洋葱 砧板 平底锅 切碎 添加 煎炒 肉 语义 链接 VLM (类型感知) 𝑂𝑂𝑞𝑞 𝑜𝑜3 排序后 与 𝑂𝑂𝑞𝑞 → → → 𝑜𝑜1, 𝑜𝑜2, 实体… , 𝑜𝑜𝐾𝐾子集 𝑓𝑓𝑡𝑡−3 𝑓𝑓𝑡𝑡−2 𝑓𝑓𝑡𝑡−1 𝑓𝑓𝑡𝑡 𝑂𝑂𝑡𝑡, 𝑆𝑆𝑡𝑡, 𝐵𝐵𝑡𝑡 𝑅𝑅𝑜𝑜𝑞𝑞 组装器 c. 焦点更新(多轮) 焦点 信号 匹配实体的示例 更新后的焦点状态 先前的焦点 轮次 交互 条件化 增强 胡椒 洋葱 平底锅 肉 焦点 (历史)
𝐹𝐹𝑖𝑖 (From Parsed Boost Focus Support 𝜙𝜙−) (𝜙𝜙+, Match Entities (w/ Rules & Weights) Context 𝑧𝑧𝑞𝑞) Drop
多轮 Boost
图 2. FOLIO 概览。一段流式烹饪视频在顶部运行,并在 $t_q=60$ 秒处附带一个示例查询。(a) 对于每个片段 $C_i$,写入器 VLM 在焦点引导的写入级别 $\Lambda_i = \text{BUDGET}(F_{i-1})$ 下生成详细/紧凑的记录,并更新混合记忆 $M_t = (S_t, O_t, B_t)$;$\text{UPDATEFOCUS}$ 从信号 $\phi^\pm_i$ 刷新 $F_i$。(b) 查询被解析为 $z_q$,链接到排序后的实体子集 $O_q$(带有 SEMLINK VLM 回退机制),组装成证据 $E_q$,并由回答 VLM 读取以产生 $\hat{y}$。(c) 在多个回合中,来自先前查询的匹配实体和动作对 $F_i$ 产生交互相关性信号,随后被反馈到 (a) 中。
算法 1 FOLIO 在线记忆构建 输入:视频流 $\{f_t\}_{t \ge 1}$,片段持续时间 $L$,写入器 VLM $W_\theta$ 1: 初始化记忆 $M_0 = (S_0, O_0, B_0)$,焦点状态 $F_0$, 当前片段 $C_{cur} \leftarrow \emptyset$,以及索引 $i \leftarrow 0$ 2: for each incoming frame $f_t$ do 3: 使用 $f_t$ 更新短期视觉缓冲区 4: 将 $f_t$ 追加到当前片段 $C_{cur}$ 5: while $C_{cur}$ 包含已完成的片段 do 6: $i \leftarrow i + 1$ 并从 $C_{cur}$ 提取 $C_i$ 7: 从 $C_i$ 中选择关键帧 $K_i$ 8: 根据 $F_{i-1}$ 和 $M_{i-1}$ 分配写入级别 $\Lambda_i$ 9: 使用写入器 VLM $W_\theta$,基于 $K_i$ 和 $\Lambda_i$ 生成记录 $\hat{U}_i$ 10: 将 $\hat{U}_i$ 合并到记忆链中,并将选定的关键帧追加到 $B_i$ 11: 为下一个片段更新焦点状态 $F_i$ 12: end while 13: end for
这些写入级别决定了分配给观察到的实体和动作的详细程度;它们并不阻止写入器 VLM 在选定的关键帧中出现时记录新观察到的实体。
3.3. 混合语义记忆结构
随着视频流的到达,FOLIO 持续更新一个混合记忆,该记忆结合了短期视觉缓冲区、长期语义记忆和视觉证据缓存。处理片段 $C_i$ 后,记忆状态为 $$M_i = (S_i, O_i, B_i), \quad (2)$$ 其中 $S_i$ 是短期视觉缓冲区,$O_i$ 是长期语义记忆(实现为以实体为中心的结构化记忆),$B_i$ 是视觉证据缓存。
短期视觉缓冲区。短期视觉缓冲区 $S_i$ 随着新帧的到达而更新,并保留最近的视觉上下文以供查询时回答使用。它保留了当前流状态的保真度高的证据,因为压缩的语义记录可能会丢失视觉细节。这一组件的动机来自近期帧基线研究,这些研究表明视觉窗口为实时流式查询提供了强大的短期信号 [44]。
长期语义记忆。长期语义记忆 $O_i$ 是由写入器 VLM 从选定的关键帧生成的以实体为中心的结构化记忆。在此,实体指流中视觉定位的对象或参与者,动作和事件存储为关联记录。背景行为。系数和阈值是固定的方法超参数,而非数据集特定的学习参数。
产生的焦点状态 $F_i$ 通过诱导下一个写入级别 $\Lambda_{i+1}$ 来指导后续的记忆写入:具有较高焦点分数的实体和动作接收更详细的记录,而周围上下文则作为紧凑的上下文记录写入。
第 5 页
每个实体条目保留身份字段,如规范名称、别名和类别,并随时间累积记录和关联事件。写入器 VLM 从选定的关键帧为观测到的实体生成结构化记录,包括其状态、位置、关系、可见文本(如有)以及指向视觉证据缓存的链接。在当前片段记录生成后,引用同一实体的记录被合并为 $O_i$ 中的记忆链,以跨片段跟踪状态、位置、关系和动作。
视觉证据缓存。视觉证据缓存 $B_i$ 按片段存储选定的关键帧及其时间戳,并将它们链接到相应的实体和事件记录。
3.4. 焦点引导的在线记忆写入
FOLIO 按片段写入记忆(图 2(a))。随着帧的到来,FOLIO 将它们累积在一个固定时长的在线片段中。一旦片段被观测完毕,它会被传递给自适应关键帧选择器,然后传递给写入器 VLM。对于片段 $i$,$\Lambda_i$ 中的写入级别指定哪些选定的实体和动作应获得更详细的记录,而周围上下文则以紧凑方式写入。关键帧选择器从观测片段中选择一个紧凑集合 $K_i$,作为写入器 VLM 的视觉证据。候选集包含边界帧、中间帧以及片段内视觉变化最大的探测帧。当片段视觉变化较小且没有选定实体需要额外视觉证据时,FOLIO 仅保留边界帧;否则,保留完整的候选集。选定的关键帧也会追加到视觉证据缓存 $B_i$ 中,以便后续恢复。
写入器 VLM 接收选定的关键帧以及 $\Lambda_i$,并生成结构化记录 $\hat{U}_i$。对于由焦点状态优先处理的实体和动作,写入器记录细粒度的状态和位置变化、与其他实体的关系、可见文本(如有)以及关联的动作或事件。对于周围上下文,它写入紧凑的上下文记录,保留实体名称、类别以及简短的位置/状态/关系备注。
每个片段结束后,FOLIO 在合并之前将写入器输出与现有的长期语义记忆 $O_{i-1}$ 对齐。记录通过基于名称、别名和类别的身份匹配规则进行合并,并使用简单的属性检查来避免不安全的合并。匹配的记录被追加到相应的记忆链中;否则,该记录开始一个新的实体条目,这减少了同一流中出现的相似对象的意外合并。更新后的记忆 $O_i$ 产生链视图 $G_i$,其中每个链按时间组织实体的位置、动作、关系、可见文本和状态变化。相同的选定关键帧作为可恢复的视觉证据追加到 $B_i$ 中,并链接到相应的实体或事件记录。
3.5. 轻量级混合检索与回答
当查询到达时,FOLIO 从迄今构建的混合记忆中检索证据(图 2(b))。FOLIO 首先将查询和答案选项中的实体和动作名称与长期语义记忆中的身份字段进行匹配,并对链接的实体记录、动作链和事件记录进行排序。由于这种匹配是在结构化字段而非原始纯文本上进行的,因此检索保持轻量级。当直接匹配不足时,FOLIO 使用语义查询扩展:一个轻量级的 VLM 辅助扩展步骤使用相同的 VLM 模型提出相关的实体或事件名称,然后将其与结构化记忆进行匹配。此扩展选择存储的证据;它不生成新证据。
然后,根据直接匹配或扩展匹配对匹配的记录进行排序。排序后,FOLIO 使用固定的相关性阈值来决定结构化记录是否提供足够的依据。如果没有记录超过此阈值,FOLIO 会从视觉证据缓存中恢复与排名靠前的记录链接的少量关键帧。这种保守的恢复步骤将缓存的帧作为视觉支持,而不是单独的检索源。
对于答案生成,回答 VLM 接收选定的结构化记录、短期视觉缓冲区以及任何恢复的关键帧。
3.6. 多轮查询的焦点状态更新
对于多轮查询流(图 2(c)),每个查询首先使用其到达时可用的记忆进行回答。如果某个片段仍在异步写入中,其长期记录不用于该回答;短期视觉缓冲区提供最近的视觉上下文。回答后,FOLIO 将查询和可用答案选项中的实体和动作名称链接到存储的实体、动作或事件。匹配的项目用作未来片段的交互证据,并有助于第 3.2 节中 $\phi_{+i}(o)$ 的交互相关性特征。未匹配的名称作为未解决的引用保留,仅当它们后来匹配观测到的实体或动作时,才会影响焦点状态。由于更新仅使用之前的轮次和迄今构建的记忆,因此它在不访问未来帧或后续查询的情况下改变未来的写入级别。
4. 实验
4.1. 实验设置
流式协议。我们在严格的在线流式协议下评估 FOLIO。视频作为有序片段流进行处理,每个查询仅使用观测到的片段前缀、从该前缀构建的记忆以及之前的对话历史进行回答。从不使用未来帧,答案选项仅在查询时提供。
第 6 页
表 1. 在完整 OVO-Bench 上的单轮查询流结果。对于 FOLIO,我们报告了使用 Qwen2.5-VL-7B 和 Qwen3-VL-8B 的结果;Avg 是任务列的算术平均值。
感知 回溯 模型 OCR ACR ATR STU FPD OJR Avg EPM ASI HLD Avg
Gemini 1.5 Pro 85.9 67.0 79.3 58.4 63.4 62.0 69.3 58.6 76.4 52.6 62.5 GPT-4o 69.8 64.2 71.6 51.1 70.3 59.8 64.5 57.9 75.7 48.7 60.8 LLaVA-Video-7B 69.1 58.7 68.8 49.4 74.3 59.8 62.3 56.2 53.5 51.5 53.7 LLaVA-OneVision-7B 66.4 57.8 73.3 53.4 71.3 62.0 62.0 56.2 55.4 21.5 43.7 Qwen2-VL-7B 40.4 50.5 63.8 47.2 66.3 53.6 51.0 48.7 35.5 45.0 43.7 Qwen2-VL-72B 65.8 60.6 69.8 51.7 69.3 54.4 61.9 52.5 60.8 57.5 57.0 Flash-VStream-7B 24.2 29.4 28.5 33.7 25.7 28.8 28.4 39.1 37.2 5.9 27.4 VideoLLM-online-8B 8.1 2.8 12.0 14.0 45.5 21.1 22.2 18.8 12.2 17.7 16.2 StreamChat‡ 51.7 47.7 58.6 41.0 61.1 47.8 50.1 50.2 54.1 37.6 47.4 Dispider 57.7 49.5 62.1 44.9 61.4 51.6 54.6 48.5 55.4 45.4 36.1 Qwen2.5-VL-7B 76.5 57.8 68.1 46.6 66.3 56.5 60.9 49.8 58.1 44.6 50.2 + OASIS 85.2 72.5 66.4 52.2 67.3 64.7 67.3 51.9 58.8 48.9 52.6 Qwen3-VL-8B‡ 83.9 58.7 70.7 56.2 69.3 64.1 66.8 51.2 60.8 43.6 51.2 + OASIS 92.0 80.7 81.0 67.4 67.3 79.9 78.1 62.0 60.1 47.3 57.2
Qwen2.5-VL-7B+ FOLIO 95.3 83.3 87.5 60.9 62.9 72.3 77.0 50.5 54.3 66.7 57.2 Qwen3-VL-8B+ FOLIO 96.7 85.7 85.7 70.6 62.5 90.9 82.0 59.0 63.6 84.6 69.1
多轮评估使用之前的模型预测结果,而非之前的真实答案。
基准测试。我们在 OVO-Bench [40] 和 StreamingBench [31] 上进行评估。OVO-Bench 提供单轮流式查询,包括关于当前时刻的感知查询(Perception queries)和需要恢复早期证据的回溯查询(Backward queries)。StreamingBench 评估多轮流式交互,其中后续查询可能指代之前的轮次或早期的视觉上下文。
模型与基线。我们使用 Qwen2.5-VL-7B 和 Qwen3-VL-8B 骨干网络评估 FOLIO。我们将 OASIS [29] 作为 OVO-Bench 上单轮流式 QA 的对比基线,并将 Think-While-Watching [50] 作为 StreamingBench 上多轮流式 QA 的对比基线。
VLM 设置。我们使用 vLLM [22] 为所有 VLM 提供服务,每个模型实例使用一个 GPU,并通过 OpenAI 兼容的多模态接口进行调用。在记忆写入、语义查询扩展和答案生成中的所有 VLM 调用均使用相同的配置,最大模型长度为 24K token。
硬件。所有实验均在 NVIDIA RTX 6000 Ada Generation GPU 服务器上进行,每个 GPU 配备 48 GB 内存和 960 GB/s 内存带宽。
4.2. 主要结果
单轮结果。表 1 报告了 OVO-Bench 的感知和回溯子集上的每项任务准确率。FOLIO 在两个骨干网络上均优于 OASIS,使用 Qwen2.5-VL-7B 时感知/回溯平均得分为 77.0/57.2,使用 Qwen3-VL-8B 时为 82.0/69.1。这种提升在回溯查询中尤为明显,其中更强的骨干网络使相对于 OASIS 的优势从 +4.6 个百分点扩大到 +11.9 个百分点。最大的改进出现在幻觉检测(HLD)上,这表明结构化记忆有助于区分实体或事件是否确实出现在观察到的流中。HLD 也从保守的答案校准中受益,因此我们单独报告它,并不将其作为记忆质量的唯一证据。主要的例外是 FPD,其中 FOLIO 略逊于 OASIS;该任务需要超出观察前缀进行外推,因此不太直接受益于记忆检索。
多轮结果。表 2 评估了记忆设计是否转移到 StreamingBench 完整的多轮流式交互中。FOLIO 优于在线骨干网络和最强的多轮基线 Think-While-Watching。最大的提升出现在 Realtime 和 OmniSource 上,其中长期语义记忆补充了对 evolving stream(演变中的流)查询的近期帧定位。SQA 仍然更具挑战性,因为许多查询需要解决前一轮的指代消解以及对屏幕上状态(如分数)的细粒度读取。这表明交互状态跟踪和详细状态捕获仍然是重要的改进方向。Proactive Output 包含在内是为了完整性,但我们将其视为一种面向时间的诊断指标,而非结构化记忆主张的主要证据。
6
第 7 页
表 2. 在完整 StreamingBench 上的多轮查询流结果。对于 FOLIO,我们报告了使用 Qwen2.5-VL-7B 和 Qwen3-VL-8B 的结果;各列分别报告任务族和总体准确率。
| Method | Realtime | OmniSource | SQA | Proactive | Overall | | :— | :— | :— | :— | :— | :— | | VideoLLM-online-8B | 35.99 | 28.45 | 30.80 | 3.92 | 32.48 | | Dispider-7B | 67.63 | 35.66 | 34.80 | 25.34 | 53.12 | | StreamAgent-7B | 74.28 | 36.26 | 39.60 | 28.90 | 57.02 | | Qwen3-VL-8B (online instruct) | 25.12 | 21.47 | 17.20 | 17.60 | 23.04 | | Think While Watching (Qwen3-VL-8B, multi-turn) | 74.40 | 37.47 | 50.00 | 40.00 | 58.82 | | Qwen2.5-VL-7B + FOLIO | 75.3 | 61.8 | 51.6 | 23.1 | 69.7 | | Qwen3-VL-8B + FOLIO | 81.2 | 63.6 | 54.8 | 51.6 | 74.5 |
表 3. 使用 Qwen3-VL-8B 在按问题类型比例采样的 500 查询 OVO-Bench Backward 分割上进行的记忆写入成本诊断。Merged bank 报告了合并段级记录后的序列化记忆大小。
| Variant | Acc. | Writer calls/min | Writer lat./chunk | Writer tokens / video (M) | Writer output tok./Q | Records /Q | Merged bank KB/Q | Accuracy (%) | | :— | :— | :— | :— | :— | :— | :— | :— | :— | | Fixed + uniform | 62.7 | 201.5K | 38.4K | | | | | | | Adaptive + uniform | 63.2 | 126.7K | 38.3K | | | | | | | Fixed + focus-guided | 65.9 | 207.3K | 26.4K | 179.2 | 154.9 | | | | | FOLIO (adaptive + focus-guided) | 67.1 | 134.7K | 26.2K | 178.3 | 153.4 | | | |
表 4. 使用 Qwen3-VL-8B 的系统成本。Writer 延迟按段测量;未合并记录报告实体级合并前段级记录的序列化大小,TTFT 在提问时测量。
| Segment length | Dataset | Writer calls/min | Writer lat./chunk | Unmerged rec. KB/min | VLM calls/Q | TTFT/Q | | :— | :— | :— | :— | :— | :— | :— | | 2s | OVO-Bench | 7.5 | 5.88s | 151.1 | 2.15 | 6.58s | | 4s | StreamingBench | 7.5 | 7.68s | 155.5 | 1.80 | 7.31s |
图 3. 在用于组件消融实验的 200 视频 StreamingBench 诊断子集上,使用 Qwen3-VL-8B 进行的块长度敏感性分析。条形图显示准确率,蓝色标记显示每个视频的记忆写入器输入标记数。
4.3. 系统成本
我们分析了在根据原始 Backward 问题类型比例采样的 500 查询 OVO-Bench Backward 诊断分割上的记忆写入成本。节省来自两个系统选择:聚焦语义记忆构建,它避免以相同的详细程度写入每个观察到的实体;以及自适应关键帧选择,它减少了发送给写入器 VLM 的视觉输入。表 3 将这些选择与固定视觉输入和均匀记忆写入进行了比较。相对于固定-均匀变体,FOLIO 将写入器输入标记减少了 33.2%,写入器输出标记减少了 31.8%,写入记录减少了 31.3%,合并记忆大小减少了 32.4%,同时在此诊断分割上将准确率提高了 4.4 个百分点。由于记录在实体级别进行合并,所有变体的合并记忆库都保持紧凑,但聚焦写入仍然减少了必须生成、合并和检索的文本量。
表 4 报告了当前 8s 自适应关键帧设置的典型运行时和存储成本。写入器每段调用一次,或每分钟视频约 7.5 次调用。在 8B 主干上,持久化的段级记录在实体级合并前以每分钟视频约 151–156 KB 的速度写入;最终合并的记忆库更小,如表 3 所示。提问时的回答使用 1.80–2.15 次 VLM 调用,TTFT 为 6.58–7.31 秒。在此设置下,写入器延迟为每段 5.88–7.68 秒,这使得记忆写入成为显著的系统成本,但并非唯一的延迟来源。该方法符合流式传输规范,批处理或更快的写入器和回答主干是实时部署的主要系统优化。完整的 7B/8B 系统统计信息见附录 H。
块长度敏感性。图 3 仅改变了记忆写入器在用于下方组件消融实验的相同 200 视频 StreamingBench 诊断子集上使用的观察段长度,该子集包含 1,000 次时间戳查询。较短的段更频繁地写入记忆,但这种额外成本并不能提高相对于默认 8s 设置的准确率。较长的段降低了写入器成本,但 32s 设置损失了 6.0 个百分点,因为每次记忆更新必须总结更大的时间间隔。因此,我们使用 8s 作为记忆质量和写入成本之间的默认权衡。
第 8 页
表 5. 在 200 查询 OVO-Bench Backward 划分上使用 Qwen3-VL-8B 进行问题时间证据消融实验。S/O/B 分别表示短期视觉缓冲区、长期语义记忆和视觉证据缓存帧。
| 消融设置 | Acc. (%) | Calls/Q | Input tok./Q (K) | | :— | :— | :— | :— | | w/o Recent Window | 32.4 | – | -38.6 | | w/o Focus Controller | 65.5 | – | -5.5 | | w/o Struct. Memory | 68.3 | – | -2.7 | | w/o Adaptive Visual | 68.3 | – | -2.7 | | w/o Interaction Focus | 69.7 | – | -1.3 | | Full | 71.0 | – | – |
| 设置 | Acc. (%) | Calls/Q | Input tok./Q (K) | | :— | :— | :— | :— | | S | 54.5 | 1.00 | 3.18 | | O | 42.6 | 1.54 | 1.54 | | B | 52.5 | 1.54 | 4.01 | | S + B | 50.5 | 1.54 | 6.94 | | S + O | 55.5 | 1.54 | 4.47 | | S + O + B | 50.5 | 1.54 | 7.86 | | FOLIO | 56.7 | 1.54 | 4.84 |
图 4. 在 200 视频 StreamingBench 诊断子集上使用 Qwen3-VL-8B 进行组件消融实验。条形图显示移除每个组件后的准确率;灰色数字报告相对于完整系统的下降幅度。
4.4. 消融实验
组件消融。图 4 在相同的 200 视频 StreamingBench 诊断子集上对主要的焦点-记忆组件进行了消融;完整的数值表见附录中的表 9。移除近期视觉窗口导致最大的性能下降,表明短期视觉证据对于边界和当前状态查询是不可或缺的。这是该方法的一个重要边界:FOLIO 并非旨在替代近期视觉定位,而是使早期实体及其历史变得可检索。由于采样的划分包含许多实时查询,主要有助于长时程记忆的组件在聚合效应上可能较小。在保留分块级事件/文本检索的同时移除结构化记忆,在此混合划分上的危害较小,因为许多查询仍可从局部或事件级证据中回答。移除焦点控制器或自适应视觉写入会降低准确率,这支持了显著性感知记忆写入和视觉证据选择的作用。交互焦点在此处的影响较小,因为此诊断划分中只有部分可评估查询需要多轮引用解析;下文的问题时间证据消融以及附录诊断进一步隔离了长时程记忆的行为。
问题时间证据消融。表 5 隔离了在 200 查询 OVO-Bench Backward 划分上由问题时间读取器使用的证据来源,该划分是根据原始 Backward 问题类型比例采样的。所有行使用相同的答案提示,仅在答案者可用的证据来源上有所不同;系统运行时成本见表 4。短期视觉缓冲区是一个强大的基线,但添加长期结构化记忆提高了准确率,且完整的检索策略在不统一追加缓存关键帧的情况下表现最佳。
消融综合与失败分析。综上所述,消融实验表明近期视觉证据仍然至关重要,且当问题的答案依赖于早期的实体历史而非仅当前的视觉状态时,长期结构化记忆最为有用。OVO-Bench Backward 证据消融是故意严格的:短期视觉缓冲区保持强劲,而添加长期记忆带来了适度的整体增益,并在 HLD 问题上带来了更清晰的增益。简单地将所有可用的证据源进行拼接并不可靠,尤其是当缓存的关键帧被统一追加时。附录 11 中的失败分类法进一步支持了这一解释。大多数剩余错误并非简单的记忆查找失败:在我们审查的 OVO-Bench 和 StreamingBench 错误中,“已写入但未检索到”类别为零,而主导案例涉及检索到的证据仍然不足或区分度不够。这指出了当前系统的两个实际限制:写入器有时会遗漏细粒度的状态或 OCR/分数证据,而答案器即使有相关记忆可用,也可能无法比较相似候选事件。
5. 结论
我们提出了 FOLIO,一种用于流式视频理解的免训练焦点语义记忆系统。FOLIO 以焦点状态在线写入记忆:选定的实体和动作接收更高详细程度的记录,而周围上下文保持紧凑。其混合记忆结合了近期视觉上下文、长期语义记忆和视觉证据缓存。在查询时,混合检索将查询链接到相关记忆记录,并在直接匹配不足时使用语义扩展。在 OVO-Bench 和 StreamingBench 上,FOLIO 提高了准确率并降低了记忆写入成本,表明流式视频记忆受益于聚焦写入而非单纯的时间压缩。
当前系统也指出了有用的下一步方向。写入器使用适用于状态、动作、关系和可见文本的通用模式,但特定领域的线索(如所有权变更或屏幕分数)可能需要更丰富的记忆字段。实现还使用了固定的分块边界,尽管某些流可能会从事件触发的分割中受益。最后,记忆写入仍然是主要
第 9 页
吞吐量瓶颈。未来的工作可以将基于焦点的写入与领域自适应记忆场、事件驱动分割以及更快的批量写入器相结合,以实现实时多流部署。
致谢
LLM 如 Claude Code、Codex 和 GPT 被用作通用助手,用于编码、实验、论文起草和格式排版。作者尽其所知验证了内容,并对其准确性负责。
参考文献
[1] Kirolos Ataallah, Xiaoqian Shen, Eslam Abdelrahman, Essam Sleiman, Mingchen Zhuge, Jian Ding, Deyao Zhu, Jürgen Schmidhuber, and Mohamed Elhoseiny. Goldfish: Vision-language understanding of arbitrarily long videos. In European Conference on Computer Vision, pages 251–267. Springer, 2024. 3, 15, 16
[2] Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, et al. Qwen3-vl technical report. arXiv preprint arXiv:2511.21631, 2025. 3, 15
[3] Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, Humen Zhong, Yuanzhi Zhu, Mingkun Yang, Zhaohai Li, Jianqiang Wan, Pengfei Wang, Wei Ding, Zheren Fu, Yiheng Xu, Jiabo Ye, Xi Zhang, Tianbao Xie, Zesen Cheng, Hang Zhang, Zhibo Yang, Haiyang Xu, and Junyang Lin. Qwen2.5-vl technical report, 2025. 1, 3, 15
[4] Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Xi Chen, Krzysztof Choromanski, Tianli Ding, Danny Driess, Avinava Dubey, Chelsea Finn, Pete Florence, Chuyuan Fu, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Kehang Han, Karol Hausman, Alexander Herzog, Jasmine Hsu, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Lisa Lee, Tsang-Wei Edward Lee, Sergey Levine, Yao Lu, Henryk Michalewski, Igor Mordatch, Karl Pertsch, Kanishka Rao, Krista Reymann, Michael Ryoo, Grecia Salazar, Pangang Sanketi, Pierre Sermanet, Jaspiar Singh, Anikait Singh, Radu Soricut, Huong Tran, Vincent Vanhoucke, Quan Vuong, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Jialin Wu, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, and Brianna Zitkovich. Rt-2: Vision-language-action models transfer web knowledge to robotic control. arXiv preprint arXiv:2307.15818, 2023. 1
[5] Joya Chen, Zhaoyang Lv, Shiwei Wu, Kevin Qinghong Lin, Chenan Song, Difei Gao, Jia-Wei Liu, Ziteng Gao, Dongxing Mao, and Mike Zheng Shou. Videollm-online: Online video large language model for streaming video. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18407–18418, 2024. 1, 3, 16
[6] Joya Chen, Ziyun Zeng, Yiqi Lin, Wei Li, Zejun Ma, and Mike Zheng Shou. Livecc: Learning video llm with streaming speech transcription at scale. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 29083–29095, 2025. 3, 16
[7] Xueyi Chen, Keda Tao, Kele Shao, and Huan Wang. Streamtom: Streaming token compression for efficient video understanding. arXiv preprint arXiv:2510.18269, 2025. 3, 16
[8] Yilong Chen, Xiang Bai, Zhibin Wang, Chengyu Bai, Yuhan Dai, and Ming Lu. Streamkv: Streaming video question-answering with segment-based kv cache retrieval and compression. In Proceedings of the AAAI Conference on Artificial Intelligence, pages 3120–3128, 2026. 1
[9] Shangzhe Di, Zhelun Yu, Guanghao Zhang, Haoyuan Li, Hao Cheng, Bolin Li, Wanggui He, Fangxun Shu, and Hao Jiang. Streaming video question-answering with in-context video kv-cache retrieval. In International Conference on Learning Representations, pages 42115–42127, 2025. 1, 3, 16
[10] Xin Ding, Hao Wu, Yifan Yang, Shiqi Jiang, Qianxi Zhang, Donglin Bai, Zhibo Chen, and Ting Cao. Streammind: Unlocking full frame rate streaming video dialogue through event-gated cognition. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 13448–13459, 2025. 1, 3, 16
[11] Chaoyou Fu, Yuhan Dai, Yongdong Luo, Lei Li, Shuhuai Ren, Renrui Zhang, Zihan Wang, Chenyu Zhou, Yunhang Shen, Mengdan Zhang, et al. Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pages 24108–24118, 2025. 1, 3, 15
[12] Shenghao Fu, Qize Yang, Yuan-Ming Li, Yi-Xing Peng, Kun-Yu Lin, Xihan Wei, Jian-Fang Hu, Xiaohua Xie, and Wei-Shi Zheng. Vispeak: Visual instruction feedback in streaming videos. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 21778–21788, 2025. 1, 3, 16
[13] Kristen Grauman, Andrew Westbury, Eugene Byrne, Zachary Chavis, Antonino Furnari, Rohit Girdhar, Jackson Hamburger, Hao Jiang, Miao Liu, Xingyu Liu, Miguel Martin, Tushar Nagarajan, Ilija Radosavovic, Santhosh Kumar Ramakrishnan, Fiona Ryan, Jayant Sharma, Michael Wray, Mengmeng Xu, Eric Zhongcong Xu, Chen Zhao, Siddhant Bansal, Dhruv Batra, Vincent Cartillier, Sean Crane, Tien Do, M. Doulaty, Pravallika Erapalli, Christoph Feichtenhofer, Adrian Fragomeni, Qichen Fu, Abrham Gebreselasie, Cristina Gonzalez, James Hillis, Xuhua Huang, Yifei Huang, Wenqi Jia, Wenqi Khoo, Jachym Kolář, Satwik Kottur, Anurag Kumar, Federico Landini, Chao Li, Yanghao Li, Karttikeya Mangalam, Rahul Modhugu, Jonathan Munro, Tushar Murrell, Takumi Nishiyasu, Will Price, Paola Ruiz, Merey Ramazanova, Leda Sari, Kiran Somasundaram, Audra Southernland, Yusuke Sugano, Jiarui Tao, Minh Vo, Yuchen Wang, Xindi Wu, Takuma Yagi, Yunyi Zhu, Pablo Arbelaez, David Crandall, Dima Damen, Giovanni Maria Farinella, Christian Fuegen, Bernard Ghanem, Vamsi Krishna Ithapu, C. V. Jawahar, Hanbyul Joo, Kris Kitani, Haizhou Li, Richard Newcombe, Aude Oliva, Hyun Soo Park, James M. Rehg, Yoichi Sato, Jianbo Shi, Mike Zheng Shou, Antonio Torralba, Lorenzo Torresani, Mingfei Yan, and Jitendra Malik. Ego4d: Around the world in 3,000 hours of egocentric video. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18419–18430, 2021. 1, 3, 15
9
第 10 页
IEEE/CVF 计算机视觉与模式识别会议论文集,第 18995–19012 页,2022。1
[14] Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, 和 Xiang Bai。视频流式思维:视频语言模型可以同时观看和思考。arXiv 预印本 arXiv:2603.12262,2026。3, 16
[15] Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawal 等人。Event-vstream:面向长视频流的基于事件驱动的实时理解。arXiv 预印本 arXiv:2601.15655,2026。3, 16
[16] Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, 和 Hao Sun。Wat:在线视频理解需要先观看再思考。arXiv 预印本 arXiv:2603.13412,2026。3, 16
[17] Bo He, Hengduo Li, Young Kyun Jang, Menglin Jia, Xuefei Cao, Ashish Shah, Abhinav Shrivastava, 和 Ser-Nam Lim。Ma-lmm:用于长期视频理解的记忆增强型大型多模态模型。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 13504–13514 页,2024。3, 15, 16
[18] Zhenpeng Huang, Xinhao Li, Jiaqi Li, Jing Wang, Xiangyu Zeng, Cheng Liang, Tao Wu, Xi Chen, Liang Li, 和 Limin Wang。在线视频理解:Ovbench 和 VideoChat-Online。在计算机视觉与模式识别会议论文集,第 3328–3338 页,2025。1, 3, 16
[19] Zhenpeng Huang, Xinhao Li, Jiaqi Li, Jing Wang, Xiangyu Zeng, Cheng Liang, Tao Wu, Xi Chen, Liang Li, 和 Limin Wang。在线视频理解:Ovbench 和 VideoChat-Online。在计算机视觉与模式识别会议论文集,第 3328–3338 页,2025。3, 16
[20] Junhyeok Kim, Min Soo Kim, Jiwan Chung, Jungbin Cho, Jisoo Kim, Sungwoong Kim, Gyeongbo Sim, 和 Youngjae Yu。Egospeak:学习在野外自主对话代理中何时说话。在计算语言学协会:NAACL 2025 发现论文集,第 2990–3005 页,2025。3, 16
[21] Minsoo Kim, Kyuhong Shim, Jungwook Choi, 和 Simyung Chang。Infinipot-v:面向流式视频理解的内存受限 KV 缓存压缩。神经信息处理系统进展,38:138983–139013,2026。1, 3, 16
[22] Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, 和 Ion Stoica。使用 PagedAttention 实现大型语言模型服务的高效内存管理。arXiv 预印本 arXiv:2309.06180,2023。6
[23] Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Luo 等人。Mvbench:一个综合性的多模态视频理解基准。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 22195–22206 页,2024。1, 3, 15
[24] KunChang Li, Yinan He, Yi Wang, Yizhuo Li, Wenhai Wang, Ping Luo, Yali Wang, Limin Wang, 和 Yu Qiao。VideoChat:以聊天为中心的视频理解。中国科学:信息科学,68(10):200102,2025。3, 15
[25] Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, 和 Tao Chen。Freshmem:面向流式视频理解的受脑启发的频域混合记忆。arXiv 预印本 arXiv:2602.01683,2026。1, 3, 16
[26] Wei Li, Bing Hu, Rui Shao, Leyang Shen, 和 Liqiang Nie。Lion-fs:作为在线视频助手的快慢视频语言思考者。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 3240–3251 页,2025。1, 3, 16
[27] Yanwei Li, Chengyao Wang, 和 Jiaya Jia。Llama-vid:一张图片在大语言模型中值两个标记。在欧洲计算机视觉会议,第 323–340 页。Springer,2024。3, 15
[28] Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, 和 Shu-Tao Xia。从逐字到要点:通过语义信息瓶颈蒸馏金字塔多模态记忆以用于长视界视频智能体。arXiv 预印本 arXiv:2603.01455,2026。16
[29] Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, 和 Guanbin Li。Oasis:面向流式视频推理的按需分层事件记忆。arXiv 预印本 arXiv:2604.17052,2026。1, 3, 6, 16, 20
[30] Bin Lin, Yang Ye, Bin Zhu, Jiaxi Cui, Munan Ning, Peng Jin, 和 Li Yuan。Video-llava:通过投影前的对齐学习统一的视觉表示。在 2024 年自然语言处理实证方法会议论文集,第 5971–5984 页,2024。1, 3, 15
[31] Junming Lin, Zheng Fang, Chi Chen, Haoxuan Cheng, Zihao Wan, Fuwen Luo, Ziyue Wang, Peng Li, Yang Liu, 和 Maosong Sun。StreamingBench:评估多模态大语言模型实现流式视频理解的差距。在 ICASSP 2026 – IEEE 国际声学、语音和信号处理会议 (ICASSP),第 12147–12151 页。IEEE,2026。1, 3, 6, 14, 16
[32] Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, 和 Xiaoyu Shen。边看边说:释放多模态大语言模型真正的实时视频理解能力。arXiv 预印本 arXiv:2601.06843,2026。3, 16
[33] Jihao Liu, Zhiding Yu, Shiyi Lan, Shihao Wang, Rongyao Fang, Jan Kautz, Hongsheng Li, 和 Jose M Alvare。StreamChat:与流式视频聊天。arXiv 预印本 arXiv:2412.08646,2024。16
[34] Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, 和 Jing Liu。流式视频中的思考。arXiv 预印本 arXiv:2603.12938,2026。3, 16
[35] Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, 和 Jianzong Wang。Vista:针对事后查询的流式视频问答的场景感知优化。在 AAAI 人工智能会议论文集,第 7539–7547 页,2026。1, 3, 16
[36] Xudong Lu, Yang Bo, Jinpeng Chen, Shuhan Li, Xintong Guo, Huankang Guan, Fang Liu, Dunyuan Xu, Peiwen Sun, Heyang Sun 等人。Aura:通过视频流实现始终在线的理解和实时辅助。arXiv 预印本 arXiv:2604.04184,2026。3, 16
10
第 11 页
[37] Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, et al. Video-rag: Visually-aligned retrieval-augmented long video comprehension. Advances in Neural Information Processing Systems, 38:168008–168033, 2026. 3, 15, 16
[38] Karttikeya Mangalam, Raiymbek Akshulakov, and Jitendra Malik. Egoschema: A diagnostic benchmark for very long- form video language understanding. Advances in Neural Information Processing Systems, 36:46212–46244, 2023. 1, 3, 15
[39] Zhenyu Ning, Guangda Liu, Qihao Jin, Chengwei Li, Wen- chao Ding, Minyi Guo, and Jieru Zhao. Livevlm: Efficient online video understanding via streaming-oriented kv cache and retrieval. arXiv preprint arXiv:2505.15269, 2025. 3, 16
[40] Junbo Niu, Yifei Li, Ziyang Miao, Chunjiang Ge, Yuanhang Zhou, Qihao He, Xiaoyi Dong, Haodong Duan, Shuangrui Ding, Rui Qian, et al. Ovo-bench: How far is your video-llms from real-world online video understanding? In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025. 1, 3, 6, 14, 16
[41] Rui Qian, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Shuangrui Ding, Dahua Lin, and Jiaqi Wang. Streaming long video un- derstanding with large language models. Advances in Neural Information Processing Systems, 37:119336–119360, 2024. 3, 15, 16
[42] Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, and Zheng Liu. Video-xl-2: Towards very long-video under- standing through task-aware kv sparsification. arXiv preprint arXiv:2506.19225, 2025. 15
[43] Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Bal- akrishnan Varadarajan, Florian Bordes, et al. Longvu: Spa- tiotemporal adaptive compression for long video-language understanding. arXiv preprint arXiv:2410.17434, 2024. 1, 3, 15
[44] Yujiao Shen, Shulin Tian, Jingkang Yang, and Ziwei Liu. A simple baseline for streaming video understanding. arXiv preprint arXiv:2604.02317, 2026. 1, 3, 4, 16
[45] Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, Tiejun Huang, and Bo Zhao. Video- xl: Extra-long vision language model for hour-scale video understanding. In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 26160–26169, 2025. 3, 15
[46] Chonghao Sima, Katrin Renz, Kashyap Chitta, Li Chen, Hanxue Zhang, Chengen Xie, Ping Luo, Andreas Geiger, and Hongyang Li. Drivelm: Driving with graph visual question answering. arXiv preprint arXiv:2312.14150, 2023. 1
[47] Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Feiyang Wu, Haozhe Chi, Xun Guo, Tian Ye, Yanting Zhang, et al. Moviechat: From dense token to sparse memory for long video understanding. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18221–18232, 2024. 3, 15, 16
[48] Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, and Tao Chen. Curvestream: Boosting streaming video understanding in mllms via curvature-aware hierarchical visual memory management. arXiv preprint arXiv:2603.19571, 2026. 1, 3, 16
[49] Haibo Wang, Bo Feng, Zhengfeng Lai, Mingze Xu, Shiyu Li, Weifeng Ge, Afshin Dehghan, Meng Cao, and Ping Huang. Streambridge: Turning your offline video large language model into a proactive streaming assistant. Advances in Neural Information Processing Systems, 38:132332–132359, 2026. 1, 3, 16
[50] Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu, Yulong Ao, and Jun Zhao. Think while watching: Online streaming segment-level memory for multi-turn video rea- soning in multimodal large language models. arXiv preprint arXiv:2603.11896, 2026. 3, 6, 16
[51] Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, et al. Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution. arXiv preprint arXiv:2409.12191, 2024. 1, 3, 15
[52] Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Ming Ding, Xiaotao Gu, Shiyu Huang, Bin Xu, et al. Lvbench: An extreme long video understanding benchmark. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 22958–22967, 2025. 3, 15
[53] Xiaohan Wang, Yuhui Zhang, Orr Zohar, and Serena Yeung- Levy. Videoagent: Long-form video understanding with large language model as agent. In European Conference on Computer Vision, pages 58–76. Springer, 2024. 3, 15, 16
[54] Yi Wang, Kunchang Li, Xinhao Li, Jiashuo Yu, Yinan He, Guo Chen, Baoqi Pei, Rongkun Zheng, Zun Wang, Yansong Shi, et al. Internvideo2: Scaling foundation models for mul- timodal video understanding. In European conference on computer vision, pages 396–416. Springer, 2024. 1, 3, 15
[55] Yueqian Wang, Xiaojun Meng, Yuxuan Wang, Jianxin Liang, Jiansheng Wei, Huishuai Zhang, and Dongyan Zhao. Vide- ollm knows when to speak: Enhancing time-sensitive video comprehension with video-text duet interaction format. arXiv preprint arXiv:2411.17991, 1(3):5, 2024. 1, 3, 16
[56] Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, and Linfeng Zhang. Acceler- ating streaming video large language models via hierarchical token compression. arXiv preprint arXiv:2512.00891, 2025. 1, 3, 16
[57] Yuxuan Wang, Yueqian Wang, Bo Chen, Tong Wu, Dongyan Zhao, and Zilong Zheng. Omnimmi: A comprehensive multi- modal interaction benchmark in streaming video contexts. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 18925–18935, 2025. 3, 16
[58] Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Xun Yang, Dapeng Wu, Xiangyu Chen, and Xuelong Li. Episodic memory representation for long- form video understanding. arXiv preprint arXiv:2508.09486, 2025. 1, 3, 16
[59] Ziyang Wang, Shoubin Yu, Elias Stengel-Eskin, Jaehong Yoon, Feng Cheng, Gedas Bertasius, and Mohit Bansal.
11
第 12 页
Videotree: 用于长视频推理的自适应基于树的视频表示。Dong,以及 Changsheng Xu。Livestar:面向现实世界在线视频理解的直播助手。神经信息处理系统进展,38:31266–31304,2026。3, 16
[60] Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, 和 Wenjun Wu。Eventmemagent:具有自适应工具使用的分层事件中心记忆,用于在线视频理解。arXiv 预印本 arXiv:2602.15329,2026。1, 3, 16
[61] Shiwei Wu, Joya Chen, Kevin Qinghong Lin, Qimeng Wang, Yan Gao, Qianli Xu, Tong Xu, Yao Hu, Enhong Chen, 和 Mike Zheng Shou。Videollm-mod:通过深度混合视觉计算实现高效的视频语言流式传输。神经信息处理系统进展,37:109922–109947,2024。3, 16
[62] Junbin Xiao, Xindi Shang, Angela Yao, 和 Tat-Seng Chua。Next-qa:问答的下一阶段,解释时序动作。在 IEEE/CVF 计算机视觉与模式识别会议论文集,第 9777–9786 页,2021。3, 15
[63] Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye, 和 Zuxuan Wu。Fluxmem:用于流式视频理解的自适应分层记忆。arXiv 预印本 arXiv:2603.02096,2026。1, 3, 16
[64] Haomiao Xiong, Zongxin Yang, Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Jiawen Zhu, 和 Huchuan Lu。具有记忆增强知识的流式视频理解与多轮交互。arXiv 预印本 arXiv:2501.13468,2025。15, 20
[65] Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Kelly Peng, Yao Lu, 和 Song Han。Streamingvlm:无限视频流的实时理解。arXiv 预印本 arXiv:2510.09608,2025。3, 16
[66] ShuHang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, LingHao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, 和 Xuming Hu。RTV-bench:通过实时视频对 MLLM 的连续感知、理解和推理进行基准测试。在神经信息处理系统第 39 届年度会议数据集与基准测试轨道,2026。1, 3, 16
[67] Yanlai Yang, Zhuokai Zhao, Satya Narayan Shukla, Aashu Singh, Shlok Kumar Mishra, Lizhu Zhang, 和 Mengye Ren。Streammem:面向流式视频理解的查询无关 KV 缓存记忆。arXiv 预印本 arXiv:2508.15717,2025。3, 16
[68] Zhenyu Yang, Yuhang Hu, Zemin Du, Dizhan Xue, Shengsheng Qian, Jiahong Wu, Fan Yang, Weiming Dong, 和 Changsheng Xu。Svbench:一个具有时序多轮对话的流式视频理解基准。arXiv 预印本 arXiv:2502.10810,2025。1, 3, 16
[69] Zhenyu Yang, Kairui Zhang, Yuhang Hu, Bing Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Weiming Dong, 和 Changsheng Xu。Livestar:面向现实世界在线视频理解的直播助手。神经信息处理系统进展,38:31266–31304,2026。1, 3, 16
[70] Zhenyu Yang, Kairui Zhang, Yuhang Hu, Bing Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Weiming Dong, 和 Changsheng Xu。Livestar:面向现实世界在线视频理解的直播助手。神经信息处理系统进展,38:31266–31304,2026。3, 16
[71] Linli Yao, Yicheng Li, Yuancheng Wei, Lei Li, Shuhuai Ren, Yuanxin Liu, Kun Ouyang, Lean Wang, Shicheng Li, Sida Li, 等。Timechat-online:80% 的视觉令牌在流式视频中天然冗余。在第 33 届 ACM 国际多媒体会议论文集,第 10807–10816 页,2025。1, 3, 16
[72] Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, 和 Sung Ju Hwang。Worldmm:用于长视频推理的动态多模态记忆智能体。arXiv 预印本 arXiv:2512.02425,2025。16
[73] Xueyang Yu, Cheng Shi, Yang Wang, 和 Sibei Yang。Eyes wide open:面向流式视频的主动自我视频-LLM。神经信息处理系统进展,38:13420–13463,2026。1, 3, 16
[74] Xiangyu Zeng, Kefan Qiu, Qingyu Zhang, Xinhao Li, Jing Wang, Jiaxin Li, Ziang Yan, Kun Tian, Meng Tian, Xinhai Zhao, 等。Streamforest:具有持久事件记忆的高效在线视频理解。神经信息处理系统进展,38:75804–75835,2026。1, 3, 16
[75] Hang Zhang, Xin Li, 和 Lidong Bing。Video-llama:一种用于视频理解的指令调整音频视觉语言模型。在第 2023 年自然语言处理实证方法会议论文集:系统演示,第 543–553 页,2023。3, 15
[76] Haowei Zhang, Shudong Yang, Jinlan Fu, See-Kiong Ng, 和 Xipeng Qiu。Hermes:将 KV 缓存作为分层记忆以实现高效的流式视频理解。arXiv 预印本 arXiv:2601.14724,2026。3, 16
[77] Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, 和 Xiaoyu Shen。Think-as-you-see:大视觉语言模型的流式思维链推理。arXiv 预印本 arXiv:2603.02872,2026。3, 16
[78] Kairui Zhang, Zhenyu Yang, Bing Wang, Shengsheng Qian, 和 Changsheng Xu。Querystream:通过查询感知剪枝和主动响应推进流式视频理解。在第十四届表示学习国际会议,2026。1, 3, 16
[79] Pan Zhang, Xiaoyi Dong, Yuhang Cao, Yuhang Zang, Rui Qian, Xilin Wei, Lin Chen, Yifei Li, Junbo Niu, Shuangrui Ding, 等。Internlm-xcomposer2.5-omnilive:一种用于长期流式视频和音频交互的综合多模态系统。arXiv 预印本 arXiv:2412.09596,2024。3, 16
[80] Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, 和 Ziwei Liu。从语言到视觉的长上下文迁移。arXiv 预印本 arXiv:2406.16852,2024。1, 3, 15
[81] Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, 和 Chunyuan Li。Llava-video:使用合成数据进行视频指令微调。arXiv 预印本 arXiv:2410.02713,2024。1, 3, 15
12
第 13 页
[82] Yichi Zhang, Xin Luna Dong, Zhaojiang Lin, Andrea Madotto, Anuj Kumar, Babak Damavandi, Joyce Chai, and Seungwhan Moon. 基于流式第一人称视频的前瞻性助手对话生成。在 2025年自然语言处理实证方法会议论文集,第12055–12079页,2025年。3, 16 [83] Yichi Zhang, Xin Luna Dong, Zhaojiang Lin, Andrea Madotto, Anuj Kumar, Babak Damavandi, Joyce Chai, and Seungwhan Moon. 基于流式第一人称视频的前瞻性助手对话生成。在 2025年自然语言处理实证方法会议论文集,第12055–12079页,2025年。1, 3, 16 [84] Minghang Zheng, Yuxin Peng, Benyuan Sun, Yi Yang, and Yang Liu. 用于准确且低延迟在线视频时间定位的分层事件记忆。在 IEEE/CVF国际计算机视觉会议论文集,第21589–21599页,2025年。3, 16 [85] Junjie Zhou, Yan Shu, Bo Zhao, Boya Wu, Shitao Xiao, Xi Yang, Yongping Xiong, Bo Zhang, Tiejun Huang, and Zheng Liu. Mlvu:一个全面的长视频理解多任务基准。arXiv预印本 arXiv:2406.04264,2(5): 6, 2024年。1, 3, 15
13
第 14 页
A. 补充概览
本补充材料提供了数据集详情、扩展的相关工作、额外的方法细节、额外的定量结果、定性分析、系统效率诊断以及提示模板。
B. 数据集
本附录描述了我们在主实验中使用的流式视频基准,重点介绍我们在第 4 节中报告结果的子集。
B.1. OVO-Bench
OVO-Bench [40] 是一个在线流式视频问答基准。给定在时间 $t_0$ 针对长度为 $t_{end}$ 的流式视频发出的文本查询 $Q_{t_0}$,每个问题被限制在流的一个特定时间窗口内,模型必须仅使用该窗口内可用的证据进行回答。设 $T$ 为区分“近期”和“较早”内容的近期阈值。OVO-Bench 将其问题划分为三种在线视频理解模式:实时视觉感知(Real-Time Visual Perception, RTV),它根据近期窗口 $X[t_0-T, t_0]$ 回答关于当前场景的问题;回溯(Backward Tracing, BT),它根据 $X[0, t_0-T]$ 回答关于较早内容的问题;以及前向主动响应(Forward Active Responding, FAR),它决定在将来内容 $X(t_0, t_{end}]$ 展开时何时响应。该基准包含跨越 644 个独特视频的 2,814 个问答对。
实时视觉感知(RTV)子任务。实时视觉感知评估模型能否感知、理解和推理当前时刻正在进行的视觉内容。我们报告每个子任务的准确率: • OCR – 光学字符识别:识别并解释帧内出现的字符(149 个问题)。 • ACR – 动作识别:识别并解释当前帧中个人正在执行的动作(109 个)。 • ATR – 属性识别:识别附近帧中物体的特征,如颜色、纹理或大小(116 个)。 • STU – 空间理解:推理附近帧中物体之间的空间关系(178 个)。 • FPD – 未来预测:预测当前场景最可能的后续阶段,包括物体状态、动作和其他动态元素的变化(101 个)。 • OJR – 物体识别:识别当前帧中出现的物体(184 个)。
回溯(BT)子任务。回溯评估模型能否回忆并推理流中早期发生的事件。我们报告以下任务的准确率: • EPM – 情景记忆:回溯并检索过去视频输入中的关键时刻(297 个问题)。 • ASI – 动作序列识别:识别过去流中人类动作的正确顺序(148 个)。 • HLD – 幻觉检测:回答那些故意与现有视频输入无关的问题,以暴露捏造行为(186 个)。
RTV 组探测写入器是否保持当前场景地址可达,而 BT 组探测以实体为中心的记忆是否在近期视觉窗口之外保留了实体级和事件级的证据。这两个要求直接对应 FOLIO 记忆的两个角色:用于当前时刻显著性的焦点引导记忆写入,以及用于回顾性回忆的持久化以实体为中心的记忆。
B.2. StreamingBench
StreamingBench [31] 是一个全面的流式视频理解基准,由 900 个视频和 4,500 个人工标注的问答对组成,涵盖八个视频类别。RTV 和 BT 使用单问题多选协议,而 FAR 使用不同的多查询、时间感知决策协议,该协议在密集采样的时间点触发重复推理。遵循流式同行中的常见做法,我们在 OVO-Bench 的完整 RTV 和 BT 子集上进行评估——即下面列出的九个多选子任务,总共 1,468 个问题,跨越 512 个独特视频——并将三个 FAR 子任务(REC、CRR、SSR)推迟到未来的工作中。
该基准将其 18 个子任务组织为流式视频理解的三个核心方面:实时视觉理解(10 个子任务,500 个视频,2,500 个问题)、全源理解(4 个子任务,200 个视频,1,000 个问题)和上下文理解(4 个子任务,200 个视频,800 个问题)。我们的表格报告了流式文献中最常比较的级别的准确率: • Realtime – 实时视觉理解中十个子任务的聚合准确率:物体感知、因果推理、片段摘要、属性感知、事件理解、文本丰富理解、前瞻性推理、空间理解、动作感知和计数。这些任务评估模型能否感知、识别并推理当前流中出现的视觉内容。 • OmniSource – 全源理解中四个子任务的聚合准确率:情绪识别、场景理解、来源判别和多模态对齐。这些任务要求整合流中同步的视觉和音频内容。
第 15 页
• SQA(顺序问答):上下文理解子任务,其中每个问题都直接关联到同一视频中先前问题所提及的实体或事件;模型必须利用对话历史的情景记忆来解决跨轮次的指代问题。 • Proactive(主动输出):主动输出(PO),一种上下文理解子任务,模型必须在视频流展开过程中自主决定何时发出规定的输出,而不是回答明确的问题。评估采用轮询协议,在真实输出时间附近的窗口内每秒查询一次模型。 • Overall(总体得分):报告的问题类别的综合得分。
在每个视频样本中,所有带时间戳的查询都是针对单个样本的长期语义记忆进行处理的,该记忆随着视频流的展开而增量构建(第3节)。因此,跨轮次的实体绑定是通过共享记忆而非仅通过提示的对话历史发生的,并且前一轮的查询会更新用于后续块写入记忆的焦点状态(多轮焦点更新)。我们报告主动输出以作完整性说明,但将其与主要的显式查询设置分开解释。主动输出主要测试响应时机,而 FOLIO 旨在使先前观察到的实体和证据可被显式查询寻址。
B.3. StreamBench
StreamBench [64] 是一个开放式流式视频问答基准,旨在评估随时间推移与记忆的多轮交互。给定在流式视频特定时间戳 $t_0$ 提出的自由形式自然语言问题 $Q_{t_0}$,模型必须仅使用直到 $t_0$ 观察到的视觉内容生成开放式答案。与 StreamingBench 不同,这里不提供多项选择选项:预测为简短的自然语言句子,并使用“LLM-as-judge”协议与真实参考进行评分。该基准涵盖三个视频来源——Ego(第一人称记录)、WebVideo(长格式网络片段,如烹饪节目和户外教程)和 Movie(短片片段)——每个来源的视频数量大致平衡。每个视频都配有五个或六个断点问题,放置在递增的时间戳上,因此同一视频上的连续问题与增量增长的视觉上下文形成自然的对话。
StreamBench 将其问题划分为六个子集,以探测互补的记忆和推理技能。我们报告每个子集的准确率: • SF(空间特征):识别近期帧中当前场景的属性,如物体、颜色、数量或绝对空间布局。 • OS(物体搜索):定位先前在视频中看到的物体(例如,“我在哪里可以找到黑色烤箱?”),要求模型从记忆中回忆该实体最后已知的位置,而不是在当前视图中重新发现它。 • SM(顺序记忆):回答关于同一场景中近期过去的事件或物体状态,包括“我刚才做 X 了吗?”或“X 刚才拿着什么”类型的问题。 • LM(长期记忆):回忆视频流早期发生的事实或事件,通常跨越场景边界或指代不再可见的物体(例如,“洗完菜板后我把菜板放在哪里了?”)。 • CI(因果推理):对累积上下文进行高层整体推理,例如“基于上下文,我在做什么?”或“视频的主题是什么?”。 • KG(知识 grounded):仅与视频松散关联的一般知识问题(例如,“冰箱中使用的主要制冷剂是什么?”、“为什么蔬菜是绿色的?”),主要依靠世界知识回答,在很大程度上独立于视觉流。
表 6 报告了每个子集的准确率以及算术平均总体得分,遵循 StreamBench 的报告惯例。这六个子集直接强调了 FOLIO 记忆管道的不同方面:SF 和 OS 探测焦点引导的记忆写入是否使当前场景可寻址,以及以实体为中心的记忆是否为每个实体保留了稳定的最后已知位置;SM 和 LM 分别探测记忆是否在短和长的时间间隔内保留了实体和事件级别的证据;CI 锻炼回答者将整个记忆聚合为连贯叙事的能力。
C. 扩展相关工作
本节提供与第2节压缩概述相对应的扩展相关工作讨论。
C.1. 视频大语言模型与长视频理解
大型视觉语言模型通过更强的视觉编码器、多模态对齐和视频指令微调,已从图像理解迅速发展到视频理解 [2, 3, 24, 30, 51, 54, 75, 81]。这些模型通常在离线视频基准上进行评估,这些基准测试时间推理、长上下文理解和多模态问答 [11, 23, 38, 52, 62, 85]。另一条互补的工作线通过扩展上下文长度或通过稀疏采样、时间池化、令牌压缩或自适应帧选择来减少视觉令牌,从而改进长视频处理 [27, 42, 43, 45, 80]。其他系统引入了记忆库、层次化表示或基于检索的长视频推理 [1, 17, 37, 41, 47, 53, 59]。这些工作为视频语言推理奠定了坚实的基础,但它们主要在离线
15
第 16 页
机制:模型、压缩器或检索器在决定使用哪些证据之前,可以访问完整视频、查询或两者。这一假设与流式视频理解不同,在流式视频理解中,帧随时间到达,且在构建记忆时未来查询是未知的。因此,FOLIO 针对的是不同的机制。FOLIO 并非为已知查询压缩完全可观测的视频,而是从已观察到的前缀在线写入记忆,并保留未来查询可能引用的已观察实体。
C.2. 流式视频理解与交互
流式视频理解应运而生,旨在评估模型处理在线视频并在任意时间戳回答问题的能力。OVO-Bench 研究实时感知、回溯追踪和前向主动响应;StreamingBench 评估实时视觉理解、全源理解和上下文交互 [31, 40]。SVBench、OVBench、RTV-Bench、OmniStar 和 ESTP-Bench 进一步将评估空间扩展到时间多轮对话、实时感知、在线视频对话和即时主动响应 [18, 66, 68, 70, 73]。这些基准测试表明,流式模型必须在保持与当前场景紧密关联的同时维持时间连续性。
越来越多的 Video-LLMs 通过专门的流式架构、训练目标和交互格式来解决这一在线设置问题。早期系统如 VideoLLM-online 引入了具有响应/静音决策的流式视频对话 [5],而后续模型通过深度混合计算、在线记忆缓冲区、逐帧解码或与流式对齐的训练来改进流处理 [6, 19, 33, 36, 49, 61, 65, 79]。另一个活跃方向侧重于主动交互:决定助手何时响应、保持沉默、中断或提供视觉指令反馈 [10, 12, 20, 26, 55, 57, 69, 73, 82, 83]。最近的推理导向模型也探索了边看边想、流式思维链以及将语言轨迹作为记忆 [14, 16, 32, 34, 50, 77]。
这些文献虽然相关,但研究的是与我们不同的维度。许多这些系统探讨的是如何高效处理流、如何将训练与流式推理对齐,或模型何时应该说话。FOLIO 则探讨应将哪些证据写入记忆,以便后续问题仍可回答。它与主动响应系统是互补的:前者决定何时响应,而 FOLIO 利用交互来决定哪些实体应以更详细的程度被记住。
C.3. 流式视频的记忆、检索与压缩
最接近的研究线探讨了如何在记忆和延迟约束下保留有用的历史。第一类方法在视觉令牌、特征或 KV 缓存的级别进行操作。QueryStream 使用查询相关性和时间新颖性剪枝令牌;FluxMem、FreshMem 和 CurveStream 使用邻接性、频域或基于曲率的标准维持自适应分层视觉记忆;TimeChat-Online、STC、ReKV、StreamKV、InfiniPot-V、StreamMem、LiveVLM、StreamingTOM 及相关方法压缩或检索视觉令牌和 KV 状态,以保持流式推理的高效性 [7–9, 21, 25, 39, 48, 56, 63, 67, 71, 76, 78]。SimpleStream 提供了一个重要的合理性基线,表明仅凭强大的近期帧在流式基准测试中即可具有竞争力 [44]。这些工作共同表明,保留和压缩是流式 Video-LLMs 的核心。
第二类方法将历史组织为时间场景、事件或分层记忆。OASIS 维护短和中等视觉窗口以及按需分层事件森林;StreamForest 构建持久的事件记忆森林;EventMemAgent 在基于事件的记忆上添加自适应工具使用;Vista 压缩和召回场景单元;Event-VStream 和分层事件记忆系统使用事件边界作为基本在线单元 [15, 29, 35, 60, 74, 84]。离线事件记忆系统如 Video-EM 同样展示了结构化情景记忆的价值,尽管它们是在访问完整视频和查询的情况下构建这些记忆的 [58]。
FOLIO 在记忆单元上与这两类方法不同。令牌和 KV 方法保留计算状态,但不暴露供后续引用的稳定实体。场景和事件记忆保留时间单元,但单个实体可能跨越多个事件持久存在,在不同描述中更改名称,在不同位置间移动,或通过别名或答案选项在后续被引用。FOLIO 转而存储持久的实体身份,并累积其属性、状态、位置、关系、动作链和证据点。这种实体级记忆使得流可以按照用户问题使用的相同术语进行寻址。
C.4. 结构化实体与世界记忆
几种近期方法超越了扁平的视觉令牌,转向结构化记忆。MA-LMM 和 MovieChat 为长视频理解引入了记忆库,而 VideoStreaming 和 VideoTree 为查询驱动的推理构建了紧凑或分层表示 [17, 41, 47, 59]。VideoAgent、Goldfish 和类 Video-RAG 系统将长视频视为检索语料库,在查询时选择相关的帧、片段或辅助文本信号 [1, 37, 53]。更近期的记忆代理方法,如 WorldMM 和 MM-Mem,为长视界视频推理构建多源记忆、知识图谱、视觉记忆或金字塔语义记忆 [28, 72]。这些工作展示了结构化视频记忆的潜力,尤其是当问题需要信息
第 17 页
分布在时间上的信息。
D.2. 关键帧选择与链式视图
对于每个片段 $C_i = [s_i, e_i]$,FOLIO 选择一个紧凑的关键帧集合 $K_i \subset C_i$。候选集包含边界帧、中间帧和高变化帧。对于在片段内采样的探测帧 $g_1, \dots, g_m$,视觉变化通过以下公式估计:
$$ \delta_j = \frac{1}{HW} \sum_{h,w} |g_{j+1}(h, w) – g_j(h, w)|, \quad (3) $$
高变化探测帧由 $j^\star_i = \arg \max_j \delta_j$ 选择。当片段的视觉变化较低且没有聚焦目标面临消失风险时,写入器仅保留边界帧;否则,它保留完整的候选集。
合并后的实体记忆被转换为链式视图:
$$ G_i = (\{O_i(o)\}_o, \{C^{act}_i(o)\}_o, R_i), \quad (4) $$
其中 $O_i(o)$ 存储带有位置周期的实体记录,$C^{act}_i(o)$ 存储动作链,$R_i$ 聚合跨实体关系三元组。这些链式视图是查询时检索模块使用的默认文本证据源。
D. 附加方法细节
本附录提供了第 3 节所述方法的算法细节。算法遵循正文中使用的符号。实验特定的常数、模型选择、提示和解码设置已在实验设置和提示附录中描述。
D.1. 在线长期语义记忆构建
算法 2 总结了长期语义记忆的构建过程。短期视觉缓冲区在帧级别单独维护;本算法详细说明了长期语义记忆、链式视图和视觉证据缓存。该算法按时间顺序处理视频前缀片段。每个片段选择关键帧,使用写入器 VLM 写入结构化记录,将记录合并到长期记忆中,更新焦点,并刷新链式视图。
算法 2 在线长期语义记忆构建
输入: 前缀 $V_{\le t}$,写入器模型 $W_\theta$,片段长度 $\Delta$ 输出: $M_t = (O_t, G_t, B_t)$,焦点 $F_t$
1: $O_0, G_0, B_0, F_0 \leftarrow \emptyset$ 2: $\{C_i\}_{i=1}^N \leftarrow \text{SEGMENT}(V_{\le t}, \Delta)$ 3: for $i = 1$ to $N$ do 4: $K_i \leftarrow \text{SELECTKF}(C_i, F_{i-1})$ 5: $\Lambda_i \leftarrow \text{ASSIGNWRITINGLEVELS}(F_{i-1})$ 6: $\hat{U}_i \leftarrow W_\theta(K_i, \Lambda_i)$ 7: $O_i \leftarrow \text{MERGE}(O_{i-1}, \hat{U}_i)$ 8: $B_i \leftarrow \text{UPDATECACHE}(B_{i-1}, K_i, \hat{U}_i)$ 9: $F_i \leftarrow \text{UPDATEFOCUS}(F_{i-1}, O_i, \hat{U}_i)$ 10: $G_i \leftarrow \text{BUILDCHAINS}(O_i)$ 11: end for 12: return $(O_N, G_N, B_N), F_N$
然而,大多数结构化记忆系统是离线的、查询条件驱动的或代理式的:它们通常在视频完全可用后才构建或遍历记忆,使用更重的工具栈,或依赖学习到的检索策略。FOLIO 专为在线流式模式设计。随着流的展开,它写入长期语义记忆,为实体记录保留可恢复的关键帧证据,并使用明确的目标、锚点、动词、时间范围和答案选项提及来选择证据。因此,FOLIO 将结构化记忆引入了流式视频理解的实体层面:核心记忆项不是片段、令牌、场景或事件,而是其历史可命名且可检索的观测实体。
D.3. 查询时混合检索与回答构建
算法 3 总结了证据选择过程。检索模块解析查询和答案选项,将查询提及链接到实体身份,并组装紧凑的证据块。当结构化链接未产生候选实体时,目录链接器通过语义查询扩展将查询映射到现有目录中的实体标识符。
算法 3 查询时证据选择
输入: $q = (u, Y_q, t_q)$,记忆 $M_{t_q}$,答案生成器 $\Psi_\phi$ 输出: 答案 $\hat{y}$
1: $z_q \leftarrow \text{PARSE}(u, Y_q)$ 2: $O_q \leftarrow \emptyset$ 3: for all $o \in O_{t_q}$ do 4: 计算 $R(o \mid q)$ 5: if $R(o \mid q) > 0$ then 6: $O_q \leftarrow O_q \cup \{(o, R(o \mid q))\}$ 7: end if 8: end for 9: 按分数对 $O_q$ 排序;保留前 K 个 10: if $O_q = \emptyset$ then 11: $O_q \leftarrow \text{SEMLINK}(z_q, \text{CAT}(O_{t_q}))$ 12: end if 13: $E_q \leftarrow \text{ASSEMBLE}(z_q, O_q, G_{t_q})$ 14: 从视觉证据缓存中选择最近的帧 $K^{rec}_q$ 和存储的帧 $K^{cache}_q \subseteq B_{t_q}$ 15: $\hat{y} \leftarrow \Psi_\phi(q, E_q, K^{rec}_q, K^{cache}_q)$ 16: return $\hat{y}$
第 18 页
D.4. 实体相关性评分
$$R(o | q) = \sum_{r \in T_q} w_T M(r, o) + \sum_{h \in H_q} w_H M(h, o) + \sum_{y \in Y_{key_q}} w_Y M(y, o) + \sum_{v \in V_q} w_V M(v, C_{actt_q}(o)) – w_B B(o). \quad (5)$$
其中 $M(\cdot, \cdot)$ 是规范名称、别名、类别、属性以及头名词之间带有同义词扩展的归一化匹配函数。项 $M(v, C_{actt_q}(o))$ 检查查询动词是否出现在实体的动作链中,而 $B(o)$ 是对无关背景实体的微小惩罚。具有正分数的实体经过排序和截断,形成候选集 $O_q$。
D.5. 实体匹配
实体匹配器旨在保持身份的稳定性的同时,允许跨片段的自然语言变化。对于新提及 $x$ 和现有实体 $o$,FOLIO 使用规范名称、别名、头名词、类别和部分字符串匹配来计算分数:
$$m(x, o) = \max(\lambda_{name}m_{name}, \lambda_{alias}m_{alias}, \lambda_{head}m_{head}, \lambda_{cat}m_{cat}, \lambda_{sub}m_{sub}). \quad (6)$$
这里 $m_{name}$ 检查规范名称是否相等,$m_{alias}$ 检查别名是否相等,$m_{head}$ 检查头名词是否一致,$m_{cat}$ 检查类别是否一致,$m_{sub}$ 检查规范名称之间的包含关系。当 $m(x, o) \ge \tau_m$ 时接受匹配。
匹配器还提取一组判别性修饰符 $D(x)$ 和 $D(o)$,例如颜色或其他身份承载属性。对于仅基于头名词或部分名称的弱匹配,当 $D(x) \cap D(o) = \emptyset$ 且 $D(x), D(o) \neq \emptyset$ 时,抑制该匹配:
$$D(x) \cap D(o) = \emptyset, \quad D(x), D(o) \neq \emptyset. \quad (7)$$
这防止了两个具有相同头名词但不同颜色的不同实体被合并到一个实体槽中。
D.6. 焦点更新与写入级别
焦点更新使用两组特征。正特征包括可见性、首次出现、重新出现、持久性、事件参与、移动、状态变化、可操纵目标状态以及交互条件相关性。负特征包括缺失、长期消失和静态背景行为。分数更新为:
$$\pi_i(o) = \text{clip}_{[0,1]}(\gamma \pi_{i-1}(o) + \Delta_i(o)), \quad (8)$$
其中
$$\Delta_i(o) = \alpha^\top \phi^+_i(o) – \beta^\top \phi^-_i(o). \quad (9)$$
这里 $\phi^+_i(o)$ 和 $\phi^-_i(o)$ 是上述的正负特征向量。系数是固定的方法超参数,而非学习参数。
写入级别由确定性规则分配,该规则将每个实体映射到 VLM 写入器使用的四个标签之一:
$$\lambda_i(o) = \begin{cases} \text{focus}, & \text{高优先级}, \\ \text{support}, & \text{有用证据}, \\ \text{context}, & \text{场景锚点}, \\ \text{drop}, & \text{否则}. \end{cases} \quad (10)$$
仅列出有限数量的焦点实体进行详细写入,而支持实体和上下文实体则列出进行紧凑写入。首次出现证据规则保留了对于新可见的操作实体、工具、容器、电器、文本区域和异常实体的开放世界发现能力。
D.7. 多轮焦点更新详情
本节扩展第 3.6 节中描述的多轮焦点机制。当查询 $q_j$ 到达时,FOLIO 从其目标、锚点和答案选项提及中提取一组焦点术语 $\Gamma_j$。每个术语都与当前的以实体为中心的内存进行匹配。匹配的实体在 $\Omega_i(o)$ 中获得一个交互方面,并获得焦点提升 $\pi_i(o) \leftarrow \text{clip}_{[0,1]}(\pi_i(o) + \eta_q \mu_j(o))$,其中 $\mu_j(o) = \mathbb{1}[o \in \text{Match}(\Gamma_j, O_i)]$ 是查询术语匹配指示符。尚未匹配任何实体的术语被放入待定集合 $P_{pend_i}$,并在后续片段写入后重试。如果待定术语后来匹配到新观察到的实体,则该实体获得延迟提升 $\pi_i(o) \leftarrow \text{clip}_{[0,1]}(\pi_i(o) + \eta_p \nu_i(o))$,并在适当时将术语添加为别名;这里 $\nu_i(o) = \mathbb{1}[o \in \text{Match}(P_{pend_i}, O_i)]$ 是待定术语匹配指示符。
D.8. 记录字段模式
持久实体槽(长期记忆条目)。长期实体内存 $O_t$ 中的每个槽存储 $o_j = (id_j, n_j, N_j, c_j, a_j, X_j, E_j)$:一个稳定的标识符 $id_j$、规范名称 $n_j$、别名集合 $N_j$、类别 $c_j$、属性集合 $a_j$、观察序列 $X_j$ 和事件序列 $E_j$。观察记录可见时的时间跨度、位置、支持或载体实体、状态、关系、文本证据、置信度以及对 $B_t$ 中实体特定关键帧的引用。事件记录时间跨度、动作类型、摘要、参与者和更改的实体。
写入器 VLM 每个片段发出三种类型的记录,这些记录通过合并步骤馈送到上述的槽字段。
18
第 19 页
详细的实体记录 包含身份(规范名称、别名、类别)、属性、位置、可见时的支撑或载体实体、状态、关系、交互、状态变化、证据文本以及关键帧引用。对于带有文本的证据(记分牌、屏幕文字、球衣号码),写入器还会保留表面文本作为线索。
紧凑的实体记录 包含相同的身份字段,以及单条简短的位置/状态/关系备注和关键帧引用。
事件记录 总结动作及其参与者和任何发生变化的实体,并附加到片段时间戳和参与实体的标识符上。
D.9. 查询类型分类法
解析查询 $z_q$ 中的查询类型字段 $\chi_q$ 取自固定分类法:空间(spatial)、历史位置(historical-location)、当前位置(current-location)、交互(interaction)、属性(attribute)、是/否(yes/no)、幻觉检测(hallucination-detection)和概念查询(concept queries)。每种类型选择不同的证据组装策略(附录 D.10)。
D.10. 按查询类型的证据组装
ASSEMBLE 内的证据选择由来自 $z_q$ 的查询类型 $\chi_q$ 参数化。组装后的块始终包含解析后的查询上下文、目标和答案选项支持,以及简短的场景概述;特定类型的选择额外添加:
- 交互(Interaction): 目标和支持锚点的动作链事件及参与者链接。
- 当前位置(Current-location): 目标实体的最新位置时段。
- 历史位置(Historical-location): 目标实体直至 $t_q$ 的完整位置链。
- 属性(Attribute): 存储的属性及视觉描述符。
- 空间(Spatial): 涉及目标实体的关系三元组。
- 是/否和幻觉检测(Yes/no and hallucination-detection): 存在性证据,以及指示目标是否出现在 $O_{t_q}$ 中的覆盖标签。
- 概念(Concept): 通过实体目录链接获得的间接证据。
当答案选项与组装上下文中的实体或事件一致时,证据行可标记为答案选项支持。
E. 额外的数据集结果
StreamBench 提供了与 OVO-Bench 和 StreamingBench 互补的评估设置:其问题是开放式的,任务空间更多样,且多轮交互模式约束较少。遵循官方协议,我们报告基于语义相似度的准确率,并使用 LLM-as-judge 评估器。如表 6 所示,FOLIO 在相同的 Qwen3-VL-8B 模型上,相比骨干网络和 OASIS 记忆基线有了显著提升。最大的增益出现在短期记忆(SM)、长期记忆(LM)和空间特征(SF)上,这表明以实体为中心的记忆有助于在自由形式的交互中实现近期的定位和历史的检索。在知识 grounded(KG)上的改进表明,检索到的记忆并不会阻止回答者在答案仅松散锚定于视频时使用其语言先验。总体而言,这些结果通过展示 FOLIO 在答案空间比多项选择题更不受约束时仍然有效,从而补充了主要基准测试的结果。
对于表 6,已发表的基线遵循其报告中的帧设置。我们复现的 Qwen/OASIS 行使用 0.5 fps 采样,而 FOLIO 使用 1 fps 在线记忆构建。
要点: 在相同的 Qwen3-VL-8B 骨干网络上,FOLIO 将总分从 62.1 提高到 70.6(+8.5 个百分点)。SF、SM 和 LM 上的增益与以实体为中心的记忆的作用相一致:它使当前的视觉细节可寻址,保留近期的状态变化,并支持从流的早期部分进行检索。
E.1. 额外的效率和消融表
F. 定性案例研究
我们包含三个代表性示例,以说明在查询时如何使用以实体为中心的记忆,以及错误仍然出现在何处。我们包含样本标识符,以便分析可追溯至发布的元数据。
StreamingBench 多轮示例。案例 1:StreamingBench SQA,魔术表演交互(sample_1,5 轮)。结果:5 轮中正确 4 轮。失败轮次:question_idx=34,在 273 秒处;真实标签是碰拳(fist bump),预测是击掌(high-five)。早期的片段记录了一名穿着黑色夹克内搭白色衬衫的男子,以及附近一名穿着黑色衬衫的男子。这支持了前两轮:模型正确回答了中心人物穿着黑色夹克内搭白色衬衫,并随后解析出他正在与穿深色衬衫的男子互动。在视频后期,以实体为中心的记忆还追踪了该男子在改变位置后的情况,并记录他穿着深色衬衫和浅色裤子,最近的画面显示他手持一个带有黑色边缘的白色相框,里面有四张扑克牌;这些支持了后来正确的轮次。失败发生在短暂的社会手势上:真实标签动作是两人碰拳,而预测是击掌。272–280 秒左右的相关片段记忆仅粗略地将该动作存储为“拍手”/“一起拍手”。因此,查询时的读取器检索到了正确的人,但没有足够精确的动作状态,回答者将模糊的手势映射到了错误的选项。这是一个记忆粒度失败导致的错误。
19
第 20 页
表 6. StreamBench [64] 上的结果。我们报告了六个问题子集上的准确率 (%) 以及它们之间的宏平均值。‡ 表示由我们复现的结果,其他结果来自先前的工作。Avg 表示六个子集的算术平均值。每列中的最佳得分以粗体高亮显示。
模型 OS LM SM CI KG SF Avg
GPT-4o 60.5 61.2 64.4 72.3 93.9 74.7 71.0 LLaMA-VID 33.9 38.2 44.1 58.4 76.9 57.1 51.2 LLaVA-Hound 37.6 43.2 53.4 55.7 76.3 62.0 54.7 LongVA 41.1 47.4 57.6 59.8 80.7 66.1 52.4 MiniCPM-V2.6 37.6 51.9 43.7 65.7 66.2 64.2 56.6 VILA-1.5 36.1 44.4 50.8 68.3 78.6 65.5 57.1 InternVL2 38.5 46.6 50.9 67.6 81.0 62.2 57.6 InternLM-XComposer2.5 38.8 43.3 50.8 65.6 88.4 60.5 57.7 MovieChat 18.6 20.4 26.5 42.3 67.2 35.8 35.3 FreeVA 35.6 37.5 43.7 58.8 84.0 53.7 56.3 Video-online 41.4 48.8 52.9 62.7 69.2 64.1 56.4 Flash-VStream 37.1 44.5 48.6 58.1 66.4 59.2 52.1 StreamChat 40.7 43.6 47.1 63.0 89.1 73.8 59.5
Qwen2.5-VL-7B 36.1 41.3 41.0 50.5 76.5 62.3 51.1 + OASIS [29] 35.9 39.4 44.1 54.5 76.9 64.9 52.4
Qwen3-VL-8B‡ 33.8 50.5 47.8 69.4 73.5 62.6 56.0 + OASIS [29] 47.0 53.6 54.3 71.7 86.1 67.6 62.1 Qwen3-VL-8B + FOLIO‡ 44.4 64.7 66.7 64.7 94.7 88.2 70.6
表 7. 500 查询 OVO-Bench 反向分割上的记忆写入成本诊断。本表镜像主论文中的诊断内容,并包含在此处以保持补充效率表的自包含性。表 8. 按组件调用划分的令牌预算。记忆写入输入令牌是根据提示文本加上图像令牌近似值估算的;查询时间令牌计数是根据保存的文本提示和响应计算的。
变体 Acc. 输入 输出 记录/查询 银行 KB/查询 (%) tok./Q tok./Q 组件 平均输入令牌/调用 平均输出令牌/调用 固定 + 均匀 62.7 201.5K 38.4K 259.7 226.8 FOLIO writer VLM 6.4k 572.4 自适应 + 均匀 63.2 126.7K 38.3K 259.6 226.5 语义查询扩展 824.6 627.2 固定 + 焦点引导 65.9 207.3K 26.4K 179.2 154.9 回答器 1071.0 147.2 FOLIO 67.1 134.7K 26.2K 178.3 153.4
OVO-Bench correct example. Case 2: OVO-Bench OCR, correct (video_id=1442, 而非未来泄漏问题:所有证据均来自查询时间戳之前的 块,但写入的状态过于粗略,无法区分击掌和高五。 question_id=m14s100_035). 查询:哪个品牌 名称反复出现在侧板上?GT = C / Yokohama, Pred = C / Yokohama。块级记忆
20
第 21 页
表 9. StreamingBench 诊断运行上的记忆组件消融及查询时行为。准确率是下游 QA 在 145 个可评估多项选择查询上的准确率。Calls/Q 报告每个查询的平均 VLM 调用次数,包括回答器和 VLM 辅助语义查询扩展。Memory hit(记忆命中率)是检索到结构化记忆的查询比例,Semantic expansion(语义扩展)是调用 VLM 辅助语义查询扩展的比例,Cache trigger(缓存触发)是将来自视觉证据缓存的链接关键帧添加到回答输入中的比例。全系统查询时行为是从保存的全方法诊断日志中计算的,而消融行使用相应的保存的消融日志。
| Variant | Acc. | Calls/Q | Frames/Chunk | Memory hit | Semantic expansion | Cache trigger | | :— | :— | :— | :— | :— | :— | :— | | Full FOLIO | 71.0 | 1.70 | 3.83 | 95.9% | 75.2% | 2.1% | | w/o Recent Window | 32.4 | 1.70 | 3.83 | 96.6% | 69.7% | 1.4% | | w/o Structured Memory | 68.3 | 1.00 | 3.80 | 96.6% | 0.0% | 0.0% | | w/o Focus Controller | 65.5 | 1.46 | 3.80 | 96.6% | 45.5% | 0.0% | | w/o Adaptive Visual Writing | 68.3 | 1.66 | 4.00 | 96.6% | 65.5% | 1.4% | | w/o Interaction Focus | 69.7 | 1.69 | 3.84 | 96.6% | 69.0% | 1.4% |
表 10. OVO-Bench Backward 诊断分割上额外的查询时证据消融。S 表示短期视觉缓冲区,O 表示长期语义记忆,Exp 表示 VLM 辅助语义查询扩展,B 表示来自视觉证据缓存的关键帧证据。当使用语义查询扩展时,Calls 包括语义查询扩展。FOLIO 行是基于同一诊断分割中成功完成的查询计算的。此扩展附录表将直接结构化记忆检索与语义查询扩展和缓存关键帧证据分开,而主论文报告了相同证据源分析的压缩版本,其中 O 对应于本表中的 O+Exp。输入令牌、端到端延迟和 TTFT 是在整个查询时管道上测量的。
| Setting | Acc. (%) | Calls/Q | Input tok./Q (K) | E2E/Q (s) | TTFT/Q (s) | | :— | :— | :— | :— | :— | :— | | S | 54.5 | 1.00 | 3.18 | 8.11 | 2.72 | | O direct | 41.0 | 1.00 | 1.47 | 12.51 | 6.56 | | O + Exp | 42.6 | 1.54 | 1.54 | 12.84 | 6.58 | | B | 52.5 | 1.54 | 4.01 | 14.14 | 8.68 | | S + B | 50.5 | 1.54 | 6.94 | 13.52 | 7.70 | | S + O direct | 52.5 | 1.00 | 4.39 | 12.29 | 6.53 | | S + O + Exp | 55.5 | 1.54 | 4.47 | 12.81 | 6.72 | | S + O direct + B | 50.0 | 1.00 | 7.67 | 16.05 | 8.95 | | S + O + Exp + B | 50.5 | 1.54 | 7.86 | 16.78 | 9.30 | | FOLIO | 56.7 | 1.54 | 4.84 | 12.89 | 6.80 |
查询时读者检索摩托车条目,因为语义查询扩展将“bike seat”链接到 motorcycle/seat 记忆。当表面措辞与记忆名称不同时,这种扩展是有用的,但在这里它也创造了一种失败模式:检索到的记忆证明了摩托车座垫的存在,但它从未在打开之前建立之前的位置。回答器从检索到的实体过度推断,预测为“on the scooter”而不是弃权。这说明了为什么幻觉检测查询不仅需要检索相关实体,还需要检查检索到的证据是否直接支持查询的事实。
结论。这些案例表明,当所需证据被明确写入并检索到时,FOLIO succeeds,但当记忆相关但证据不足,或者当简短交互以过于粗糙的粒度写入时,FOLIO 会失败。
48–56s: signboard, attributes: YOKOHAMA logo, location: along the track, evidence summary: YOKOHAMA signboard is visible.
OVO-Bench failure example. Case 3: OVO-Bench HLD, failure (video_id=375, question_id=m14s100_064). Query: Where was the bike seat before I opened it? GT = B / Unable to answer, Pred = D / on the scooter. The observed stream shows motorcycle repair, and the memory contains related but insufficient evidence:
0–8s: motorcycle, attributes include black seat; 64–72s: person adjusts the motorcycle seat; 128–136s: fuel tank is open.
G. Failure Taxonomy Discussion
合并的以实体为中心的记忆将此保留为标志牌实体,其后续状态显示它“显示 YOKOHAMA branding”。在查询时,读者使用查询和答案选项对相关实体进行排名;语义查询扩展将通用短语“brand name”映射到 signboard/text 实体,回答器选择包含 Yokohama 的选项。这个例子展示了预期的行为:OCR 证据首先写入块记忆,然后合并到稳定的实体槽中,最后通过实体级目录链接检索。
表 11 通过定性案例补充了对最终 8B 运行的小规模错误审查。在审查的 StreamingBench 错误中,大多数错误不是空记忆失败,而是系统检索到了合理的证据,但仍不足以在答案选项之间进行充分区分,特别是在情绪、误导性上下文和计数问题上。在审查的 OVO-Bench 错误中,失败分为证据缺失和检索区分度不足,特别是在 EPM 和 ASI 上,其中经常检索到相关实体,但不能直接建立查询的过去状态或动作顺序。“写入但未检索”在两个数据集中都很罕见,表明当前的瓶颈较少是找到候选记忆
第 22 页
表 11. 最终 8B 模型运行的失败分类学。我们回顾了 OVO-Bench 和 StreamingBench 上的错误预测。百分比是在每个数据集的错误集中计算的。
| Dataset | # Errors | Memory Missing | Written but Not Retrieved | Retrieved but Evidentially Insufficient | Retrieved but Not Sufficiently Discriminative | Multi-turn Reference Unresolved | | :— | :— | :— | :— | :— | :— | :— | | StreamingBench | 37 | 5 (13.5) | 0 (0.0) | 2 (5.4) | 29 (78.4) | 1 (2.7) | | OVO-Bench | 25 | 9 (36.0) | 0 (0.0) | 1 (4.0) | 15 (60.0) | 0 (0.0) |
表 12. OVO-Bench 和 StreamingBench 上的记忆构建开销。片段记录是在实体级合并之前持久化的 JSON 块级记录;视觉证据缓存内存是从存储的关键帧缓存中测量的。
| Dataset | Model | Video min | Segment Records (KB/min) | Visual-Evidence Cache (KB/min) | Writer latency | Input tok. | Output tok. | | :— | :— | :— | :— | :— | :— | :— | :— | | OVO-Bench | 8B | 428.5 | 151.1 | 3614.7 | 5.88s | 4409 | 734 | | StreamingBench | 8B | 314.7 | 155.5 | 3645.4 | 7.68s | 4523 | 781 | | OVO-Bench | 7B | 428.5 | 139.6 | 3614.7 | 12.15s | 5577 | 628 | | StreamingBench | 7B | 314.7 | 150.4 | 3635.2 | 14.63s | 5719 | 700 |
比决定检索到的证据是否足够具体以支持唯一答案更为困难。我们注意到,审查过的 StreamingBench 错误中包含很少的 SQA 案例,因此与完整的 StreamingBench 基准相比,跨轮次引用失败的情况代表性不足。
表 11 中的分类学表明,当前的检索模块并非主要的瓶颈。在两个数据集中,“已写入但未检索到”的纯失败情况都很罕见。相反,其余错误主要来自两个来源。首先,一些必要的证据从未以足够的细节写入记忆,特别是对于细粒度状态、过去位置或动作转换。其次,回答者通常在看到检索到的证据时过度承诺,这些证据相关但不足以区分以支持唯一答案。这意味着,未来的改进更可能来自提高记忆保真度和证据充分性判断,而不仅仅是增加检索广度。特别是,StreamingBench 的结果指向更强的校准和跨轮次证据使用,而 OVO 的结果则更强烈地指向针对 EPM 和 ASI 等回溯问题缺乏细粒度记忆。
H. 系统效率与内存开销
表 12 报告了从保存的记忆构建日志中收集的系统级统计信息。Writer VLM 一次处理一个固定的 8 秒视频块,这对应于每分钟视频约 60/8 = 7.5 次 VLM 调用;小的偏差来自部分边界块和持续时间舍入。为了使存储成本更易于阅读,表 12 仅报告了每分钟视频的片段级文本记录和视觉证据缓存内存。文本记忆数字是实体级合并之前块级记录的持久化 JSON 开销;检索使用的最终合并银行更小,并在表 3 中单独报告。
表 13 报告了相应的查询时成本。语义查询扩展率表示读者在直接词汇记忆查找之外使用 VLM 辅助语义查询扩展的频率。缓存触发器表示来自视觉证据缓存的链接关键帧被添加到回答输入中的查询比例。TTFT 是针对查询时读者测量的。
表 13. 诊断子集上的查询时检索和回答统计。语义查询扩展是读者在直接词汇记忆查找之外使用 VLM 辅助语义查询扩展的比率,缓存触发器是来自视觉证据缓存的链接关键帧被添加到回答输入中的比率。
| Dataset | Model | Questions | Acc. | VLM calls/Q | TTFT/Q | TTFT/call | Semantic expansion | Memory hit | Cache trigger | | :— | :— | :— | :— | :— | :— | :— | :— | :— | :— | | OVO-Bench | 8B | 100 | 75.0% | 2.15 | 6.58s | 3.06s | 40.0% | 85.0% | 0.0% | | OVO-Bench | 7B | 100 | 67.0% | 1.86 | 8.81s | 4.74s | 0.0% | 85.0% | – | | StreamingBench | 8B | 145 | 74.5% | 1.80 | 7.31s | 4.06s | 75.2% | 95.9% | 2.1% | | StreamingBench | 7B | 145 | 69.7% | 1.70 | 7.27s | 4.28s | 69.7% | 96.6% | – |
主要结论是,即使在实体级合并之前,文本开销仍然可控。在这些运行中,持久化的片段级 JSON 记录约为每分钟视频 140–156 KB,而最终的合并实体库更小,因为引用同一实体的记录被合并。选定的视觉证据由带时间戳的关键帧引用表示,并在需要时从源视频中重新提取。这种开销表明,对于长达数小时的在线流,记忆增长并不是即时的存储瓶颈。以测得的速率,10 小时的在线前缀对应于大约 90 MB 的片段级文本记录。即使选定的关键帧被物化,视觉证据缓存的增长率约为每分钟视频 3.6 MB,即在 10 小时前缀期间大约 2.2 GB;当缓存帧存储为带时间戳的引用时,持久化开销要小得多。
H.1. 长视界在线记忆诊断
我们在长视界在线设置中进一步评估 FOLIO,其中记忆是在查询到达之前基于长观测前缀构建的。这里的时间长度指的是查询到达前累积的在线前缀,而不是离线设置下可用的完整视频持续时间。诊断示例是从具有长查询时前缀的 OVO-Bench 案例中采样的:我们首先选择观测前缀至少为 20 分钟的示例,并包括来自 15–20 分钟范围的一小部分额外示例,以覆盖更多可用的长前缀案例。下面报告的完成运行包含第 2 阶段后的 47 个评估查询。
第 23 页
过滤。浏览器将视频放置在左上方面板,相关查询流放置在左下方面板,合并后的实体记忆放置在上右方面板,而分块级别的记忆写入则显示在右下方面板。我们使用此视图来审计写入器 VLM 是否保留了正确的实体、动作、文本证据以及中间分块响应,并检查查询时的读取器是否在生成答案前检索到了预期的支持信息。
相同的浏览器可以以流式检查模式运行。当视频快进到时间 $t$ 时,未来的问题、未来的分块以及未来的合并记忆更新都会被隐藏,因此该界面仅暴露截至时间 $t$ 已到达的问题、已写入的分块以及可用的合并记忆。这使得它非常有用,可用于检查未来信息是否被隐藏,并诊断错误是源于记忆构建、检索还是答案生成。
此诊断不作为主要基准结果使用。其目的是检查在线记忆积累过长的前缀后,相同的记忆构建流水线是否保持稳定。该运行未出现第 2 阶段错误,达到了 100.0% 的记忆命中率,平均每个查询使用 1.55 次 VLM 调用。在此长前缀子集上,合并记忆保持在每个查询 0.6 MB 以下,表明即使写入了大量分段级别的记录,实体合并也能使持久记忆的大小保持在可控范围内。
I. 附加多轮诊断
表 15. StreamingBench SQA 完整划分上的多轮焦点状态更新的 SQA 诊断,包含 50 个视频和 250 个查询。论文读取器使用当前轮次可用的先前查询历史,而无查询历史则从答案提示中移除先前的查询。运行时按每个查询测量。Sem. exp. 表示语义查询扩展率,Cache fr./Q 表示每个查询添加的平均缓存帧数。
| 设置 | Acc. | Calls/Q | Runtime/Q | Sem. exp. | Cache fr./Q | | :— | :— | :— | :— | :— | :— | | FOLIO, 论文读取器 | 54.8 | 1.87 | 9.89s | 87.2% | 0.02 | | FOLIO, 无查询历史 | 54.0 | 1.87 | 9.79s | 87.2% | 0.02 | | 无交互焦点, 论文读取器 | 53.6 | 1.91 | 10.57s | 91.6% | 0.16 | | 无交互焦点, 无查询历史 | 53.2 | 1.91 | 10.30s | 91.6% | 0.12 | | 无焦点控制器, 论文读取器 | 51.2 | 1.88 | 10.27s | 87.6% | 0.11 | | 无焦点控制器, 无查询历史 | 51.2 | 1.88 | 10.27s | 87.6% | 0.11 |
表 15 隔离了交互焦点在 50 视频 SQA 子集上的作用,其中后续查询经常引用先前轮次中的实体或动作,例如询问之前讨论过的人后来做了什么,或者引用的物体移动到了哪里。带有查询历史的论文读取器表现最佳,但移除查询历史仅使整个系统发生轻微变化。相比之下,移除交互焦点会导致两种读取器提示下的准确率下降。这表明增益并非仅仅源于让回答者接触先前的查询;先前轮次还通过指导后续的记忆构建来提供帮助。
J. 演示浏览器
图 5 展示了我们用于检查 FOLIO 在具体流式示例上的内部浏览器的两张截图。
23
第 24 页
(a) 篮球比赛示例。
(b) 综艺与魔术表演示例。
图 5. 交互式演示浏览器,用于在一个视图中检查视频、查询、合并记忆和块级记忆。
24
第 25 页
K. 提示模板
FOLIO 使用的三个视觉语言调用由以下提示模板驱动,此处逐字重现。花括号中的占位符(例如 {start_time:.1f}、{question})由周围管道在调用时填充。
K.1. 写入器 VLM 提示
由写入器 VLM Wθ 在每个按时间排序的片段上使用:它接收选定的关键帧以及带有详细和紧凑对象列表的写入指导,并返回包含详细对象记录、紧凑对象记录和事件的结构化 JSON。
写入器 VLM 提示(逐字)
为预算限制下的对象状态记忆分析此片段。
时间范围:{start_time:.1f}s – {end_time:.1f}s
{object_state_budget}
预算控制写入的详细程度,而非对象发现。
所需行为: 1. 详细对象(DETAILED objects):如果可见,编写包含位置、持有者、状态、关系、交互、状态变化、证据摘要和证据帧的结构化状态。 2. 紧凑对象(COMPACT objects):如果可见,编写一条包含位置/状态/关系和证据帧的紧凑笔记。 3. 始终发现新可见的操作对象、工具、容器、电器、烹饪表面、水槽、屏幕/文本以及异常对象。除非它们是动作的核心,否则将它们放入 compact_objects;如果是动作核心,则放入 detailed_objects。 4. 不要因为新对象或罕见对象未列在预算中而忽略它们。 5. 不要在 detailed_objects 和 compact_objects 之间重复相同的物理对象。
仅返回有效的 JSON: { "time": "{start_time:.1f}-{end_time:.1f}s", "detailed_objects": [ { "name": "对象名称", "category": "类别", "attributes": ["属性1"], "location": "位置", "holder": "无或持有者", "state": "当前可见状态", "relations": [ {"relation": "在…上/在…内/在…旁边/与…一起使用等", "target": "其他对象"} ], "interactions": [ {"type": "持有/移动/使用等", "with": "人/工具", "summary": "描述"} ], "state_change": "自上一片段以来发生的变化,或保持稳定", "evidence_summary": "具体的可见证据", "evidence_frames": [0], "confidence": 0.85 } ], "compact_objects": [ { "name": "非焦点可见对象", "category": "类别", "location": "紧凑位置", "state": "紧凑状态", "relation": "与动作或详细对象的关系", "brief": "一条简短有用的记忆笔记", "evidence_frames": [0], "confidence": 0.7
25
第 26 页
} ], "events": [ { "event_type": "动作类型", "summary": "发生了什么事", "participants": ["obj1", "obj2"], "changed_objects": ["obj1"], "confidence": 0.8 } ] }
规则: 1. 仅列出可见或部分可见的对象。 2. 两个对象列表中的对象总数最多为 {top_k_objects},事件总数最多为 {top_m_events}。 3. 对于重复出现或主动操作的焦点对象,优先分配详细的预算。 4. 即使工具、容器、电器、烹饪表面、水槽、屏幕/文本以及新出现的对象不是动作中心,也要保留其紧凑的笔记。 5. evidence_frames 可以是该片段内的近似局部帧索引;如果无法定位证据,请使用空列表。
K.2. 语义查询扩展提示
仅在直接结构化记忆检索返回空候选集时调用,通常针对抽象或概念层面的查询。VLM 接收查询、答案候选项、紧凑的对象目录和动作目录,并被限制为仅返回现有的对象标识符,以及简短的理由和候选答案先验。
语义查询扩展提示(逐字)
你是一个视频记忆助手。基于规则的检索器未能找到与该问题的直接关键词匹配。请使用语义推理来识别概念上相关的对象。
## 问题 {question}
## 选项 {options_text}
## 记忆中所有跟踪对象 {object_list}
## 显著动作/事件 {action_list}
## 任务 问题可能使用不直接命名对象的抽象概念(例如,“ avid reader ”[ avid reader ],“ active sport ”[ active sport ])。
你的工作: 1. 识别哪些跟踪对象/动作与问题在概念上相关。
2. 返回它们的 object_ids(3-7 个最相关的)。 3. 同时简要解释哪个选项似乎得到最多支持。
- 示例:“avid reader” -> 书架、书籍、杂志、阅读灯
- 示例:“musician” -> 钢琴、吉他、鼓
- 示例:“正在发生什么活动” -> 查看动作列表
## 输出(仅 JSON,无其他文本) { "relevant_object_ids": ["obj_0001", "obj_0002", "obj_0005"], "reasoning": "简要解释这些对象为何与问题概念相关。", "suggested_option": "A/B/C/D" }
26
第 27 页
K.3. 回答提示词
由回答型 VLM $A_\phi$ 在查询时调用。它接收查询、答案候选项、整合后的记忆块、最近帧以及任何检索到的缓存帧;返回包含预测标签、支持证据、推理过程和置信度的结构化响应。当整合后的记忆携带概念查询头(在检索时使用语义查询扩展时设置)时,提示词的“模式 B”分支会自动启用。
回答提示词(逐字)
你是一名视频问答助手。使用以下内容回答多项选择题: 1. 上方显示的最近帧(问题时间点附近的当前视觉状态) 2. 下方的整合记忆(视频中较早部分的 chronological 历史)
该记忆是基于视频中跨时间的物体观察构建的,组织为按时间排序的位置链和行动链。
模式选择(从记忆中自动检测):
=== 模式 A — 严格事实(默认)=== 除非记忆包含标题“## (!) 概念问题 — 需要特殊处理”,否则使用此模式。
规则: 1. 记忆是过去事件的主要来源。最近帧仅用于告知当前状态。 2. 对于多项选择题,选择一个选项标签(A、B、C 或 D)。 3. 如果“无法回答”、“无法确定”、“不可见”或类似内容在选项中,且记忆/帧中不包含直接、明确的证据,你必须选择它。 4. 避免推测:当有“无法回答”选项时,优先选择它而不是猜测。 5. 禁止使用的词汇:“最可能”、“表明”、“暗示”、“可能是”、“通常”、“典型地”、“大概”。如果使用这些词,答案很可能是“无法回答”。 6. 物体的存在本身不确认其位置、动作或关系。
=== 模式 B — 概念推理(仅当记忆包含概念问题头时启用)=== 当基于规则的检索器完全无法处理此问题时,会启用此模式(表明它询问的是抽象概念,如“是读者”/“是音乐家”)。
规则: 1. 间接证据是有效的:书架 -> 读者;钢琴 -> 音乐家;工具 -> 修理工。 2. 你不需要对活动进行直接的视觉确认。 3. 模式 A 的禁止词汇规则在此不适用——你可以使用“表明/暗示”。 4. 除非被反驳,否则信任 LLM 建议的选项(如果有)。
=== 通用规则 === 当存在时,信任记忆顶部的问题上下文和选项检查信号。 仅返回有效的 JSON。
## 问题 {question}
## 选项 {options_text}
## 整合记忆 {memory_text}
## 决策过程
- 步骤 1:记忆/帧是否明确陈述了答案?如果是 -> 选择该选项。
- 步骤 2:如果记忆显示“未找到目标” -> 如果有“无法回答”选项,则选择它。
- 步骤 3:否则,选择受证据反驳最少的选项。
## 输出 JSON 格式 { "prediction_label": "A/B/C/D", "prediction_text": "你选择的选项的文本", "visual_observation": "你在最近帧中看到的内容", "supporting_evidence": [
27
第 28 页
{"source": "memory/frames", "time": "…", "evidence": "…"} ], "reason": "简要解释", "confidence": 0.0-1.0 }
28