从器械轨迹到手术意图:无需人工标注的预测性腹腔镜自动取景

快速导读:提出DiffeoAfford管道,从手术器械轨迹中自动生成组织可供性热图标签,训练实时预测模型驱动AffordView应用进行预测性视野调整,并在12对腹腔镜胆囊切除术中验证其降低外科医生认知负荷的有效性。

腹腔镜手术中,视野控制是影响手术流畅度和安全性的关键环节。传统模式下,持镜助手需要持续推断主刀医生的意图来调整腹腔镜位置,但意图推断本质上依赖于隐性的专家知识,沟通不畅常导致视野不佳,增加主刀医生的认知负荷。本文提出了一种全新的解决思路:不依赖专家标注,而是从手术器械的运动轨迹中自动推导出组织可供性(Affordance)——即组织上可进行手术交互的区域,并利用这一信号训练模型实时预测手术意图,驱动预测性自动取景。

研究团队设计了DiffeoAfford管道,利用微分同胚约束的组织追踪技术,从已完成的手术视频中回顾性地生成可供性热点(Affordance Hotspot, AH)软标签。基于这些自动生成的标签训练Segformer模型,实现了对AH的实时预测。最终开发的AffordView应用根据预测的AH中心动态裁剪和放大视野,在12对腹腔镜胆囊切除术的术中评估中,显著降低了主刀医生的Theta/Alpha Ratio和SURG-TLX主观负荷评分。

英文题目:Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery

论文出处:arXiv 每日论文精选 · arXiv:2608.02471

原始论文:PDF / 论文页面

这篇论文解决什么问题?

腹腔镜手术的视野控制问题长期存在。持镜助手需要实时理解主刀医生的手术意图,但意图本身是隐性的、动态变化的,即使经验丰富的助手也难以完美同步。视野不佳会导致主刀医生反复口头纠正、手术节奏中断,甚至增加胆管损伤等并发症风险。现有解决方案大致分为两类:基于器械跟踪的被动视野调整,以及基于视觉注意力模型的主动预测。

器械跟踪方法虽然直观,但存在根本性局限——它只能跟随已经发生的动作,无法预测下一步的交互位置。视觉注意力模型则面临标注瓶颈:训练一个能预测外科医生注视区域的模型,通常需要专家对大量手术视频进行逐帧标注,成本极高且难以规模化。更关键的是,专家在标注时依赖的是隐性知识,不同专家之间的一致性有限,标注本身也存在噪声。

本文的核心洞察在于:外科医生的视觉注意力并非随机分布,而是受组织可供性驱动。所谓可供性,是指组织表面可进行手术交互的区域——例如正在被剥离的胆囊浆膜层、需要电凝的血管。更重要的是,这些可供性区域可以通过观察器械的动作轨迹来反向推断:器械停留、操作的位置,正是具有手术可供性的区域。这一洞察使得从动作中自动推导视觉注意力成为可能,绕过了昂贵的人工标注环节。

核心创新

  • 提出基于动作的可供性概念,从手术器械轨迹而非人工标注中获取监督信号,实现可扩展的视觉注意力建模。
  • 设计DiffeoAfford管道,结合全局变换和微分同胚变形场,在变形组织上建立密集的像素级对应,自动生成连续的可供性热点标签。
  • 构建AffordView预测性自动取景应用,通过预测手术交互区域并主动居中,降低外科医生认知负荷,而非被动跟踪器械。

方法概览

提出DiffeoAfford管道,利用器械轨迹和微分同胚约束的组织追踪,从已完成的手术视频中回顾性地生成组织可供性热点(AH)软标签。基于这些标签训练Segformer模型,实时预测AH热图。开发AffordView应用,根据预测的AH中心动态裁剪和放大视野,实现预测性自动取景。

  • DiffeoAfford管道的核心思想是:利用手术器械的轨迹作为监督信号,通过组织追踪技术将器械交互位置传播到整个手术视频的所有帧,从而自动生成密集的可供性热点标签。具体而言,管道首先检测器械尖端位置,然后以器械尖端为中心生成初始高斯热图,再通过组织追踪将热图从交互帧传播到非交互帧。
  • 组织追踪采用了两阶段策略:首先使用全局单应性变换对齐相邻帧的整体运动,然后引入微分同胚变形场来建模软组织的局部非线性变形。微分同胚约束确保了变形场的光滑性和可逆性,避免了组织追踪中的交叉和撕裂伪影,这对于在变形组织上建立密集的像素级对应至关重要。
  • 通过上述追踪,DiffeoAfford能够在每一帧上累积来自不同时间点的器械交互信息,生成连续的可供性热点软标签。这些标签本质上是一种概率图,表示每个像素属于手术交互区域的似然。与人工标注的二值掩码相比,软标签保留了更多不确定性信息,更符合手术交互的模糊边界特性。
  • 获得AH标签后,研究团队使用Segformer模型进行实时预测。Segformer是一种轻量级的语义分割Transformer,能够在单帧图像上直接预测AH热图,无需时序信息。模型在Cholec80数据集上训练,该数据集包含80个腹腔镜胆囊切除术视频,DiffeoAfford为其自动生成了完整的AH标签。
  • AffordView应用将AH预测结果转化为实际的视野调整动作。具体策略是:计算预测AH热图的质心,然后以该质心为中心进行数字裁剪和放大,使手术交互区域始终保持在视野中央。与器械跟踪方法不同,AffordView的调整是预测性的——它在器械到达之前就已经将视野对准了即将交互的区域。

逐图理解论文

临床痛点与直觉

临床痛点与直觉
Fig. 1 | Conceptual overview of the study. a, Concept & Clinical Gap: Suboptimal field-of-view selection

图1展示了研究的核心概念和临床痛点:传统持镜助手模式下,视野选择依赖助手对主刀意图的推断,常导致视野不佳(红色虚线框),而本文提出的基于可供性的预测性取景能够主动将手术交互区域居中(绿色虚线框)。注意观察传统视野中器械已经到达目标区域但视野仍未调整的滞后现象。

核心方法:从动作到可供性

核心方法:从动作到可供性
Fig. 2 | Overview of the proposed affordance-guided view control framework. The framework comprises

图2呈现了完整的框架流程:左侧为DiffeoAfford管道,从器械轨迹中自动生成AH标签;中间为Segformer模型的实时AH预测;右侧为AffordView应用,根据预测的AH中心进行动态裁剪和放大。重点关注微分同胚变形场在组织追踪中的作用,以及从标签生成到实时预测的闭环设计。

关键验证:标注质量与预测能力

关键验证:标注质量与预测能力
Fig. 4 | Evaluation of affordance grounding across surgical datasets. a-c, DiffeoAfford on the Cholec80

图4展示了DiffeoAfford标注质量的定量和定性结果:小提琴图比较了不同方法的中位定位误差,注意DiffeoAfford与人类标注者的接近程度;右侧的定性示例展示了自动标注与专家标注在空间分布上的一致性,尤其关注组织变形较大区域的追踪效果。

术中验证:认知负荷真的降低了吗?

术中验证:认知负荷真的降低了吗?
Fig. 7 | Setup for the intraoperative user experience evaluation and objective metrics. The central

图7展示了术中评估的实验设置和客观指标:中央为双屏实验配置,主刀医生观看手术视野,同时采集脑电图和眼动追踪数据;注意实验组和对照组的视野差异,以及Theta/Alpha Ratio、IPA等生理指标的定义和采集方式。

实验如何设计?

  • 标注质量评估:在Cholec80数据集上,将DiffeoAfford生成的AH标签与不同经验水平的标注者(专家、观看上下文后的新手、未观看上下文的新手)进行对比,同时与全局变换基线(相似变换RANSAC、单应性RANSAC)比较定位误差。
  • 注视点对齐评估:在LCET数据集上,以术中外科医生的真实注视点(通过眼动追踪采集)为基准,评估DiffeoAfford生成的AH与真实意图在时间和空间上的对齐程度。
  • AH预测评估:在LCET和AutoLaparo数据集上,评估AH预测模型与外科医生注视点、持镜助手注视点的对齐情况,以及在AutoLaparo上评估AH预测对后续相机运动方向的预测能力。
  • 主观偏好评估:通过多中心问卷调查(n=65),让不同经验水平的外科医生在原始视图、器械跟踪视图和AffordView之间进行偏好选择。
  • 术中用户体验评估:在12对腹腔镜胆囊切除术中,实验组使用AffordView辅助视野控制,对照组使用传统持镜助手。通过脑电图(Theta/Alpha Ratio)、眼动追踪(IPA、注视熵)和SURG-TLX问卷测量认知负荷。

关键结果与论文证据

  • DiffeoAfford的标注质量与观看上下文后的新手标注者无显著差异(LMM, p=0.418),且等效性检验支持两者等价(R=0.070, 90% CI -0.259 to 0.322)(第9页)。这表明自动生成的标签达到了人类标注者的水平。
  • DiffeoAfford的中位定位误差(32.38像素)显著低于相似变换RANSAC(39.40像素, p<0.001)和单应性RANSAC(35.07像素, p=0.003)(第10页),验证了微分同胚变形场建模的必要性。
  • 在LCET数据集上,DiffeoAfford的标注与术中注视点的距离,在±0.5s、±1.0s、±2.0s窗口内与观看上下文后的低年资医生无显著差异(p=0.079, 0.267, 0.823)(第10页),进一步验证了自动标注的生态效度。
  • AH预测在Calot三角解剖和胆囊解剖阶段,与外科医生注视点的质心滞后(-0.033s, 0.013s)显著短于持镜助手(0.185s, 0.204s, p=0.014 and 0.014)(第12页),说明AH预测能更及时地对齐主刀医生的注意力。
  • 在AutoLaparo数据集上,AH预测对相机运动方向的一致性达到95.16%,且在较长时间范围内保持稳定,优于随时间衰减的器械跟踪基线(第13页)。这直接证明了AH预测的预测性优势。
  • 问卷调查中,AffordView在视野准确性上显著优于原始视图(77.1%偏好, OR=3.38, p<0.001),并在所有维度上显著优于器械跟踪基线(准确性75.4%, 稳定性75.7%, 缩放合理性61.8%, 均p<0.001)(第15页)。
  • 术中评估显示,实验组在Calot和胆囊解剖阶段的Theta/Alpha Ratio显著降低(Mean diff=-0.40, p=0.023; Mean diff=-0.42, p=0.012),SURG-TLX总分显著降低(p=0.014)(第17页),提供了认知负荷降低的生理和主观双重证据。

阅读时需要注意

  • 当前框架缺乏语义推理能力,无法识别如肿瘤浸润等需要避免交互的高风险区域,这限制了其在复杂肿瘤手术中的应用。
  • 自动取景依赖数字裁剪,未解决腹腔镜本身视野狭窄的问题,且裁剪会进一步缩小显示视野,可能影响外周警觉性。
  • 术中评估的持镜助手均为新手(少于5次手术经验),结果是否适用于经验丰富的助手尚待验证。
  • 术中评估样本量较小(12对),且为单中心研究,结果的普适性需进一步验证。
  • 脑电图和眼动追踪数据可能受双屏实验设置和电磁干扰影响,如注视熵未显著降低可能与此有关。

关联工作

  • AffordTissue是一个并发的预印本工作,同样预测密集的组织可供性热图,但其监督信号来自专家逐帧标注和语言指令,而本文从手术轨迹中自动推导。两者目标不同,互为补充:AffordTissue追求语义丰富的可供性理解,本文追求可扩展的自动标注范式。
  • Gong等人使用微分同胚约束来恢复被操作组织的非交叉、真实变形,与本文在2D图像平面上使用微分同胚进行可供性定位的方法在概念上一致,验证了微分同胚在手术组织建模中的有效性。
  • GazeScope通过隐式注视注意力估计来推断用户感兴趣区域并动态调整工具跟踪优先级,避免了显式选择和特殊硬件。本文的AffordView同样无需额外硬件,但通过预测可供性而非估计注视来驱动视野控制,代表了不同的技术路线。

发表评论