一张多人照片里,输入“穿红衣服的男孩”,模型先找到指定人物,再画出他的视线落点;也可以直接点击画面坐标来选人。Google与伊利诺伊大学香槟分校提出GazeAnywhere,并开源12万组带提示标注的Gaze-Co数据,把注视估计从固定检测流水线改成可用文字或视觉提示控制的任务。
传统方法通常先检测人头和姿态,再把裁剪结果交给视线网络。前一步框错人,后面的落点预测即使计算正确也没有意义;多人、遮挡和野外图像会让这种级联错误更频繁。
用一句描述替代手工人头框
团队把新任务命名为Promptable Gaze Target Estimation。输入可以是“红衣男孩”一类自然语言,也可以是画面中的一个点。输出同时包括指定人物的位置、视线是否落在画面内,以及一张表示可能注视区域的热力图。
传统级联方案与GazeAnywhere端到端方案对比。
这种设定允许用户在同一张图里反复询问不同人物,不必提前准备每个人的头部框。文字描述还能使用衣着、相对位置和其他可见概念,适合照片整理、人机交互与行为研究中的定向分析。论文并未把视线落点等同于心理意图:看到某个位置,只说明模型估计目光朝向那里。
12万组Gaze-Co样本从概念开始标注
现有注视数据多围绕头部裁剪和单一主体建立,无法直接训练“按描述选人”。团队因此开发数据引擎,生成Gaze-Co数据集与基准,包含12万组高质量图像—提示配对。每个样本把人物概念、位置、画内或画外状态及目标区域连在一起。
Gaze-Co数据引擎生成提示、人物与视线标注。
数据覆盖文本提示和视觉提示,也保留真实场景里的多人关系。模型训练时不能只学习常见人脸朝向,还要把“用户究竟问的是谁”纳入判断。这个变化看似只是多了一句文字,实际把主体定位和视线估计合并成了一个联合问题。
提示式设计也解决了多人图像中的接口问题。如果系统自动给每个人编号,人物一移动或检测顺序改变,编号就可能失效;自然语言可使用稳定的可见特征,点坐标则适合交互界面。两种提示共享同一任务输出,应用不必维护两套视线模型。
冻结编码器也能同时找人、判画外和画热图
GazeAnywhere使用Transformer检测器融合冻结图像编码器与文本编码器的特征。检测器负责锁定目标人物,视线分支输出画内概率和目标热力图。冻结基础编码器减少训练成本,也便于利用已有视觉—语言表征理解衣着与场景概念。
GazeAnywhere融合图像和提示的模型结构。
团队在多个PGE基准上报告了当前最佳结果,并把模型带到分布外的真实临床数据上测试。论文把这项结果作为新任务的强基线,而非宣称所有注视场景已经解决;婴幼儿、强遮挡、极端头部角度和画外目标仍需要更多样本验证。
不同真实场景中的注视人物与落点预测。
下一步接入交互、临床观察与内容分析
可提示接口让注视估计更容易进入实际工具。研究人员可直接指定某位参与者,教育场景可分析学生是否看向课件区域,照片与视频工具也能按人物查询其关注对象。若扩展到视频,还需要跨帧维持人物身份,并区分短暂扫视和持续注视。
代码和Gaze-Co数据已经公开,后来者可以在同一任务定义上评测新模型。进入临床或公共空间前,还要建立隐私、授权和误差报告机制;GazeAnywhere当前提供的是视觉估计结果,不应被当作个体注意力或认知状态的确定结论。
视频版本还可以把热力图与物体检测结合,统计一段时间内目光落在哪些对象上。要做到这一点,模型需处理视线短暂离开画面、人物互相遮挡以及镜头切换。Gaze-Co提供了静态图像起点,跨帧身份与时间尺度将成为下一层问题。
评测也应分别报告找错人和视线方向预测错误,便于判断改进应落在哪个模块。
参考资料
https://arxiv.org/abs/2608.11367