发表机构
BUAA; CUHK; NTU; THU; HFUT(北京航空航天大学; 香港中文大学; 南洋理工大学; 清华大学; 合肥工业大学)
机构由 AI 辅助整理,请以论文原文为准。AI 中文总结
本研究提出以视觉定位证据图(VGEG)为核心的统一多模态深度研究智能体OneSearch-VL,构建相关数据集与基准,在图像、视频深度研究任务上较Qwen3-VL-8B取得显著性能提升。
AI 中文摘要
单图像、多图像及视频的深度研究需要不同的视觉操作,但共享视觉定位、外部检索与事实合成的工作流程。核心挑战在于保留局部视觉锚点、实体关系、源支持事实及答案生成操作之间的依赖关系。我们提出OneSearch-VL,这是一个以视觉定位证据图(Visually Grounded Evidence Graph, VGEG)为核心的统一智能体,将这些依赖关系编码为数据构建、过程监督及操作级评估的共享任务级参考。基于VGEG的数据引擎构建并验证多图像与视频问题,过滤专家轨迹。利用这些数据,我们分别组装用于监督微调(SFT)的OneSearch-VL-SFT-110K和用于强化学习(RL)的OneSearch-VL-RL-10K。我们进一步从VGEG标注中推导证据感知视觉定位规则奖励(Evidence-aware Visual-Grounded Rubric reward, EVGR),以在RL过程中监督证据可追溯性与视觉定位。为进行细粒度评估,我们构建OneSearch-MI-Bench与OneSearch-Video-Bench,按其VGEG编码的研究操作组织问题。实验表明,OneSearch-VL-8B在两个新基准上较带工具访问的Qwen3-VL-8B分别提升20.2和17.6个百分点,同时在7个图像基准及VideoDR上也取得显著增益。项目代码仓库:this https URL
英文摘要
Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We further derive the Evidence-aware Visual-Grounded Rubric reward (EVGR) from VGEG annotations to supervise evidence traceability and visual grounding during RL. For fine-grained evaluation, we construct OneSearch-MI-Bench and OneSearch-Video-Bench, organizing questions by the research operations encoded in their VGEGs. Experiments show that OneSearch-VL-8B improves over Qwen3-VL-8B with tool access by 20.2 and 17.6 percentage points on the two new benchmarks, respectively, while also achieving substantial gains across 7 image benchmarks and VideoDR. Project repository: https://github.com/appletea233/OneSearch-VL