arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

OneSearch-VL:面向图像与视频的统一多模态深度研究智能体

OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video

Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu

arXiv 2610.12419首次发表:更新:

发表机构

BUAA; CUHK; NTU; THU; HFUT(北京航空航天大学; 香港中文大学; 南洋理工大学; 清华大学; 合肥工业大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

本研究提出以视觉定位证据图(VGEG)为核心的统一多模态深度研究智能体OneSearch-VL,构建相关数据集与基准,在图像、视频深度研究任务上较Qwen3-VL-8B取得显著性能提升。

AI 中文摘要

单图像、多图像及视频的深度研究需要不同的视觉操作,但共享视觉定位、外部检索与事实合成的工作流程。核心挑战在于保留局部视觉锚点、实体关系、源支持事实及答案生成操作之间的依赖关系。我们提出OneSearch-VL,这是一个以视觉定位证据图(Visually Grounded Evidence Graph, VGEG)为核心的统一智能体,将这些依赖关系编码为数据构建、过程监督及操作级评估的共享任务级参考。基于VGEG的数据引擎构建并验证多图像与视频问题,过滤专家轨迹。利用这些数据,我们分别组装用于监督微调(SFT)的OneSearch-VL-SFT-110K和用于强化学习(RL)的OneSearch-VL-RL-10K。我们进一步从VGEG标注中推导证据感知视觉定位规则奖励(Evidence-aware Visual-Grounded Rubric reward, EVGR),以在RL过程中监督证据可追溯性与视觉定位。为进行细粒度评估,我们构建OneSearch-MI-Bench与OneSearch-Video-Bench,按其VGEG编码的研究操作组织问题。实验表明,OneSearch-VL-8B在两个新基准上较带工具访问的Qwen3-VL-8B分别提升20.2和17.6个百分点,同时在7个图像基准及VideoDR上也取得显著增益。项目代码仓库:this https URL

英文摘要

Single-image, multi-image, and video deep research require different visual operations but share a workflow of visual grounding, external retrieval, and fact composition. A key challenge is to preserve the dependencies linking localized visual anchors, entity relations, source-supported facts, and answer-producing operations. We introduce OneSearch-VL, a unified agent centered on the Visually Grounded Evidence Graph (VGEG), which encodes these dependencies as a shared task-level reference for data construction, process supervision, and operation-level evaluation. Our VGEG-based data engine constructs and verifies multi-image and video questions and filters expert trajectories. Using these data, we assemble OneSearch-VL-SFT-110K and OneSearch-VL-RL-10K for SFT and RL, respectively. We further derive the Evidence-aware Visual-Grounded Rubric reward (EVGR) from VGEG annotations to supervise evidence traceability and visual grounding during RL. For fine-grained evaluation, we construct OneSearch-MI-Bench and OneSearch-Video-Bench, organizing questions by the research operations encoded in their VGEGs. Experiments show that OneSearch-VL-8B improves over Qwen3-VL-8B with tool access by 20.2 and 17.6 percentage points on the two new benchmarks, respectively, while also achieving substantial gains across 7 image benchmarks and VideoDR. Project repository: https://github.com/appletea233/OneSearch-VL

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑