DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。