arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-17 至 2026-02-17 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 11 篇

2602.05847 2026-02-17 cs.AI cs.CV 81%

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: 通过查询意图和模态注意力强化音频视觉推理

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

机构 * tencent(腾讯)

专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 OmniVideo-R1通过查询意图和模态注意力机制,提升多模态推理能力,在多个基准上超越现有基线模型。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11858 2026-02-17 cs.CV cs.AI cs.CL cs.LG 80%

Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

无需缩放:用于细粒度多模态感知的区域到图像蒸馏

Lai Wei, Liangbo He, Jun Lan, Lingzhong Dong, Yutong Cai, Siyuan Li, Huijia Zhu, Weiqiang Wang, Linghe Kong, Yue Wang, Zhuosheng Zhang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出区域到图像蒸馏方法,通过训练时间内化代理缩放能力,提升细粒度多模态感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13324 2026-02-17 cs.CV cs.AI cs.RO 79%

Synthesizing the Kill Chain: A Zero-Shot Framework for Target Verification and Tactical Reasoning on the Edge

构建杀伤链:一种零样本框架,用于边缘节点上的目标验证和战术推理

Jesse Barkley, Abraham George, Amir Barati Farimani

机构 * With the Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种零样本框架,通过边缘设备实现目标验证和战术推理,验证了分层架构在动态军事环境中的有效性。

Comments 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13332 2026-02-17 cs.CV cs.AI 73%

MedScope: Incentivizing "Think with Videos" for Clinical Reasoning via Coarse-to-Fine Tool Calling

MedScope:通过粗到细的工具调用激励“通过视频思考”以进行临床推理

Wenjie Li, Yujie Zhang, Haoran Sun, Xingqi He, Hongcheng Gao, Chenglong Ma, Ming Hu, Guankun Wang, Shiyi Yao, Renhao Yang, Hongliang Ren, Lei Wang, Junjun He, Yankai Jiang

机构 * College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院) Fudan University, Shanghai, China(复旦大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Tsinghua University, Beijing, China(清华大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedScope通过粗到细的工具调用机制,提升临床视频推理的准确性与可信度,实现基于时间局部化视觉证据的医疗AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10551 2026-02-17 cs.CV cs.AI 62%

C^2ROPE: Causal Continuous Rotary Positional Encoding for 3D Large Multimodal-Models Reasoning

C^2ROPE: 3D 大多模态模型推理中的因果连续旋转位置编码

Guanting Ye, Qiyan Zhao, Wenhao Yu, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Ka-Veng Yuen

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, USTC(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, USTC(中国科学技术大学人工智能与数据科学学院)

专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 C^2ROPE通过引入空间-时间连续位置编码和切比雪夫因果掩码,解决3D多模态模型中视觉特征连续性和因果关系建模问题。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14589 2026-02-17 cs.AI cs.CL cs.LG 62%

MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs

MATEO:一种多模态基准,用于LVLMs中的时间推理和规划

Gabriel Roccabruna, Olha Khomyn, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento, Italy(特伦托大学信号与交互系统实验室) University of Trento(特伦托大学) Amazon(亚马逊)

专题命中 视觉推理 :vision language model(abstract);分类 cs.AI、cs.LG

AI总结 MATEO是一个多模态基准,用于评估和提升大型视觉语言模型在时间推理和规划方面的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14518 2026-02-17 cs.AI 57%

Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning

多模态长链推理中的知识冲突诊断

Jing Tang, Kun Wang, Haolang Lu, Hongjin Chen, KaiTao Chen, Zhongxiang Sun, Qiankun Li, Lingjuan Lyu, Guoshun Nan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Renmin University of China(中国人民大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出了一种统一的知识冲突概念,揭示了多模态长链推理中不同冲突类型的特征和处理机制,为诊断和控制推理失败提供了原理性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14225 2026-02-17 cs.AI 57%

Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding

文本优先于视觉:针对超高清遥感理解的代理强化学习在超高清遥感理解中的知识注入至关重要

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yuhao Zhou, Di Wang, Yifan Zhang, Haoyu Wang, Haiyan Zhao, Hongda Sun, Long Lan, Jun Song, Yulin Wang, Jing Zhang, Wenlong Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Sichuan University, China(四川大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Renmin University of China, China(中国人民大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出分阶段知识注入方法,利用文本引导提升超高清遥感理解的视觉推理能力,实现XLRS-Bench上的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14035 2026-02-17 cs.AI 57%

FloCA: Towards Faithful and Logically Consistent Flowchart Reasoning

FloCA: 向忠实且逻辑一致的流程图推理迈进

Jinzi Zou, Bolin Wang, Liang Li, Shuo Zhang, Nuo Xu, Junzhou Zhao

机构 * MoE KLINNS Lab, Xi’an Jiaotong University, Xi’an 710049, P. R. China(西安交通大学) China Mobile Group Shaanxi Co., Ltd.(中国移动集团陕西公司)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 FloCA通过结合LLM和外部工具实现流程图推理,解决现有方法在流程图拓扑表示和幻觉问题上的不足,提升对话系统的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14017 2026-02-17 cs.LG 57%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.LG

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13574 2026-02-17 cs.SE cs.CR 50%

Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation

面向执行状态的LLM推理用于自动化漏洞证明生成

Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, Luyi Xing

专题命中 视觉推理 :grounding(abstract)

AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。

Comments Version 1.0 (13 pages, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏