arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4524 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4524 篇

2510.00072 2026-05-04 cs.CV cs.AI cs.LG 67%

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 67%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25683 2026-04-29 cs.IR 67%

K-CARE: Knowledge-driven Symmetrical Contextual Anchoring and Analogical Prototype Reasoning for E-commerce Relevance

K-CARE:基于知识的对称上下文锚定与类比原型推理用于电商相关性

Chen Yifei, Tian Zhixing, Wang Chenyang, Cheng Ziguang

专题命中 视觉推理 :grounding(abstract,abstract_cn)

AI总结 K-CARE通过结合外部知识与类比推理,解决电商搜索中因知识边界缺失导致的相关性问题,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21304 2026-04-29 cs.IR 67%

PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs

PaperMind:多模态大语言模型中科学论文代理推理与批判的基准测试

Yanjun Zhao, Tianxin Wei, Jiaru Zou, Xuying Ning, Yuanchen Bei, Lingjie Chen, Simmi Rana, Wendy H. Yang, Hanghang Tong, Jingrui He

专题命中 视觉推理 :grounding(abstract,abstract_cn)

AI总结 PaperMind通过整合多模态信息和跨源推理,评估科学论文的综合推理能力,揭示多模态大语言模型在科学推理和批判中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 67%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract)

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM 67%

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO 67%

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11004 2026-04-14 cs.CV cs.AI cs.LG 67%

Panoptic Pairwise Distortion Graph

全景成对失真图

Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出全景成对失真图任务,通过区域结构化组成图像对,改进现有方法对整体图像分析的局限性,构建PandaSet数据集、PandaBench基准和Panda架构,揭示多模态大语言模型在区域级失真理解上的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 67%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract)

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL 67%

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04009 2026-04-07 cs.SE 67%

Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding

对软件架构图理解的VLMs基准测试与评估

Shuyin Ouyang, Jie M. Zhang, Jingzhi Gong, Gunel Jahangirova, Mohammad Reza Mousavi, Jack Johns, Beum Seuk Lee, Adam Ziolkowski, Botond Virginas, Joost Noppen

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract)

AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03406 2026-04-07 cs.GR 67%

SASAV: Self-Directed Agent for Scientific Analysis and Visualization

SASAV:面向科学分析和可视化的自主代理

Jianxin Sun, David Lenz, Tom Peterka, Hongfeng Yu

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

AI总结 本文提出SASAV,首个无需外部提示或人类在环反馈的自主AI代理,可自动执行科学数据分析并生成有洞察力的可视化,推动AI for Science加速大规模科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 67%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 67%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10853 2026-04-01 cs.LG cs.AI cs.CV 67%

GenOL: Generating Diverse Examples for Name-only Online Learning

GenOL:为名称-only在线学习生成多样化示例

Minhyuk Seo, Seongwon Cho, Minjae Lee, Diganta Misra, Hyeonbeom Choi, Seon Joo Kim, Jonghyun Choi

机构 * KU Leuven(鲁汶大学) Seoul National University(首尔大学) ELLIS(欧洲学习与智能系统实验室) MPI-IS Tübingen(马克斯·普朗克智能系统研究所图宾根) Yonsei University(延世大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对在线学习中数据分布偏移问题,提出GenOL框架,通过生成模型提升名称-only训练中图像的内在和跨模型多样性,优于传统监督和网络监督方法。

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27571 2026-03-31 cs.HC 67%

RAGent: Physics-Aware Agentic Reasoning for Training-Free mmWave Human Activity Recognition

RAGent:面向无训练毫米波人类活动识别的物理感知代理推理

Mingda Han, Huanqi Yang, Zehua Sun, Wenhao Li, Yanni Yang, Guoming Zhang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 RAGent通过物理感知代理推理实现无训练毫米波人类活动识别,利用雷达知识库进行证据驱动推理,无需领域特定训练或适应,实现跨领域鲁棒识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24846 2026-03-27 cs.CV cs.AI cs.LG 67%

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

NeuroVLM-Bench:评估用于神经系统疾病临床推理的视觉增强大语言模型

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika Simjanoska Misheva, Kostadin Mishev

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文评估了视觉增强大语言模型在神经疾病临床推理中的性能,通过多模态模型在MRI和CT数据集上进行基准测试,发现影像属性基本解决,但诊断推理仍具挑战性。

Comments 53 pages, 12 figures. Manuscript submitted to the BMC Medical Informatics and Decision Making journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23495 2026-03-25 cs.CV cs.AI cs.LG 67%

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

VISion On Request: 基于稀疏、动态选择的视觉-语言交互提升大模型效率

Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星AI剑桥实验室) Technical University of Iasi(伊阿斯技术大学) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VISOR通过稀疏化视觉-语言交互提升大模型效率,无需丢弃视觉信息,动态分配计算资源,实验表明在多样基准和挑战任务中性能优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20894 2026-03-24 cs.MM 67%

AcoustEmo: Open-Vocabulary Emotion Reasoning via Utterance-Aware Acoustic Q-Former

AcoustEmo:通过语句感知的声学Q-Former实现开放词汇情绪推理

Liyun Zhang, Xuanmeng Sha, Shuqiong Wu, Fengkai Liu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 AcoustEmo通过引入语句感知的声学Q-Former,利用时间同步滑动窗口提取段级音频token,提升复杂情绪推理能力,在EMER任务中优于基线模型。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 67%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 67%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 67%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03827 2026-03-05 cs.MM 67%

Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition

通过层次语义表示进行进化多模态推理以实现意图识别

Qianrui Zhou, Hua Xu, Yunjin Gu, Yifan Wang, Songze Li, Hanlei Zhang

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 HIER通过层次语义表示与进化推理提升多模态意图识别性能,实现更准确的意图推断。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03099 2026-03-05 cs.RO 67%

Point2Act: Efficient 3D Distillation of Multimodal LLMs for Zero-Shot Context-Aware Grasping

Point2Act: 多模态大语言模型的高效3D蒸馏用于零样本情境感知抓取

Sang Min Kim, Hyeongjun Heo, Junho Kim, Yonghyeon Lee, Young Min Kim

机构 * Seoul National University(首尔国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Point2Act通过多模态大语言模型高效蒸馏实现零样本情境感知抓取,生成空间定位响应以支持实际操作任务。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02662 2026-03-04 cs.HC 67%

Behavior-Aware Anthropometric Scene Generation for Human-Usable 3D Layouts

面向人类可用性的行为感知场景生成

Semin Jin, Donghyuk Kim, Jeongmin Ryu, Kyung Hoon Hyun

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种行为感知的体格场景生成框架,通过结合视觉-语言模型和用户体格数据,提升3D布局的人体可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04366 2026-03-03 cs.HC cs.MM 67%

Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction

向人类专家对齐多模态大语言模型:聚焦亲子互动

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。

Comments Accepted at CHI 2026 Full Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02339 2026-03-03 cs.CL 67%

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

AStar: 通过自动化结构化思维提升多模态推理

Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract)

AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21619 2026-02-26 cs.CL 67%

When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning

更多未必更好:对视觉空间推理中空间与常识信息的系统分析

Muku Akasaka, Soyeon Caren Han

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract)

AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。

Comments 5 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19516 2026-02-24 cs.CE 67%

Pixel2Phys: Distilling Governing Laws from Visual Dynamics

Pixel2Phys: 从视觉动态中提炼 governing laws

Ruikun Li, Jun Yao, Yingfan Hua, Shixiang Tang, Biqing Qi, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract)

AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。

Comments CVPR2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09972 2026-02-11 cs.RO 67%

Hydra-Nav: Object Navigation via Adaptive Dual-Process Reasoning

Hydra-Nav: 通过自适应双过程推理实现物体导航

Zixuan Wang, Huang Fang, Shaoan Wang, Yuanfei Luo, Heng Dong, Wei Li, Yiming Gan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。

详情

展开后加载摘要…

URL PDF HTML 收藏