arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-25 至 2025-12-25 共收录 29 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2512.21126 2025-12-25 cs.CV cs.DB 83%

MarineEval: Assessing the Marine Intelligence of Vision-Language Models

MarineEval: 评估视觉-语言模型的海洋智能

YuK-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 79%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14368 2025-12-25 cs.CV cs.CL cs.LG 73%

O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model

O3SLM:开放权重、开放数据和开放词汇草图-语言模型

Rishi Gupta, Mukilan Karuppasamy, Shyam Marjit, Aditay Tripathi, Anirban Chakraborty

机构 * IISc(印度理工学院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 8 篇

2512.21194 2025-12-25 cs.CV 85%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21243 2025-12-25 cs.RO cs.AI cs.LG 81%

LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation

LookPlanGraph: 一种基于视觉语言模型图增强的具身指令跟随方法

Anatoly O. Onishchenko, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 视觉推理 :VLM(title);vision language model(abstract);分类 cs.AI、cs.LG

AI总结 LookPlanGraph通过动态更新场景图实现具身指令跟随,利用视觉语言模型增强环境感知,优于静态场景图方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 81%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 73%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20934 2025-12-25 cs.CV cs.AI cs.CL cs.MA 62%

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

归纳式视觉编程:从经验中演化工具库以进行空间推理

Shengguang Wu, Xiaohan Wang, Yuhui Zhang, Hao Zhu, Serena Yeung-Levy

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。

Comments Project Website: https://transductive-visualprogram.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20936 2025-12-25 cs.CV 57%

Reasoning-Driven Amodal Completion: Collaborative Agents and Perceptual Evaluation

基于推理的无遮挡完成:协作代理与感知评估

Hongxing Fan, Shuyu Zhao, Jiayang Ao, Lu Sheng

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) School of Software, Beihang University(软件学院,北京航空航天大学) School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 本文提出一种协作多代理推理框架,通过解耦语义规划与视觉合成,提升无遮挡完成任务的语义一致性和结构完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 50%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09141 2025-12-25 cs.RO 50%

RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation

RGMP: 基于几何先验的多模态策略用于通用人形机器人操作

Xuetao Li, Wenke Huang, Nengyuan Pan, Kaiyan Zhao, Songhua Yang, Yiming Wang, Mengde Li, Mang Ye, Jifeng Xuan, Miao Li

专题命中 视觉推理 :vision language model(abstract)

AI总结 RGMP通过结合几何-语义推理与递归高斯适应,实现了高效的人形机器人多模态操作控制。

Journal ref Proceedings of the AAAI conference on artificial intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 8 篇

2412.06244 2025-12-25 cs.CV 70%

Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction

无偏区域-语言对齐用于开放词汇密集预测

Yunheng Li, Yuxuan Li, Quansheng Zeng, Wenhai Wang, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) NKIARI, Shenzhen Futian(深圳福田国家信息研究院) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DenseVLM通过无偏区域-语言对齐提升开放词汇密集预测性能

Comments Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21099 2025-12-25 cs.GR cs.AI cs.CV 62%

TexAvatars : Hybrid Texel-3D Representations for Stable Rigging of Photorealistic Gaussian Head Avatars

TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars

Jaeseong Lee, Junyeong Ahn, Taewoong Kang, Jaegul Choo

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。

Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21237 2025-12-25 cs.CV 57%

SegMo: Segment-aligned Text to 3D Human Motion Generation

SegMo:基于段落的文本到3D人体运动生成

Bowen Dang, Lin Wu, Xiaohang Yang, Zheng Yuan, Zhixiang Chen

机构 * University of Sheffield(谢菲尔德大学) University of Glasgow(格拉斯哥大学) Queen Mary University of London(伦敦大学Queen Mary)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SegMo通过段落对齐实现文本与3D人体运动的精细生成与对齐,提升生成效果并拓展应用范围。

Comments The IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21150 2025-12-25 cs.CV 57%

ORCA: Object Recognition and Comprehension for Archiving Marine Species

ORCA:面向档案化海洋物种的对象识别与理解

Yuk-Kwan Wong, Haixin Liang, Zeyu Ma, Yiwei Chen, Ziqiang Zheng, Rinaldi Gotama, Pascal Sebastian, Lauren D. Sparks, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科学与技术大学) Indo Ocean Foundation Project(印度洋基金会项目)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ORCA提出一个多模态基准数据集,用于提升海洋物种识别与理解的研究水平,通过细粒度视觉和文本注释推动领域内方法学进展。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21065 2025-12-25 cs.RO cs.CV 57%

Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation

基于粗到细学习的语言引导抓取检测用于机器人操作

Zebin Jiang, Tianle Jin, Xiangtong Yao, Alois Knoll, Hu Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于粗到细学习的语言引导抓取检测方法,通过跨模态融合和动态卷积头提升抓取精度与鲁棒性,实验证明其在复杂环境中的有效性。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20714 2025-12-25 cs.AI cs.CY cs.HC 57%

From Pilots to Practices: A Scoping Review of GenAI-Enabled Personalization in Computer Science Education

从飞行员到实践:关于生成式AI在计算机科学教育中实现个性化的一次范围综述

Iman Reihanian, Yunfei Hou, Qingquan Sun

机构 * School of Computer Science and Engineering, California State University, San Bernardino, CA 92407 , USA(计算机科学与工程学院,加州州立大学,桑 bernardino,CA 92407,美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过综述32项研究,探讨生成式AI在计算机科学教育中的个性化应用,提出探索优先的采用框架,强调试点和证据驱动的扩展,以提升学习效果并应对相关风险。

Comments Review article. 23 pages, 7 figures, 8 tables. Published in AI (MDPI), 2026

Journal ref AI 2026, 7(1), Article 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11718 2025-12-25 cs.HC cs.AI 57%

Interaction, Process, Infrastructure: A Unified Framework for Human-Agent Collaboration

交互、过程、基础设施:人机协作的统一框架

Yun Wang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种统一框架,通过整合交互、过程和基础设施,解决人机协作中结构表示和适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11953 2025-12-25 cs.CV 57%

SPOC: Spatially-Progressing Object State Change Segmentation in Video

SPOC: 视频中空间性推进的对象状态变化分割

Priyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 3 篇

2512.20674 2025-12-25 cs.LG cs.AI cs.CV 82%

HyDRA: Hierarchical and Dynamic Rank Adaptation for Mobile Vision Language Model

HyDRA:面向移动视觉语言模型的分层和动态秩适应

Yuanhao Xi, Xiaohuan Bing, Ramin Yahyapour

机构 * Liaoning Technical University(辽宁技术大学) University of Göttingen(哥廷根大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 HyDRA通过分层和动态秩调度优化,提升移动视觉语言模型的微调效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20940 2025-12-25 cs.RO 50%

ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments

连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。

Shuhao Ye, Sitong Mao, Yuxiang Cui, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19083 2025-12-25 cs.RO 50%

CoDrone: Autonomous Drone Navigation Assisted by Edge and Cloud Foundation Models

CoDrone:由边缘和云基础模型辅助的自主无人机导航

Pengyu Chen, Tao Ouyang, Ke Luo, Weijie Hong, Xu Chen

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 CoDrone通过整合云-边-端协作计算框架和基础模型,提升无人机自主导航性能,实现更高效和精确的环境感知与动态适应。

Comments This paper is accepted by the IEEE Internet of Things Journal (IoT-J) for publication in the Special Issue on "Augmented Edge Sensing Intelligence for Low-Altitude IoT Systems"

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 1 篇

2512.21337 2025-12-25 cs.CV 79%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 3 篇

2512.20916 2025-12-25 cs.IR cs.MM 82%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 79%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20675 2025-12-25 cs.LG cs.AI 73%

Revisiting the Learning Objectives of Vision-Language Reward Models

重新审视视觉-语言奖励模型的学习目标

Simon Roy, Samuel Barbeau, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) Sorbonne Université(索邦大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估了基于VLM的奖励模型,发现简单三元组损失在性能上优于现有方法,表明改进可能源于数据和架构差异。

Comments Published as an extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 3 篇

2512.20781 2025-12-25 cs.IR 67%

Soft Filtering: Guiding Zero-shot Composed Image Retrieval with Prescriptive and Proscriptive Constraints

软过滤:通过规劝性与禁止性约束指导零样本复合图像检索

Youjin Jung, Seongwoo Cho, Hyun-seok Min, Sungchul Choi

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract)

AI总结 本文提出SoFT方法,通过规劝性和禁止性约束提升零样本复合图像检索的准确性与鲁棒性。

Comments Accepted to AAAI 2026 Workshop on New Frontiers in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21221 2025-12-25 cs.CV cs.AI 62%

Leveraging Lightweight Entity Extraction for Scalable Event-Based Image Retrieval

利用轻量级实体提取实现可扩展的基于事件的图像检索

Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Tran Chi Nguyen

机构 * University of Science - VNUHCM(越南胡志明市科学大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级两阶段检索流程,利用事件中心实体提取结合BM25和BEiT-3模型,实现高效准确的图像检索。

Comments System description paper for EVENTA Grand Challenge Track 2 at ACM Multimedia 2025 (MM '25). Ranked 4th place. 6 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01907 2025-12-25 cs.CV cs.CL 57%

RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events

RSCC:一种大规模遥感变化描述数据集用于灾害事件

Zhenyuan Chen, Chenxi Wang, Ningyu Zhang, Feng Zhang

机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(国家自然资源部空间时空信息与智能服务重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 RSCC数据集通过提供大规模遥感图像对和详细变化描述,提升视觉-语言模型在灾害事件双时间理解中的性能和应用能力。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏