arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-04 至 2026-03-04 共收录 52 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 11 篇

2603.02688 2026-03-04 cs.AI cs.RO 57%

Retrieval-Augmented Robots via Retrieve-Reason-Act

通过检索-推理-行动实现增强型机器人

Izat Temiraliev, Diji Yang, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出检索增强型机器人学(RAR)范式,通过检索-推理-行动循环,使机器人能从外部文档获取未见程序知识,提升复杂任务执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02626 2026-03-04 cs.AI 57%

See and Remember: A Multimodal Agent for Web Traversal

见与忆:一种用于网页浏览的多模态代理

Xinjun Wang, Shengyao Wang, Aimin Zhou, Hao Hao

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) East China Normal University(华东师范大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 V-GEMS通过视觉 grounding 和显式记忆系统实现精确稳健的网页浏览,实验显示其在导航任务中性能提升28.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 50%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2603.02789 2026-03-04 cs.CL cs.AI 70%

OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets

OCR 或不是?在 MLLMs 时代重新思考文档信息提取:基于真实世界的大规模数据集

Jiyuan Shen, Peiyue Yuan, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

机构 * SAP(SAP公司) Stanford University(斯坦福大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了在 MLLMs 时代是否仍需 OCR,通过大规模数据集评估发现,仅图像输入可达到与 OCR 增强方法相当的性能,并展示了通过精心设计的模式、示例和指示可进一步提升 MLLMs 的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI 70%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 2 篇

2603.02546 2026-03-04 cs.CV 70%

On Discriminative vs. Generative classifiers: Rethinking MLLMs for Action Understanding

在判别与生成分类器之间:重新思考MLLMs用于动作理解

Zhanzhong Pang, Dibyadip Chatterjee, Fadime Sener, Angela Yao

机构 * National University of Singapore(国立新加坡大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GAD分类器,通过生成辅助判别方法提升封闭集动作理解的准确性和效率,达到SOTA效果。

Comments 22 pages, 9 figures, 16 tables. Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02487 2026-03-04 cs.RO 50%

A Robust Simulation Framework for Verification and Validation of Autonomous Maritime Navigation in Adverse Weather and Constrained Environments

一种用于自主水路航行在恶劣天气和受限环境下的验证与验证的稳健仿真框架

Mayur S. Patil, Nataraj Sudharsan, Anthony S. Saaiby, JiaChang Xing, Keliang Pan, Veneela Ammula, Jude Tomdio, Jin Wang, Michael Kei, Heonyong Kang, Sivakumar Rathinam, Prabhakar R. Pagilla

机构 * Department of Mechanical Engineering, Texas A&M University, College Station, USA(机械工程系,德克萨斯A&M大学,学院站,美国) Department of Ocean Engineering, Texas A&M University, College Station, USA(海洋工程系,德克萨斯A&M大学,学院站,美国) American Bureau of Shipping, Spring, TX, USA(美国船舶局,斯普林,德克萨斯州,美国)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出了一种稳健的仿真框架,用于验证和验证自主水路航行系统在恶劣天气和受限环境下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 1 篇

2603.02553 2026-03-04 cs.RO cs.CV cs.HC cs.LG 62%

Give me scissors: Collision-Free Dual-Arm Surgical Assistive Robot for Instrument Delivery

给我剪刀:用于器械传递的碰撞自由双臂手术辅助机器人

Xuejin Luo, Shiquan Sun, Runshi Zhang, Ruizhi Zhang, Junchen Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(机械工程与自动化学院,北航)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种碰撞自由的双臂手术辅助机器人,通过视觉-语言模型生成轨迹并实现动态环境中的安全器械传递。

Comments 8 pages, 10 figures. Accepted by IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 11 篇

2603.02609 2026-03-04 cs.CV cs.RO 83%

VLMFusionOcc3D: VLM Assisted Multi-Modal 3D Semantic Occupancy Prediction

VLMFusionOcc3D: 基于VLM的多模态3D语义占位预测

A. Enes Doruk, Hasan F. Ates

机构 * Department of Artificial Intelligence and Data Engineering, Ozyegin University(人工智能与数据工程系,奥克辛大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 VLMFusionOcc3D通过融合视觉语言模型的语义先验,提升多模态3D语义占位预测的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23652 2026-03-04 cs.CV cs.AI 81%

3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection

面向MRI多器官异常检测的3D模态感知预训练

Haowen Zhu, Ning Yin, Xiaogen Zhou

机构 * School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MedMAP框架,通过3D MRI的模态感知预训练提升多器官异常检测性能,实验表明其优于现有视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13315 2026-03-04 cs.CV cs.AI 81%

Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models

Self-Aug: 用于大视觉-语言模型的查询和熵自适应解码

Eun Woo Im, Muhammad Kashif Ali, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出Self-Aug,一种无需训练的解码策略,通过自增强提示和自适应阈值算法提升大视觉-语言模型的事实一致性。

Comments 10 pages, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03018 2026-03-04 cs.AI cs.SE 79%

REGAL: A Registry-Driven Architecture for Deterministic Grounding of Agentic AI in Enterprise Telemetry

REGAL:一种基于注册表的架构,用于企业遥测中代理AI的确定性接地

Yuvraj Agrawal

机构 * Adobe Inc.(Adobe公司)

专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.AI

AI总结 REGAL提出一种基于注册表的架构,用于企业遥测中代理AI的确定性接地,通过显式架构方法和语义编译提升确定性计算,解决LLM在私有遥测中的接地问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02250 2026-03-04 cs.SD eess.AS 71%

SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models

SGPA: 基于频谱的语音对齐用于多模态大语言模型中可行的谢普利值解释

Paweł Pozorski, Jakub Muszyński, Maria Ganzha

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 VLM训练与架构 :multimodal large language model(title)

AI总结 SGPA通过结合连接主义时间分类和频谱边界细化,实现了多模态大语言模型中可行的音频解释,显著减少了模型评估次数并保持了全局轮廓。

Comments Submitted for admission in Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18264 2026-03-04 cs.CV 70%

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

MMTok: 为VLMs高效推理的多模态覆盖最大化

Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 MMTok通过多模态覆盖准则提升VLMs推理效率,结合视觉和文本信息优化标记选择,实现性能与速度的平衡。

Comments Accepted by ICLR 2026. Code: https://github.com/Ironieser/mmtok , Project Homepage: https://project.ironieser.cc/mmtok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02470 2026-03-04 cs.IT cs.LG cs.MM eess.IV math.IT 70%

Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding

视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信

Jingxuan Men, Mahdi Boloursaz Mashhadi, Ning Wang, Yi Ma, Mike Nilsson, Rahim Tafazolli

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)

专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20088 2026-03-04 cs.LG 70%

Quantization-Aware Distillation for NVFP4 Inference Accuracy Recovery

量化感知蒸馏用于NVFP4推理精度恢复

Meng Xin, Sweta Priyadarshi, Jingyu Xin, Bilal Kartal, Aditya Vavre, Asma Kuriparambil Thekkumpate, Zijia Chen, Ameya Sunil Mahabaleshwarkar, Ido Shahaf, Akhiad Bercovich, Kinjal Patel, Suguna Varshini Velury, Chenjie Luo, Zhiyu Cheng, Jenny Chen, Chen-Han Yu, Wei Ping, Oleg Rybakov, Nima Tajbakhsh, Oluwatobi Olabiyi, Dusan Stosic, Di Wu, Song Han, Eric Chung, Sharath Turuvekere Sreenivas, Bryan Catanzaro, Yoshi Suhara, Tijmen Blankevoort, Huizi Mao

机构 * NVIDIA(英伟达)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本研究提出量化感知蒸馏方法,用于恢复NVFP4量化大型语言模型和视觉-语言模型的推理精度,通过KL散度损失实现有效且稳定的精度恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17520 2026-03-04 cs.RO cs.CV 70%

InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation

InstructVLA: 从理解到操作的视觉-语言-动作指令微调

Shuai Yang, Hao Li, Bin Wang, Yilun Chen, Yang Tian, Tai Wang, Hanqing Wang, Feng Zhao, Yiyi Liao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 InstructVLA通过视觉-语言-动作指令微调,实现了在多模态推理和动作生成之间的平衡,提升了机器人在复杂任务中的操控性能和泛化能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21646 2026-03-04 cs.CL 67%

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

可扩展的多语言多模态机器翻译与语音-文本融合

Yexing Du, Youcheng Pan, Zekun Wang, Zheng Chu, Yichong Huang, Kaiyuan Liu, Bo Yang, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02655 2026-03-04 cs.CL cs.AI 57%

Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches

基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法

Anum Afzal, Yuki Saito, Hiroya Takamura, Katsuhito Sudoh, Shinnosuke Takamichi, Graham Neubig, Florian Matthes, Tatsuya Ishigaki

机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。

Comments Accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 3 篇

2603.02959 2026-03-04 cs.CV 79%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03278 2026-03-04 cs.RO cs.AI cs.CV 62%

Tether: Autonomous Functional Play with Correspondence-Driven Trajectory Warping

Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍

William Liang, Sam Wang, Hung-Ju Wang, Osbert Bastani, Yecheng Jason Ma, Dinesh Jayaraman

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校) Dyna Robotics(Dyna机器人技术)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。

Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15008 2026-03-04 cs.LG cs.AI stat.ML 62%

Know When to Abstain: Optimal Selective Classification with Likelihood Ratios

知何时退避:基于似然比的最优选择性分类

Alvin Heng, Harold Soh

机构 * Department of Computer Science, National University of Singapore(计算机科学系,国立新加坡大学) Smart Systems Institute, National University of Singapore(智能系统研究所,国立新加坡大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于似然比的最优选择性分类方法,通过 Neyman-Pearson 引理统一并改进了选择性分类在协变量偏移下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏