arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-14 至 2025-10-14 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2510.11602 2025-10-14 cs.CL cs.LG 57%

Deconstructing Attention: Investigating Design Principles for Effective Language Modeling

Huiyin Xue, Nafise Sadat Moosavi, Nikolaos Aletras

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11063 2025-10-14 cs.CV 57%

LSVOS 2025 Challenge Report: Recent Advances in Complex Video Object Segmentation

Chang Liu, Henghui Ding, Kaining Ying, Lingyi Hong, Ning Xu, Linjie Yang, Yuchen Fan, Mingqi Gao, Jingkun Chen, Yunqi Miao, Gengshen Wu, Zhijin Qin, Jungong Han, Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Chang Soo Lim, Joonyoung Moon, Donghyeon Cho, Tingmin Li, Yixuan Li, Yang Yang, An Yan, Leilei Cao, Feng Lu, Ran Hong, Youhai Jiang, Fengjie Zhu, Yujie Xie, Hongyang Zhang, Zhihui Liu, Shihai Ruan, Quanzhu Niu, Dengxian Gong, Shihao Chen, Tao Zhang, Yikang Zhou, Haobo Yuan, Lu Qi, Xiangtai Li, Shunping Ji, Ran Hong, Feng Lu, Leilei Cao, An Yan, Alexey Nekrasov, Ali Athar, Daan de Geus, Alexander Hermans, Bastian Leibe

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09720 2025-10-14 physics.ed-ph 50%

NotebookLM as a Socratic physics tutor: Design and preliminary observations of a RAG-based tool

Eugenio Tufino

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 9 pages, 5 figures. Revised version accepted for publication in The Physics Educator (World Scientific, in press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00683 2025-10-14 cs.SD eess.AS 50%

PicoAudio2: Temporal Controllable Text-to-Audio Generation with Natural Language Description

Zihao Zheng, Zeyu Xie, Xuenan Xu, Wen Wu, Chao Zhang, Mengyue Wu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能联合实验室、X-LANCE实验室、上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Demo page: https://HiRookie9.github.io/PicoAudio2-Page

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2506.21625 2025-10-14 cs.CL cs.AI cs.IR 57%

Doc2SAR: A Synergistic Framework for High-Fidelity Extraction of Structure-Activity Relationships from Scientific Documents

Jiaxi Zhuang, Kangning Li, Jue Hou, Mingjun Xu, Zhifeng Gao, Hengxing Cai

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2510.04991 2025-10-14 cs.RO 82%

Efficient Navigation in Unknown Indoor Environments with Vision-Language Models

D. Schwartz, K. Kondo, J. P. How

机构 * ETH Zürich(苏黎世联邦理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)

Comments 7 pages, 4 figures, accepted to the OWN workshop at IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 79%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与屏幕智能体 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01424 2025-10-14 cs.RO 75%

TriVLA: A Triple-System-Based Unified Vision-Language-Action Model with Episodic World Modeling for General Robot Control

Zhenyang Liu, Yongchong Gu, Sixiao Zheng, Yanwei Fu, Xiangyang Xue, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01185 2025-10-14 cs.RO 50%

HoMeR: Learning In-the-Wild Mobile Manipulation via Hybrid Imitation and Whole-Body Control

Priya Sundaresan, Rhea Malhotra, Phillip Miao, Jingyun Yang, Jimmy Wu, Hengyuan Hu, Rika Antonova, Francis Engelmann, Dorsa Sadigh, Jeannette Bohg

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 9 篇

2507.09279 2025-10-14 cs.CV cs.AI cs.CL 86%

Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confidence Calibration in Multimodal Large Language Models

Anita Kriz, Elizabeth Laura Janes, Xing Shen, Tal Arbel

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025 Workshop CVAMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24000 2025-10-14 cs.LG cs.CV 84%

The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models

Lijun Sheng, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track. Github link: https://github.com/TomSheng21/tta-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03123 2025-10-14 cs.CV cs.CL cs.LG 81%

Investigating VLM Hallucination from a Cognitive Psychology Perspective: A First Step Toward Interpretation with Intriguing Observations

Xiangrui Liu, Man Luo, Agneet Chatterjee, Hua Wei, Chitta Baral, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Intel Lab(英特尔实验室)

专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10965 2025-10-14 cs.CL cs.AI 79%

Judge Before Answer: Can MLLM Discern the False Premise in Question?

Jidong Li, Lingyong Fang, Haodong Zhao, Sufeng Duan, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09849 2025-10-14 cs.CL cs.CV 79%

Text Prompt Injection of Vision Language Models

Ruizhe Zhu

机构 * Ruizhe Zhu(独立研究者)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10466 2025-10-14 cs.CV 70%

When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance

Jinjin Cao, Zhiyang Chen, Zijun Wang, Liyuan Ma, Weijian Luo, Guojun Qi

机构 * MAPLE Lab, Westlake University(西溪大学MAPLE实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14670 2025-10-14 cs.HC cs.AI 70%

StreetLens: Enabling Human-Centered AI Agents for Neighborhood Assessment from Street View Imagery

Jina Kim, Leeje Jang, Yao-Yi Chiang, Guanyu Wang, Michelle C. Pasco

机构 * University of Minnesota(明尼苏达大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10290 2025-10-14 cs.SE cs.LG 57%

Grounded AI for Code Review: Resource-Efficient Large-Model Serving in Enterprise Pipelines

Sayan Mandal, Hua Jiang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16012 2025-10-14 cs.RO 50%

DualTHOR: A Dual-Arm Humanoid Simulation Platform for Contingency-Aware Planning

Boyu Li, Siyuan He, Hang Xu, Haoqi Yuan, Yu Zang, Liwei Hu, Junpeng Yue, Zhenxiong Jiang, Pengbo Hu, Börje F. Karlsson, Yehui Tang, Zongqing Lu

专题命中 幻觉与鲁棒性 :vision language model(abstract)

Comments The experiments in the paper need to be further supplemented, and more methods should be considered for expansion

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 20 篇

2507.04351 2025-10-14 cs.RO cs.AI 88%

MLLM-Fabric: Multimodal Large Language Model-Driven Robotic Framework for Fabric Sorting and Selection

Liman Wang, Hanyang Zhong, Tianyuan Wang, Shan Luo, Jihong Zhu

机构 * School of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) Department of Engineering, King’s College London(工程学院,伦敦国王学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

Comments Accepted to IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10487 2025-10-14 cs.CV cs.AI 84%

Towards Self-Refinement of Vision-Language Models with Triangular Consistency

Yunlong Deng, Guangyi Chen, Tianpei Gu, Lingjing Kong, Yan Li, Zeyu Tang, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ByteDance US(字节跳动美国公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10715 2025-10-14 cs.GR cs.CV 84%

VLM-Guided Adaptive Negative Prompting for Creative Generation

Shelly Golan, Yotam Nitzan, Zongze Wu, Or Patashnik

机构 * Adobe Research(Adobe研究院) Tel Aviv University(特拉维夫大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Project page at: https://shelley-golan.github.io/VLM-Guided-Creative-Generation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11456 2025-10-14 cs.CV 83%

Coupled Degradation Modeling and Fusion: A VLM-Guided Degradation-Coupled Network for Degradation-Aware Infrared and Visible Image Fusion

Tianpei Zhang, Jufeng Zhao, Yiming Zhu, Guangmang Cui

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04192 2025-10-14 cs.CV cs.AI cs.CL 81%

ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos

Trinh T. L. Vuong, Jin Tae Kwak

机构 * Korea University(韩国大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20761 2025-10-14 cs.AI 79%

OmniBal: Towards Fast Instruction-Tuning for Vision-Language Models via Omniverse Computation Balance

Yongqiang Yao, Jingru Tan, Feizhao Zhang, Jiahao Hu, Yazhe Niu, Xin Jin, Bo Li, Pengfei Liu, Ruihao Gong, Dahua Lin, Ningyi Xu

机构 * Shanghai Jiao Tong University(上海交通大学) SenseTime Research(商汤科技研究院) Central South University(中南大学) Tongji University(同济大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :vision-language model(title);InternVL(abstract);分类 cs.AI

Comments Accepted in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09867 2025-10-14 cs.CV 79%

Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation

Zhi Chen, Xin Yu, Xiaohui Tao, Yan Li, Zi Huang

机构 * University of Southern Queensland(昆士兰南方大学) University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to the journal Pattern Recognition in 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11693 2025-10-14 cs.CL cs.AI cs.CV 73%

Scaling Language-Centric Omnimodal Representation Learning

Chenghao Xiao, Hou Pong Chan, Hao Zhang, Weiwen Xu, Mahani Aljunied, Yu Rong

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09426 2025-10-14 cs.CV cs.AI cs.CL 73%

BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning

Shengao Wang, Arjun Chandra, Aoming Liu, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09073 2025-10-14 cs.CV 70%

Open Vocabulary Multi-Label Video Classification

Rohit Gupta, Mamshad Nayeem Rizve, Jayakrishnan Unnikrishnan, Ashish Tawari, Son Tran, Mubarak Shah, Benjamin Yao, Trishul Chilimbi

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09699 2025-10-14 cs.CR cs.AI 70%

VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands

Aofan Liu, Lulu Tang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11314 2025-10-14 cs.CL 67%

Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications

Belkiss Souayed, Sarah Ebling, Yingqiang Gao

机构 * University of Zurich(苏黎世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏