arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-05 至 2025-11-05 共收录 31 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2511.02182 2025-11-05 cs.CV 86%

Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models

Jinhwan Seo, Yoonki Cho, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(成均馆大学)

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

Comments 1st place winner of Grounded Videoqa track at the ICCV2025 Perception Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01914 2025-11-05 cs.CV cs.AI cs.RO 73%

iFlyBot-VLA Technical Report

Yuan Zhang, Chenyu Xue, Wenjie Xu, Chao Ji, Jiajia wu, Jia Pan

机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02046 2025-11-05 cs.CV cs.AI 62%

Text-VQA Aug: Pipelined Harnessing of Large Multimodal Models for Automated Synthesis

Soham Joshi, Shwet Kamal Mishra, Viswanath Gopalakrishnan

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23495 2025-11-05 cs.CL cs.AI cs.LG 62%

Diagnosing and Addressing Pitfalls in KG-RAG Datasets: Toward More Reliable Benchmarking

Liangliang Zhang, Zhuorui Jiang, Hongliang Chi, Haoyang Chen, Mohammed Elkoumy, Fali Wang, Qiong Wu, Zhengyi Zhou, Shirui Pan, Suhang Wang, Yao Ma

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) University of Toronto(多伦多大学) Pennsylvania State University(宾夕法尼亚州立大学) AT&T Chief Data Office(AT&T首席数据办公室) Griffith University(格里菲斯大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12926 2025-11-05 eess.SP cs.CV 57%

Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference

Cheng Yuan, Zhening Liu, Jiashu Lv, Jiawei Shao, Yufei Jiang, Jun Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所) School of Electronic and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08564 2025-11-05 cs.CV cs.CL 57%

Visual Program Distillation with Template-Based Augmentation

Michal Shlapentokh-Rothman, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

Comments EMNLP Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08039 2025-11-05 cs.SD cs.CL cs.MM eess.AS 50%

Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning

Shu Wu, Chenxing Li, Wenfu Wang, Hao Zhang, Hualei Wang, Meng Yu, Dong Yu

专题命中 视觉问答 :multimodal large language model(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2511.02415 2025-11-05 cs.CV 83%

ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension

Duo Xu, Hao Cheng, Xin Lin, Zhen Xie, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments 23 pages, EMNLP25 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01999 2025-11-05 cs.RO cs.AI 70%

TRACE: Textual Reasoning for Affordance Coordinate Extraction

Sangyun Park, Jin Kim, Yuchen Cui, Matthew S. Brown

机构 * ABB Robotics(ABB机器人公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments ICCV 2025. *Equal contribution. †Corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20241 2025-11-05 cs.LG cs.AI 62%

DreamPRM: Domain-Reweighted Process Reward Model for Multimodal Reasoning

Qi Cao, Ruiyi Wang, Ruiyi Zhang, Sai Ashish Somayajula, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 10 figures, to appear in NeurIPS 2025 (Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02794 2025-11-05 cs.AI cs.MA 57%

When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning

Chenyu Zhang, Minsol Kim, Shohreh Ghorbani, Jingyao Wu, Rosalind Picard, Patricia Maes, Paul Pu Liang

机构 * Harvard University(哈佛大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted at the Multimodal Algorithmic Reasoning (MAR) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02779 2025-11-05 cs.CV 57%

When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought

Yiyang Zhou, Haoqin Tu, Zijun Wang, Zeyu Wang, Niklas Muennighoff, Fan Nie, Yejin Choi, James Zou, Chaorui Deng, Shen Yan, Haoqi Fan, Cihang Xie, Huaxiu Yao, Qinghao Ye

机构 * ByteDance Seed(字节跳动种子) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Santa Cruz(圣克拉拉大学) Stanford(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 4 篇

2511.00537 2025-11-05 cs.CL cs.LG 57%

Multi-refined Feature Enhanced Sentiment Analysis Using Contextual Instruction

Peter Atandoh, Jie Zou, Weikang Guo, Jiwei Wei, Zheng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27195 2025-11-05 cs.CV cs.CL cs.SI 57%

Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments ICCV2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02238 2025-11-05 cs.AI 57%

Deep Ideation: Designing LLM Agents to Generate Novel Research Ideas on Scientific Concept Network

Keyu Zhao, Weiquan Lin, Qirui Zheng, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Artificial Intelligence Academy, Xidian University(西安电子科技大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17664 2025-11-05 cs.CV cs.RO 57%

Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras

Lingdong Kong, Dongyue Lu, Ao Liang, Rong Li, Yuhao Dong, Tianshuai Hu, Lai Xing Ng, Wei Tsang Ooi, Benoit R. Cottereau

机构 * NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) NTU(南洋理工大学) HKUST(香港科技大学) I 2 R, A*STAR(I2R, A*STAR) IPAL, CNRS IRL 2955, Singapore(IPAL, CNRS IRL 2955, 新加坡) CerCo, CNRS UMR 5549, Université Toulouse III(CerCo, CNRS UMR 5549, 法国图卢兹第三大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments NeurIPS 2025 Spotlight; 43 pages, 17 figures, 16 tables; Project Page at https://talk2event.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2503.18065 2025-11-05 cs.CV cs.AI cs.CL cs.RO 62%

Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation

Ziming Wei, Bingqian Lin, Yunshuang Nie, Jiaqi Chen, Shikui Ma, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Hunan Artificial Intelligence and Robotics Institute Company Ltd.(湖南人工智能与机器人研究院有限公司) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE Transactions on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 3 篇

2511.02243 2025-11-05 cs.AI 57%

When Modalities Conflict: How Unimodal Reasoning Uncertainty Governs Preference Dynamics in MLLMs

Zhuoran Zhang, Tengyue Wang, Xilin Gong, Yang Shi, Haotian Wang, Di Wang, Lijie Hu

机构 * Peking University(北京大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能和数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学) University of Georgia(佐治亚大学) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01952 2025-11-05 cs.CR cs.AI 57%

Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing

Jinhua Yin, Peiru Yang, Chen Yang, Huili Wang, Zhiyang Hu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06534 2025-11-05 cs.RO cs.AI 57%

MetAdv: A Unified and Interactive Adversarial Testing Platform for Autonomous Driving

Aishan Liu, Jiakai Wang, Tianyuan Zhang, Hainan Li, Jiangfan Liu, Siyuan Liang, Yilong Ren, Xianglong Liu, Dacheng Tao

机构 * Beihang University, Beijing, China(北航大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Institute of Dataspace, Hefei, China(数据空间研究所,合肥,中国) Nanyang Technological University, Singapore, Singapore(南洋理工大学,新加坡,新加坡)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

Comments ACM MM 2025 Most Popular Demo Award

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 8 篇

2510.16888 2025-11-05 cs.CV 83%

Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback

Zongjian Li, Zheyuan Liu, Qihui Zhang, Bin Lin, Feize Wu, Shenghai Yuan, Zhiyuan Yan, Yang Ye, Wangbo Yu, Yuwei Niu, Shaodong Wang, Xinhua Cheng, Li Yuan

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21375 2025-11-05 cs.CV 83%

GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution

Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang

机构 * College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院) Beijing University of Posts and Telecommunications, China(北京邮电大学) School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) Tsinghua University, China(清华大学) Beihang University, China(北航大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments NeurlPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02367 2025-11-05 cs.HC 82%

The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos

Shuning Zhang, Zhaoxin Li, Changxi Wen, Ying Ma, Simin Li, Gengrui Zhang, Ziyi Zhang, Yibo Meng, Hantao Zhao, Xin Yi, Hewu Li

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 78%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 VLM训练与架构 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25067 2025-11-05 cs.CV 70%

DRIP: Dynamic patch Reduction via Interpretable Pooling

Yusen Peng, Sachin Kumar

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

Comments Need more refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01894 2025-11-05 cs.GR cs.AI cs.LG 62%

LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency

Fangbing Liu, Pengfei Duan, Wen Li, Yi He

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03093 2025-11-05 cs.LG 57%

From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit

Valérie Costa, Thomas Fel, Ekdeep Singh Lubana, Bahareh Tolooshams, Demba Ba

机构 * EPFL(瑞士联邦理工学院) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能CBSTNTT项目) Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(NTT研究公司人工智能物理研究组) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所) SEAS, Harvard University(哈佛大学工程与应用科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02094 2025-11-05 cs.AI 57%

Automated Reward Design for Gran Turismo

Michel Ma, Takuma Seno, Kaushik Subramanian, Peter R. Wurman, Peter Stone, Craig Sherstan

机构 * Mila, University of Montreal(蒙特利尔大学Mila) Turing Inc.(图灵公司) Sony AI(索尼人工智能) Sony AI, UT Austin(索尼人工智能、得克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 3 篇

2511.02720 2025-11-05 cs.CV cs.AI 62%

LLEXICORP: End-user Explainability of Convolutional Neural Networks

Vojtěch Kůr, Adam Bajger, Adam Kukučka, Marek Hradil, Vít Musil, Tomáš Brázdil

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02358 2025-11-05 cs.CL cs.AI cs.IR cs.LG cs.MM 62%

Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation

Wongyu Kim, Hochang Lee, Sanghak Lee, Yoonsung Kim, Jaehyun Park

机构 * NC AI(NC人工智能)

专题命中 其他VLM :MLLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to MMGenSR Workshop (CIKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏