arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-20 至 2025-11-20 共收录 26 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2505.00275 2025-11-20 cs.CV cs.AI 88%

AdCare-VLM: Towards a Unified and Pre-aligned Latent Representation for Healthcare Video Understanding

Md Asaduzzaman Jabin, Hanqi Jiang, Yiwei Li, Patrick Kaggwa, Eugene Douglass, Juliet N. Sekandi, Tianming Liu

机构 * University of Georgia(佐治亚大学)

专题命中 视觉问答 :VLM(title,abstract);vision language model(abstract);LLaVA(abstract);visual question answering(abstract)

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 7th International Workshop on Large Scale Holistic Video Understanding: Toward Video Foundation Models

Journal ref Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15183 2025-11-20 cs.CL cs.LG 77%

HinTel-AlignBench: A Framework and Benchmark for Hindi-Telugu with English-Aligned Samples

Rishikant Chigrupaatii, Ponnada Sai Tulasi Kanishka, Lalit Chandra Routhu, Martin Patel Sama Supratheek Reddy, Divyam Gupta, Dasari Srikar, Krishna Teja Kuchimanchi, Rajiv Misra, Rohun Tripathi

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 6 篇

2509.24473 2025-11-20 cs.CV cs.AI cs.CL cs.LG 85%

Euclid's Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks

Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) East China Normal University(华东师范大学) Zhengzhou University(郑州大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24709 2025-11-20 cs.CV 57%

IWR-Bench: Can LVLMs reconstruct interactive webpage from a user interaction video?

Yang Chen, Minghao Liu, Yufan Shen, Yunwen Li, Tianyuan Huang, Xinyu Fang, Tianyu Zheng, Wenxuan Huang, Cheng Yang, Daocheng Fu, Jianbiao Mei, Rong Wu, Yunfei Zhao, Licheng Wen, Xuemeng Yang, Song Mao, Qunshu Lin, Zhi Yu, Yongliang Shen, Yu Qiao, Botian Shi

机构 * IWR-Bench Team(IWR-Bench团队)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14884 2025-11-20 cs.CV 57%

GeoSceneGraph: Geometric Scene Graph Diffusion Model for Text-guided 3D Indoor Scene Synthesis

Antonio Ruiz, Tao Wu, Andrew Melnik, Qing Cheng, Xuqin Wang, Lu Liu, Yongliang Wang, Yanfeng Zhang, Helge Ritter

机构 * Huawei Technologies(华为技术有限公司) Center for Cognitive Interaction Technology (CITEC), Bielefeld University(认知交互技术中心(CITEC),比勒菲尔德大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14777 2025-11-20 cs.AI 57%

The Illusion of Procedural Reasoning: Measuring Long-Horizon FSM Execution in LLMs

Mahdi Samiei, Mahdi Mansouri, Mahdieh Soleymani Baghshah

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00261 2025-11-20 cs.CV cs.HC 57%

Spot The Ball: A Benchmark for Visual Social Inference

Neha Balamurugan, Sarah Wu, Adam Chun, Gabe Gaw, Cristobal Eyzaguirre, Tobias Gerstenberg

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12001 2025-11-20 cs.CL cs.HC 50%

Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations

Eunkyu Park, Wesley Hanwen Deng, Vasudha Varadarajan, Mingxi Yan, Gunhee Kim, Maarten Sap, Motahhare Eslami

机构 * Seoul National University(首尔国立大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学)

专题命中 视觉推理 :vision language model(abstract)

Comments Under review; 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 5 篇

2511.15333 2025-11-20 cs.RO 89%

C2F-Space: Coarse-to-Fine Space Grounding for Spatial Instructions using Vision-Language Models

Nayoung Oh, Dohyun Kim, Junhyeong Bang, Rohan Paul, Daehyung Park

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract)

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15379 2025-11-20 cs.CV 79%

Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training

零样本开放词汇人体运动接地与测试时训练

Yunjiao Zhou, Xinyan Chen, Junlang Qian, Lihua Xie, Jianfei Yang

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出ZOMG框架,通过语言语义分区和软掩码优化,在无需标注或微调的情况下实现零样本开放词汇的人体运动接地,提升了运动理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15159 2025-11-20 cs.CV cs.AI cs.CL cs.LG 67%

Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation

Firdavs Nasriddinov, Rafal Kocielnik, Anima Anandkumar, Andrew J. Hung

机构 * California Institute of Technology(加州理工学院) Cedars-Sinai Medical Center(Cedars-Sinai 医疗中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as proceedings paper for ML4H 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15210 2025-11-20 cs.CL cs.AI cs.LG 62%

Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story

Vladislav Pedashenko, Laida Kushnareva, Yana Khassan Nibal, Eduard Tulchinskii, Kristian Kuznetsov, Vladislav Zharchinskii, Yury Maximov, Irina Piontkovskaya

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15272 2025-11-20 quant-ph cs.CR cs.NI 50%

QADR: A Scalable, Quantum-Resistant Protocol for Anonymous Data Reporting

Nilesh Vyas, Konstantin Baier

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2511.15059 2025-11-20 cs.CV cs.CL 79%

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(日本国立信息机构) NII LLMC Tokyo, Japan(日本国立信息机构LLMC东京)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2505.23596 2025-11-20 cs.AI 57%

Agent-SAMA: State-Aware Mobile Assistant

Linqiang Guo, Wei Liu, Yi Wen Heng, Tse-Hsun, Chen, Yang Wang

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

Comments Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2505.14160 2025-11-20 cs.CL cs.LG 83%

Breaking Language Barriers or Reinforcing Bias? A Study of Gender and Racial Disparities in Multilingual Contrastive Vision Language Models

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05923 2025-11-20 cs.CV 79%

Causal Tracing of Object Representations in Large Vision Language Models: Mechanistic Interpretability and Hallucination Mitigation

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Weitao Ma, Xiachong Feng

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15435 2025-11-20 cs.CV cs.AI cs.IR 62%

HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation

HV-Attack:多模态检索增强生成的分层视觉攻击

Linyin Luo, Yujuan Ding, Yunshan Ma, Wenqi Fan, Hanjiang Lai

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-Sen University(中山大学) Singapore Management University(新加坡管理学院)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种分层视觉攻击方法,通过在图像输入中添加不可察觉扰动,破坏多模态检索增强生成系统的检索和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15005 2025-11-20 cs.CL cs.AI 57%

Mathematical Analysis of Hallucination Dynamics in Large Language Models: Uncertainty Quantification, Advanced Decoding, and Principled Mitigation

Moses Kiprono

机构 * Catholic University of America(美国天主教大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments 10 pages, theoretical/mathematical LLM research, no figures, intended for peer-reviewed journal

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 5 篇

2511.00917 2025-11-20 cs.RO cs.AI 83%

Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots

Junyao Shi, Rujia Yang, Kaitian Chao, Selina Bingqing Wan, Yifei Shao, Jiahui Lei, Jianing Qian, Long Le, Pratik Chaudhari, Kostas Daniilidis, Chuan Wen, Dinesh Jayaraman

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

Comments Plan to resubmit after significant revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24804 2025-11-20 cs.CV cs.CL 83%

Conflict Adaptation in Vision-Language Models

Xiaoyang Hu

机构 * Brown University(布朗大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV

Comments Workshop on Interpreting Cognition in Deep Learning Models at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15316 2025-11-20 cs.CV 57%

What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs

Zhihan Ren, Lijun He, Jiaxi Liang, Xinzhu Fu, Haixia Bi, Fan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12079 2025-11-20 cs.CV 57%

Point Cloud Quantization through Multimodal Prompting for 3D Understanding

Hongxuan Li, Wencheng Zhu, Huiying Xu, Xinzhong Zhu, Pengfei Zhu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18757 2025-11-20 cs.CV 57%

ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学计算机科学与技术学院) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 2 篇

2511.15633 2025-11-20 cs.CV cs.LG 62%

Hierarchical Semantic Tree Anchoring for CLIP-Based Class-Incremental Learning

基于CLIP的层次语义树锚定的类增量学习

Tao Hu, Lan Li, Zhen-Hao Xie, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 HASTEN通过层次语义树锚定方法,有效解决CLIP类增量学习中的灾难性遗忘问题,提升模型对层次化类别结构的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13326 2025-11-20 stat.AP cs.AI 57%

TacEleven: generative tactic discovery for football open play

Siyao Zhao, Hao Ma, Zhiqiang Pu, Jingjing Huang, Yi Pan, Shijie Wang, Zhi Ming

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(交叉科学学院,中国科学院大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shanghai AI Laboratory(上海人工智能实验室) Association de la Jeunesse Auxerroise(亚眠青年协会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏