arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-25 至 2025-09-25 共收录 36 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2412.14480 2025-09-25 cs.RO cs.CL cs.CV cs.LG 73%

GraphEQA: Using 3D Semantic Scene Graphs for Real-time Embodied Question Answering

Saumya Saxena, Blake Buchanan, Chris Paxton, Peiqi Liu, Bingqing Chen, Narunas Vaskevicius, Luigi Palmieri, Jonathan Francis, Oliver Kroemer

机构 * Carnegie Mellon University(卡内基梅隆大学) Neya Systems(Neya系统) Agility Robotics(敏捷机器人) Hello Robot Bosch Center for AI(博世人工智能中心)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

Comments Project website: https://saumyasaxena.github.io/grapheqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20119 2025-09-25 cs.CV 70%

A Simple Data Augmentation Strategy for Text-in-Image Scientific VQA

Belal Shoer, Yova Kementchedjhieva

机构 * MBZUAI(穆罕默德·本·拉希德智能研究院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at WiNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04931 2025-09-25 cs.CV 57%

Long Video Understanding with Learnable Retrieval in Video-Language Models

Jiaqi Xu, Cuiling Lan, Wenxuan Xie, Xuejin Chen, Yan Lu

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉问答 :VLM(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20007 2025-09-25 cs.CL 50%

DiffNator: Generating Structured Explanations of Time-Series Differences

Kota Dohi, Tomoya Nishida, Harsh Purohit, Takashi Endo, Yohei Kawaguchi

机构 * Research and Development Group, Hitachi, Ltd.(日立株式会社研发部)

专题命中 视觉问答 :visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2509.19841 2025-09-25 cs.CV 83%

ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection

Tai-Ming Huang, Wei-Tung Lin, Kai-Lung Hua, Wen-Huang Cheng, Junichi Yamagishi, Jun-Cheng Chen

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12587 2025-09-25 cs.CV 74%

Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models

Tan-Hanh Pham, Chris Ngo

机构 * Harvard Medical School, Harvard University(哈佛医学院、哈佛大学) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院) Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)

专题命中 视觉推理 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13143 2025-09-25 cs.RO cs.AI cs.CV 73%

SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation

Zekun Qi, Wenyao Zhang, Yufei Ding, Runpei Dong, Xinqiang Yu, Jingwen Li, Lingyun Xu, Baoyu Li, Xialin He, Guofan Fan, Jiazhao Zhang, Jiawei He, Jiayuan Gu, Xin Jin, Kaisheng Ma, Zhizheng Zhang, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) UIUC(伊利诺伊大学香槟分校) ShanghaiTech University(上海交通大学) Eastern Institute of Technology(技术研究所) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉推理 :VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20021 2025-09-25 cs.AI cs.CL cs.RO 57%

Embodied AI: From LLMs to World Models

Tongtong Feng, Xin Wang, Yu-Gang Jiang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.AI

Comments Accepted by IEEE CASM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11959 2025-09-25 cs.AI 57%

STRIVE: Structured Reasoning for Self-Improvement in Claim Verification

Haisong Gong, Jing Li, Junfei Wu, Qiang Liu, Shu Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR) Institute of Automation, Chinese Academy of Scieneces(模式识别新实验室(NLPR)自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

Comments Accepted by Machine Intelligence Research (MIR)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 13 篇

2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 89%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23745 2025-09-25 cs.CV cs.AI cs.LG 85%

To Trust Or Not To Trust Your Vision-Language Model's Prediction

Hao Dong, Moru Liu, Jian Liang, Eleni Chatzi, Olga Fink

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02876 2025-09-25 cs.CV cs.LG 84%

Multimodal Reference Visual Grounding

Yangxiao Lu, Ruosen Li, Liqiang Jing, Jikai Wang, Xinya Du, Yunhui Guo, Nicholas Ruozzi, Yu Xiang

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments Project page with our code and dataset: https://irvlutd.github.io/MultiGrounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06899 2025-09-25 cs.CL cs.AI 83%

VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation

Ziang Ye, Yang Zhang, Wentao Shi, Xiaoyu You, Fuli Feng, Tat-Seng Chua

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) East China University of Science and Technology(东华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI

Comments Accepted in COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19090 2025-09-25 cs.CV cs.AI cs.CL 81%

Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning

Guoxin Wang, Jun Zhao, Xinyi Liu, Yanbo Liu, Xuyang Cao, Chao Li, Zhuoyun Liu, Qintian Sun, Fangru Zhou, Haoqiang Xing, Zhenhong Yang

机构 * JDH Algo(京东健康算法)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19875 2025-09-25 cs.CV cs.AI 73%

Adaptive Guidance Semantically Enhanced via Multimodal LLM for Edge-Cloud Object Detection

Yunqing Hu, Zheming Yang, Chang Zhao, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries(工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19843 2025-09-25 cs.CV cs.RO 57%

PersONAL: Towards a Comprehensive Benchmark for Personalized Embodied Agents

Filippo Ziliotto, Jelin Raphael Akkara, Alessandro Daniele, Lamberto Ballan, Luciano Serafini, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·科塞拉基金会)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19326 2025-09-25 cs.CL cs.AI 57%

Unveiling the Merits and Defects of LLMs in Automatic Review Generation for Scientific Papers

Ruochi Li, Haoxuan Zhang, Edward Gehringer, Ting Xiao, Junhua Ding, Haihua Chen

机构 * North Carolina State University(北卡罗来纳州立大学) University of North Texas(德克萨斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted as short paper at 25th IEEE International Conference on Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19322 2025-09-25 cs.CL cs.AI 57%

Readme_AI: Dynamic Context Construction for Large Language Models

Millie Vyas, Timothy Blattner, Alden Dima

机构 * Purdue University(普渡大学) National Institute of Standards and Technology(国家标准技术研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16180 2025-09-25 cs.CV cs.CL 57%

Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密苏里州南方大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05926 2025-09-25 cs.CL 50%

LLMs Reproduce Stereotypes of Sexual and Gender Minorities

Ruby Ostrow, Adam Lopez

机构 * University of Edinburgh(爱丁堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 13 pages, 5 figures, 9 tables (including bibliography and appendix). Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19573 2025-09-25 cs.RO 50%

Chasing Stability: Humanoid Running via Control Lyapunov Function Guided Reinforcement Learning

Zachary Olkin, Kejun Li, William D. Compton, Aaron D. Ames

机构 * Technology Innovation Institute (TII)(技术创新研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Submitted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16254 2025-09-25 cs.HC 50%

Reassessing Collaborative Writing Theories and Frameworks in the Age of LLMs: What Still Applies and What We Must Leave Behind

Daisuke Yukita, Tim Miller, Joel Mackenzie

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 2 篇

2509.19768 2025-09-25 cs.CL cs.CV 83%

CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition

Sina J. Semnani, Han Zhang, Xinyan He, Merve Tekgürler, Monica S. Lam

机构 * Stanford University(斯坦福大学)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19760 2025-09-25 cs.CV 57%

Logics-Parsing Technical Report

Xiangyang Chen, Shuzhao Li, Xiuwen Zhu, Yongfan Chen, Fan Yang, Cheng Fang, Lin Qu, Xiaoxiao Xu, Hu Wei, Minggang Wu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 2 篇

2410.08792 2025-09-25 cs.RO cs.AI cs.CV cs.LG 89%

VLM See, Robot Do: Human Demo Video to Robot Action Plan via Vision Language Model

Beichen Wang, Juexiao Zhang, Shuwen Dong, Irving Fang, Chen Feng

机构 * New York University(纽约大学)

专题命中 GUI与屏幕智能体 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19958 2025-09-25 cs.RO 50%

Generalist Robot Manipulation beyond Action Labeled Data

Alexander Spiridonov, Jan-Nico Zaech, Nikolay Nikolov, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

Comments Accepted at Conference on Robot Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 4 篇

2509.20196 2025-09-25 cs.CV cs.LG 84%

Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

Dehong Kong, Sifan Yu, Siyuan Liang, Jiawei Liang, Jianhou Gan, Aishan Liu, Wenqi Ren

机构 * School of Cyber Science and Technology, SUN YAT-SEN UNIVERSITY(中山大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Key Laboratory of Education Informatization for Nationalities, Yunnan Normal University(云南师范大学民族教育信息化重点实验室) SCSE, Beihang University(北航软件学院)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20146 2025-09-25 cs.CV cs.AI 81%

EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models

Botai Yuan, Yutian Zhou, Yingjie Wang, Fushuo Huo, Yongcheng Jing, Li Shen, Ying Wei, Zhiqi Shen, Ziwei Liu, Tianwei Zhang, Jie Yang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19595 2025-09-25 cs.CL cs.CV 79%

Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models

Mohammad Saim, Phan Anh Duong, Cat Luong, Aniket Bhanderi, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19688 2025-09-25 cs.RO cs.LG cs.SY eess.SY math.OC 57%

Formal Safety Verification and Refinement for Generative Motion Planners via Certified Local Stabilization

Devesh Nath, Haoran Yin, Glen Chou

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.LG

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏