arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-07 至 2025-10-07 共收录 70 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 22 篇

2510.04819 2025-10-07 cs.CV cs.CL 57%

Visual Representations inside the Language Model

Benlin Liu, Amita Kamath, Madeleine Grunde-McLaughlin, Winson Han, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of California Los Angeles(加州大学洛杉矶分校) Allen Institute for AI(人工智能研究院)

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04623 2025-10-07 cs.AI 57%

MedPAO: A Protocol-Driven Agent for Structuring Medical Reports

Shrish Shrinath Vaidya, Gowthamaan Palani, Sidharth Ramesh, Velmurugan Balasubramanian, Minmini Selvam, Gokulraja Srinivasaraja, Ganapathy Krishnamurthi

机构 * Department of Data Science and AI, IIT Madras, India(数据科学与人工智能系,印度理工学院马德拉斯学院) Department of Engineering Design, IIT Madras, India(工程设计系,印度理工学院马德拉斯学院) LoveForm Health Technologies, India(LoveForm健康科技公司,印度) Department of Radiology and Imaging Sciences, Sri Ramachandra Institute of Higher Education and Research, India(放射学与成像科学系, Sri Ramachandra高等教育与研究学院,印度) Department of Neuro and Interventional Radiology, Sri Ramachandra Institute of Higher Education and Research, India(神经放射学与介入放射学系,Sri Ramachandra高等教育与研究学院,印度)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Paper published at "Agentic AI for Medicine" Workshop, MICCAI 2025

Journal ref Lecture Notes in Computer Science, vol 16147, 2025. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03955 2025-10-07 cs.CV 57%

Harnessing Synthetic Preference Data for Enhancing Temporal Understanding of Video-LLMs

Sameep Vani, Shreyas Jena, Maitreya Patel, Chitta Baral, Somak Aditya, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments 17 pages, 9 figures, 6 tables. Presents TimeWarp, a synthetic preference data framework to improve temporal understanding in Video-LLMs, showing consistent gains across seven benchmarks. Includes supplementary material in the Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23054 2025-10-07 cs.CV 57%

Mask What Matters: Controllable Text-Guided Masking for Self-Supervised Medical Image Analysis

Ruilang Wang, Shuotong Xu, Bowen Liu, Runlin Huang, Donglong Chen, Weifeng Su

机构 * Beijing Normal–Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18710 2025-10-07 cs.AI 57%

Autonomous Data Agents: A New Opportunity for Smart Data

Yanjie Fu, Dongjie Wang, Wangyang Ying, Xinyuan Wang, Xiangliang Zhang, Huan Liu, Jian Pei

机构 * Arizona State University(亚利桑那州立大学) University of Kansas(堪萨斯大学) University of Notre Dame(圣母大学) Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18569 2025-10-07 cs.CV 57%

VisualChef: Generating Visual Aids in Cooking via Mask Inpainting

Oleh Kuzyk, Zuoyue Li, Marc Pollefeys, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) TU Munich(慕尼黑工业大学) MCML

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments GCPR 2025 (oral presentation; Best Master's Thesis Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21815 2025-10-07 cs.IR cs.AI cs.CL 57%

Scientific Paper Retrieval with LLM-Guided Semantic-Based Ranking

Yunyi Zhang, Ruozhen Yang, Siqi Jiao, SeongKu Kang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03455 2025-10-07 cs.CV 57%

PEaRL: Pathway-Enhanced Representation Learning for Gene and Pathway Expression Prediction from Histology

Sejuti Majumder, Saarthak Kapse, Moinak Bhattacharya, Xuan Xu, Alisa Yurovsky, Prateek Prasanna

机构 * Department of Biomedical Informatics, Stony Brook University, NY, USA(生物医学信息学系,石溪大学,纽约,美国) Department of Computer Science, Stony Brook University, NY, USA(计算机科学系,石溪大学,纽约,美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03294 2025-10-07 cs.CV 57%

Domain-Robust Marine Plastic Detection Using Vision Models

Saanvi Kataria

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 16 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04569 2025-10-07 q-fin.TR 50%

Risk-Sensitive Option Market Making with Arbitrage-Free eSSVI Surfaces: A Constrained RL and Stochastic Control Bridge

Jian'an Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 34 pages including appendices; figures included. Primary subject class: q-fin.TR. Cross-lists: cs.LG; q-fin.CP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04049 2025-10-07 cs.PL 50%

Encoding Numeric Computations and Infusing Heuristic Knowledge Using Integrity Constraints in stableKanren

Xiangyu Guo, Ajay Bansal

专题命中 视觉定位与Grounding :grounding(abstract)

Comments 12 pages, 2 figures, ICFP '25 The miniKanren and Relational Programming Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04041 2025-10-07 cs.RO 50%

SITCOM: Scaling Inference-Time COMpute for VLAs

Ayudh Saxena, Harsh Shah, Sandeep Routray, Rishi Rajesh Shah, Esha Pahwa

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Accepted at the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI (SpaVLE). *Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05135 2025-10-07 cs.RO 50%

LERa: Replanning with Visual Feedback in Instruction Following

Svyatoslav Pchelintsev, Maxim Patratskiy, Anatoly Onishchenko, Alexandr Korchemnyi, Aleksandr Medvedev, Uliana Vinogradova, Ilya Galuzinsky, Aleksey Postnikov, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIPT(莫斯科国立交通大学) Sberbank of Russia, Robotics Center(俄罗斯储蓄银行机器人中心) AIRI

专题命中 视觉定位与Grounding :visual language model(abstract)

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 3 篇

2510.00245 2025-10-07 cs.HC cs.AI 57%

Can AI agents understand spoken conversations about data visualizations in online meetings?

Rizul Sharma, Tianyu Jiang, Seokki Lee, Jillian Aurisano

机构 * DaVInCi Laboratory(DaVInCi实验室) University of Cincinnati(克利夫兰大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.AI

Journal ref The 2nd MERCADO Workshop at IEEE VIS 2025: Multimodal Experiences for Remote Communication Around Data Online, IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11465 2025-10-07 cs.CL cs.LG 57%

CEMTM: Contextual Embedding-based Multimodal Topic Modeling

Amirhossein Abaskohi, Raymond Li, Chuyuan Li, Shafiq Joty, Giuseppe Carenini

专题命中 文档图表理解 :vision language model(abstract);分类 cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03341 2025-10-07 cs.CV 57%

OpusAnimation: Code-Based Dynamic Chart Generation

Bozheng Li, Miao Yang, Zhenhan Chen, Jiawang Cao, Mushui Liu, Yi Lu, Yongliang Wu, Bin Zhang, Yangguang Ji, Licheng Tang, Jay Wu, Wenbo Zhu

机构 * Opus AI Research(Opus人工智能研究机构) Brown University(布朗大学) Zhejiang University(浙江大学) University of Toronto(多伦多大学)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 5 篇

2510.04791 2025-10-07 cs.SE 78%

GUISpector: An MLLM Agent Framework for Automated Verification of Natural Language Requirements in GUI Prototypes

Kristian Kolthoff, Felix Kretzer, Simone Paolo Ponzetto, Alexander Maedche, Christian Bartelt

专题命中 GUI与屏幕智能体 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04246 2025-10-07 cs.RO cs.AI 70%

ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context

Huiwon Jang, Sihyun Yu, Heeseung Kwon, Hojin Jeon, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD UC Berkeley(伯克利大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

Comments Project page: https://huiwon-jang.github.io/contextvla

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03612 2025-10-07 cs.AI cs.CR 70%

Cross-Modal Content Optimization for Steering Web Agent Preferences

Tanqiu Jiang, Min Bai, Nikolaos Pappas, Yanjun Qi, Sandesh Swamy

机构 * Stony Brook University(石溪大学) AWS AI Labs(亚马逊人工智能实验室)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00413 2025-10-07 cs.CV 57%

PAL-UI: Planning with Active Look-back for Vision-Based GUI Agents

Zikang Liu, Junyi Li, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学全球化人工智能学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Alibaba Group(阿里巴巴集团)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05791 2025-10-07 cs.AI 57%

GTA1: GUI Test-time Scaling Agent

Yan Yang, Dongxu Li, Yutong Dai, Yuhao Yang, Ziyang Luo, Zirui Zhao, Zhiyuan Hu, Junzhe Huang, Amrita Saha, Zeyuan Chen, Ran Xu, Liyuan Pan, Silvio Savarese, Caiming Xiong, Junnan Li

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 4 篇

2507.16856 2025-10-07 cs.CV cs.AI 81%

SIA: Enhancing Safety via Intent Awareness for Vision-Language Models

Youngjin Na, Sangheon Jeong, Youngwan Lee, Jian Lee, Dawoon Jeong, Youngman Kim

机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ETRI(电子技术研究院) KAIST(韩国科学技术院)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14574 2025-10-07 cs.CV cs.AI 81%

Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark

Rashid Mushkani

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04560 2025-10-07 cs.AI 57%

ContextNav: Towards Agentic Multimodal In-Context Learning

Honghao Fu, Yuan Ouyang, Kai-Wei Chang, Yiwei Wang, Zi Huang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) Nanjing University(南京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Merced(加州大学默塞德分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04145 2025-10-07 cs.CV cs.CL cs.IR 57%

Automating construction safety inspections using a multi-modal vision-language RAG framework

Chenxin Wang, Elyas Asadi Shamsabadi, Zhaohui Chen, Luming Shen, Alireza Ahmadian Fard Fini, Daniel Dias-da-Costa

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

Comments 33 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 12 篇

2503.16965 2025-10-07 cs.CL cs.CV 83%

Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning

Zhe Hu, Jing Li, Zhongzhu Pu, Hou Pong Chan, Yu Yin

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) InspireOmni AI Alibaba Group(阿里巴巴集团) Case Western Reserve University(凯斯西储大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03978 2025-10-07 cs.CV cs.CL 83%

No Tokens Wasted: Leveraging Long Context in Biomedical Vision-Language Models

Min Woo Sun, Alejandro Lozano, Javier Gamazo Tejero, Vishwesh Nath, Xiao Xiao Sun, James Burgess, Yuhui Zhang, Kun Yuan, Robert Tibshirani, Sean Huver, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) NVIDIA USA(NVIDIA公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00534 2025-10-07 cs.CR cs.AI 79%

The Security Threat of Compressed Projectors in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Large Language Model Department, Tencent(腾讯大语言模型部门) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 VLM训练与架构 :vision-language model(title);visual language model(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14715 2025-10-07 cs.CV cs.AI 76%

Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models

Young Kyun Jang, Ser-nam Lim

机构 * Google DeepMind(谷歌DeepMind) University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18857 2025-10-07 cs.CV cs.LG 73%

Probabilistic Language-Image Pre-Training

Sanghyuk Chun, Wonjae Kim, Song Park, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Code: https://github.com/naver-ai/prolip HuggingFace Hub: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291 33 pages, 4.5 MB; LongProLIP paper: arXiv:2503.08048; Multiplicity paper for more background: arxiv.org:2505.19614; v4: fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏