arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-25 至 2025-08-25 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2508.16148 2025-08-25 cs.IR cs.CL cs.MM 67%

Hierarchical Vision-Language Reasoning for Multimodal Multiple-Choice Question Answering

Ao Zhou, Zebo Gu, Tenghao Sun, Jiawen Chen, Mingsheng Tu, Zifeng Cheng, Yafeng Yin, Zhiwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract)

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16081 2025-08-25 cs.CL cs.LG 57%

CEQuest: Benchmarking Large Language Models for Construction Estimation

Yanzhao Wu, Lufan Wang, Rui Liu

机构 * Florida International University(佛罗里达国际大学) University of Florida(佛罗里达大学)

专题命中 视觉问答 :LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16139 2025-08-25 cs.CL 50%

XLQA: A Benchmark for Locale-Aware Multilingual Open-Domain Question Answering

Keon-Woo Roh, Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学)

专题命中 视觉问答 :grounding(abstract)

Comments Accepted to EMNLP 2025 main conference. 12 pages, 4 figures, 7 tables. Code is available at https://github.com/ro-ko/XLQA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 3 篇

2508.15802 2025-08-25 cs.CL cs.AI 83%

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

Mohan Jiang, Jin Gao, Jiahao Zhan, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14879 2025-08-25 cs.GR cs.CV 57%

MeshCoder: LLM-Powered Structured Mesh Code Generation from Point Clouds

Bingquan Dai, Li Ray Luo, Qihong Tang, Jie Wang, Xinyu Lian, Hao Xu, Minghan Qin, Xudong Xu, Bo Dai, Haoqian Wang, Zhaoyang Lyu, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) AI Thrust, HKUST(GZ)(AI thrust, 香港科技大学(广州))

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15854 2025-08-25 cs.CL 50%

QU-NLP at QIAS 2025 Shared Task: A Two-Phase LLM Fine-Tuning and Retrieval-Augmented Generation Approach for Islamic Inheritance Reasoning

Mohammad AL-Smadi

机构 * Qatar University(卡塔尔大学)

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 4 篇

2508.16157 2025-08-25 cs.CV cs.AI 62%

Beyond Human-prompting: Adaptive Prompt Tuning with Semantic Alignment for Anomaly Detection

Pi-Wei Chen, Jerry Chun-Wei Lin, Wei-Han Chen, Jia Ji, Zih-Ching Chen, Feng-Hao Yeh, Chao-Chun Chen

机构 * Silesian University of Technology(西里西亚技术大学) National Cheng Kung University(国立成功大学) Nvidia AI Technology Center(Nvidia AI技术中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15930 2025-08-25 cs.CV 57%

Semantic-Aware Ship Detection with Vision-Language Integration

Jiahao Li, Jiancheng Pan, Yuze Sun, Xiaomeng Huang

机构 * Department of Earth System Science, Tsinghua University 100084 Beijing, China(地球系统科学系,清华大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15904 2025-08-25 cs.CV 57%

Boosting Pathology Foundation Models via Few-shot Prompt-tuning for Rare Cancer Subtyping

Dexuan He, Xiao Zhou, Wenbin Guan, Liyuan Zhang, Xiaoman Zhang, Sinuo Xu, Ge Wang, Lifeng Wang, Xiaojun Yuan, Xin Sun, Yanfeng Wang, Kun Sun, Ya Zhang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Oral Pathology, Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院第九人民医院口腔病学部) Department of Pathology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院病理科) Department of Pediatric Hematology/Oncology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院儿童血液肿瘤科) Clinical Research and Innovation Unit, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院新华医院临床研究与创新单元) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09071 2025-08-25 cs.CL 50%

Exploration of Plan-Guided Summarization for Narrative Texts: the Case of Small Language Models

Matt Grenander, Siddharth Varia, Paula Czarnowska, Yogarshi Vyas, Kishaloy Halder, Bonan Min

机构 * AWS AI Labs(AWS人工智能实验室) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Accepted to the 7th Workshop on Narrative Understanding (WNU), co-located with NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2508.16320 2025-08-25 physics.ed-ph 50%

AI-Supported Mini-Labs: Combining Smartphone-Based Experiments and Multimodal AI

Jochen Kuhn, David J. Rakestraw, Stefan Küchemann, Patrik Vogt

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 5 篇

2508.15903 2025-08-25 cs.CV 83%

VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos

Kaining Li, Shuwei He, Zihan Xu

机构 * Xidian University(西电大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11695 2025-08-25 cs.CV cs.CL cs.MM 83%

Interpreting the linear structure of vision-language model embedding spaces

Isabel Papadimitriou, Huangyuan Su, Thomas Fel, Sham Kakade, Stephanie Gil

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学自然与人工智能研究所) Department of Computer Science, Harvard University(哈佛大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06860 2025-08-25 cs.CV cs.GR 83%

AutoSketch: VLM-assisted Style-Aware Vector Sketch Completion

Hsiao-Yuan Chin, I-Chao Shen, Yi-Ting Chiu, Ariel Shamir, Bing-Yu Chen

机构 * National Taiwan University(国立台湾大学) The University of Tokyo(东京大学) Reichman University(里奇曼大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 11 pages, Hsiao-Yuan Chin and I-Chao Shen contributed equally to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01225 2025-08-25 cs.CV cs.AI 76%

Multi-Cache Enhanced Prototype Learning for Test-Time Generalization of Vision-Language Models

Xinyu Chen, Haotian Zhai, Can Zhang, Xiupeng Shi, Ruirui Li

机构 * Shanghai University(上海大学) Beijing University of Chemical Technology(北京化工大学) University of Minnesota(明尼苏达大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03789 2025-08-25 cs.CV 57%

HPSv3: Towards Wide-Spectrum Human Preference Score

Yuhang Ma, Yunhao Shui, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

机构 * Mizzen AI CUHK MMLab(香港大学MMLab) King’s College London(伦敦国王学院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CPII, InnoHK(创新香港科技促进会)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 1 篇

2508.16158 2025-08-25 cs.CV 57%

RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution

Haodong He, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Amap, Alibaba Group(阿里巴巴集团阿里的)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏