arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-05 至 2025-08-05 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 10 篇

2508.01380 2025-08-05 cs.CV cs.AI 81%

Effective Damage Data Generation by Fusing Imagery with Human Knowledge Using Vision-Language Models

Jie Wei, Erika Ardiles-Cruz, Aleksey Panasyuk, Erik Blasch

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments 6 pages, IEEE NAECON'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01236 2025-08-05 cs.CV 79%

Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models

Mingyu Fu, Wei Suo, Ji Ma, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室) Swansea University(斯旺西大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

Comments accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16326 2025-08-05 cs.LG 79%

ChemMLLM: Chemical Multimodal Large Language Model

Qian Tan, Dongzhan Zhou, Peng Xia, Wanhao Liu, Wanli Ouyang, Lei Bai, Yuqiang Li, Tianfan Fu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10342 2025-08-05 cs.CV cs.AI 62%

UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models

Jun Yin, Jing Zhong, Peilin Li, Ruolin Pan, Pengyu Zeng, Miao Zhang, Shuai Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07739 2025-08-05 cs.CV cs.AI 62%

ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models

Jing Zhong, Jun Yin, Peilin Li, Pengyu Zeng, Miao Zang, Ran Luo, Shuai Lu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06690 2025-08-05 cs.SD cs.AI cs.MM 57%

Benchmarking Sub-Genre Classification For Mainstage Dance Music

Hongzhi Shu, Xinglin Li, Hongyu Jiang, Minghao Fu, Xinyu Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01074 2025-08-05 cs.CV cs.CR 57%

Evading Data Provenance in Deep Neural Networks

Hongyu Zhu, Sichu Liang, Wenwen Wang, Zhuomeng Zhang, Fangqi Li, Shi-Lin Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04981 2025-08-05 cs.CV 57%

AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting

Xiaoyu Zhou, Jingqi Wang, Yongtao Wang, Yufei Wei, Nan Dong, Ming-Hsuan Yang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Chongqing Changan Automobile Co., Ltd(重庆长安汽车有限公司) University of California, Merced(加州大学默塞德分校)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 Hightlight (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02173 2025-08-05 cs.HC 50%

EchoLadder: Progressive AI-Assisted Design of Immersive VR Scenes

Zhuangze Hou, Jingze Tian, Nianlong Li, Farong Ren, Can Liu

专题命中 其他VLM :vision-language model(abstract)

Comments To appear at UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01092 2025-08-05 cs.HC 50%

DescribePro: Collaborative Audio Description with Human-AI Interaction

Maryam Cheema, Sina Elahimanesh, Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 其他VLM :multimodal large language model(abstract)

Comments ASSETS 25 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏