arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-28 至 2025-08-28 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2508.19376 2025-08-28 cs.LG cs.AI cs.CV hep-ex 85%

Fine-Tuning Vision-Language Models for Neutrino Event Analysis in High-Energy Physics Experiments

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊文斯顿分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19639 2025-08-28 cs.MM 82%

FakeSV-VLM: Taming VLM for Detecting Fake Short-Video News via Progressive Mixture-Of-Experts Adapter

Junxi Wang, Yaxiong Wang, Lechao Cheng, Zhun Zhong

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19295 2025-08-28 cs.CV cs.LG 76%

Large VLM-based Stylized Sports Captioning

Sauptik Dhar, Nicholas Buoncristiani, Joe Anakata, Haoyu Zhang, Michelle Munson

机构 * Eluvio AI Labs(Eluvio AI实验室)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01824 2025-08-28 cs.CV cs.AI cs.LG cs.MM 75%

X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models

Zeyi Sun, Ziyang Chu, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(创新香港科技促进会) MThreads AI

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments code: https://github.com/SunzeY/X-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19298 2025-08-28 cs.CV cs.AI 73%

DemoBias: An Empirical Study to Trace Demographic Biases in Vision Foundation Models

Abu Sufian, Anirudha Ghosh, Debaditya Barman, Marco Leo, Cosimo Distante

机构 * CNR-ISASI(意大利那不勒斯) Visva-Bharati(维斯瓦-巴哈蒂)

专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 4 figures, 13th International Workshop on Biometrics and Forensics (IWBF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19254 2025-08-28 cs.CV cs.AI cs.HC 62%

Real-Time Intuitive AI Drawing System for Collaboration: Enhancing Human Creativity through Formal and Contextual Intent Integration

Jookyung Song, Mookyoung Kang, Nojun Kwak

机构 * SNU(首尔国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 6 pages, 4 figures, NeurIPS Creative AI Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19527 2025-08-28 cs.CV 57%

MotionFlux: Efficient Text-Guided Motion Generation through Rectified Flow Matching and Preference Alignment

Zhiting Gao, Dan Song, Diqiong Jiang, Chao Xue, An-An Liu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18634 2025-08-28 cs.CV 57%

OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward

Chunlin Zhong, Qiuxia Hou, Zhangjun Zhou, Shuang Hao, Haonan Lu, Yanhao Zhang, He Tang, Xiang Bai

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments 9 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏