arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-29 至 2025-08-29 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2508.16188 2025-08-29 cs.CL cs.CV cs.MM cs.SD eess.AS 79%

Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation

Weiting Tan, Jiachen Lian, Hirofumi Inaguma, Paden Tomasello, Philipp Koehn, Xutai Ma

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta AI Research(Meta AI 研究)

专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20181 2025-08-29 cs.CV cs.AI cs.CL cs.MM 73%

Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization

Alberto Compagnoni, Davide Caffagni, Nicholas Moratelli, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21066 2025-08-29 cs.CV 70%

OneReward: Unified Mask-Guided Image Generation via Multi-Task Human Preference Learning

Yuan Gong, Xionghui Wang, Jie Wu, Shiyin Wang, Yitong Wang, Xinglong Wu

机构 * ByteDance Inc.(字节跳动公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments project url: https://one-reward.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16201 2025-08-29 cs.CV cs.AI cs.CL 62%

SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning

Yicheng Ji, Jun Zhang, Heming Xia, Jinpeng Chen, Lidan Shou, Gang Chen, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21044 2025-08-29 cs.CV 57%

MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs

Junpeng Ma, Qizhe Zhang, Ming Lu, Zhibin Wang, Qiang Zhou, Jun Song, Shanghang Zhang

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18674 2025-08-29 cs.CV 57%

Image-guided topic modeling for interpretable privacy classification

Alina Elena Baia, Andrea Cavallaro

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

Comments Paper accepted at the eXCV Workshop at ECCV 2024. Supplementary material included. Code available at https://github.com/idiap/itm

详情

展开后加载摘要…

URL PDF HTML 收藏