arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-05 至 2025-11-05 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2510.16888 2025-11-05 cs.CV 83%

Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback

Zongjian Li, Zheyuan Liu, Qihui Zhang, Bin Lin, Feize Wu, Shenghai Yuan, Zhiyuan Yan, Yang Ye, Wangbo Yu, Yuwei Niu, Shaodong Wang, Xinhua Cheng, Li Yuan

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21375 2025-11-05 cs.CV 83%

GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution

Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang

机构 * College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院) Beijing University of Posts and Telecommunications, China(北京邮电大学) School of Computer Science, Wuhan University, China(武汉大学计算机学院) Zhongguancun Academy, China(中关村学院) Tsinghua University, China(清华大学) Beihang University, China(北航大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments NeurlPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02367 2025-11-05 cs.HC 82%

The Pervasive Blind Spot: Benchmarking VLM Inference Risks on Everyday Personal Videos

Shuning Zhang, Zhaoxin Li, Changxi Wen, Ying Ma, Simin Li, Gengrui Zhang, Ziyi Zhang, Yibo Meng, Hantao Zhao, Xin Yi, Hewu Li

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 78%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 VLM训练与架构 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25067 2025-11-05 cs.CV 70%

DRIP: Dynamic patch Reduction via Interpretable Pooling

Yusen Peng, Sachin Kumar

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

Comments Need more refinement

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01894 2025-11-05 cs.GR cs.AI cs.LG 62%

LGCC: Enhancing Flow Matching Based Text-Guided Image Editing with Local Gaussian Coupling and Context Consistency

Fangbing Liu, Pengfei Duan, Wen Li, Yi He

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03093 2025-11-05 cs.LG 57%

From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit

Valérie Costa, Thomas Fel, Ekdeep Singh Lubana, Bahareh Tolooshams, Demba Ba

机构 * EPFL(瑞士联邦理工学院) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能CBSTNTT项目) Physics of Artificial Intelligence Group, NTT Research, Inc., Sunnyvale, CA, USA(NTT研究公司人工智能物理研究组) University of Alberta(阿尔伯塔大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所) SEAS, Harvard University(哈佛大学工程与应用科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02094 2025-11-05 cs.AI 57%

Automated Reward Design for Gran Turismo

Michel Ma, Takuma Seno, Kaushik Subramanian, Peter R. Wurman, Peter Stone, Craig Sherstan

机构 * Mila, University of Montreal(蒙特利尔大学Mila) Turing Inc.(图灵公司) Sony AI(索尼人工智能) Sony AI, UT Austin(索尼人工智能、得克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏