arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-25 至 2025-12-25 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 3 篇

2512.20916 2025-12-25 cs.IR cs.MM 82%

MMSRARec: Summarization and Retrieval Augumented Sequential Recommendation Based on Multimodal Large Language Model

MMSRARec: 基于多模态大语言模型的摘要与检索增强的序列推荐

Haoyu Wang, Yitong Wang, Jining Wang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出MMSRARec,基于多模态大语言模型,通过摘要与检索增强序列推荐,提升推荐性能、可解释性与计算效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 79%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20675 2025-12-25 cs.LG cs.AI 73%

Revisiting the Learning Objectives of Vision-Language Reward Models

重新审视视觉-语言奖励模型的学习目标

Simon Roy, Samuel Barbeau, Giovanni Beltrame, Christian Desrosiers, Nicolas Thome

机构 * Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) Sorbonne Université(索邦大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估了基于VLM的奖励模型,发现简单三元组损失在性能上优于现有方法,表明改进可能源于数据和架构差异。

Comments Published as an extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏