arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-05 至 2025-12-05 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2510.06783 2025-12-05 cs.CV 83%

TTRV: Test-Time Reinforcement Learning for Vision Language Models

TTRV:用于视觉语言模型的测试时间强化学习

Akshit Singh, Shyam Marjit, Wei Lin, Paul Gavrikov, Serena Yeung-Levy, Hilde Kuehne, Rogerio Feris, Sivan Doveh, James Glass, M. Jehanzeb Mirza

机构 * IISc Bangalore(班加罗尔印度理工学院) JKU Linz(林茨约翰·凯撒大学) Stanford(斯坦福大学) Tübingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) MIT CSAIL Project(麻省理工CSAIL项目)

专题命中 视觉问答 :vision language model(title);InternVL(abstract);visual question answering(abstract);分类 cs.CV

AI总结 TTRV通过测试时间强化学习提升视觉语言模型的识别和问答性能,无需标记数据,在多个任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 82%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏