arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-13 至 2026-02-13 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2602.12002 2026-02-13 cs.CV 83%

Can Local Vision-Language Models improve Activity Recognition over Vision Transformers? -- Case Study on Newborn Resuscitation

局部视觉-语言模型能否在视觉转换器上提高活动识别?——新生儿复苏案例研究

Enrico Guerriero, Kjersti Engan, Øyvind Meinich-Bache

机构 * University of Stavanger, Dept. of electrical eng. and computer science(斯塔万格大学电气工程与计算机科学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究探讨了局部视觉-语言模型在新生儿复苏视频活动识别中的应用,通过LoRA微调提升性能,达到0.91的F1分数,优于TimeSFormer基线。

Comments Presented at the Satellite Workshop on Workshop 15: Generative AI for World Simulations and Communications & Celebrating 40 Years of Excellence in Education: Honoring Professor Aggelos Katsaggelos, IEEE International Conference on Image Processing (ICIP), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11636 2026-02-13 cs.CV cs.AI 73%

ScalSelect: Scalable Training-Free Multimodal Data Selection for Efficient Visual Instruction Tuning

ScalSelect: 可扩展的无训练多模态数据选择用于高效的视觉指令微调

Changti Wu, Jiahuai Mao, Yuzhuo Miao, Shijie Lian, Bin Yu, Xiaopeng Lin, Cong Huang, Lei Zhang, Kai Chen

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 ScalSelect提出一种无训练、可扩展的多模态数据选择方法,通过线性时间复杂度实现高效视觉指令微调,实验显示其性能接近甚至超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/ScalSelect}{ScalSelect}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11957 2026-02-13 cs.LG 70%

Are Two LLMs Better Than One? A Student-Teacher Dual-Head LLMs Architecture for Pharmaceutical Content Optimization

两个大语言模型是否比一个更好?一种学生-教师双头大语言模型架构用于药学内容优化

Suyash Mishra, Qiang Li, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本研究提出一种学生-教师双头大语言模型架构,用于提升药学内容的合规性与准确性,通过模块化设计和规则过滤实现高效质量控制。

Comments Submitted to the Demo Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09843 2026-02-13 cs.CV 57%

Kelix Technical Report

Kelix技术报告

Boyang Ding, Chenglong Chu, Dunju Zang, Han Li, Jiangxia Cao, Kun Gai, Muhao Wei, Ruiming Tang, Shiyao Wang, Siyang Mao, Xinchen Luo, Yahui Liu, Zhixin Ling, Zhuoran Yang, Ziming Li, Chengru Song, Guorui Zhou, Guowang Zhang, Hao Peng, Hao Wang, Jiaxin Deng, Jin Ouyang, Jinghao Zhang, Lejian Ren, Qianqian Wang, Qigen Hu, Tao Wang, Xingmei Wang, Yiping Yang, Zixing Zhang, Ziqi Wang

机构 * Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 Kelix是一种完全离散的自回归统一模型,旨在缩小离散和连续视觉表示之间的理解差距。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11757 2026-02-13 cs.CV 57%

Code2Worlds: Empowering Coding LLMs for 4D World Generation

Code2Worlds: 赋能编码大语言模型进行4D世界生成

Yi Zhang, Yunshuang Wang, Zeyu Zhang, Hao Tang

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 Code2Worlds通过双流架构和闭环机制,提升编码大语言模型在4D世界生成中的动态真实性和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09070 2026-02-13 cs.SD cs.AI eess.AS 57%

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏