arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-27 至 2025-11-27 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 9 篇

2511.21150 2025-11-27 cs.CV cs.AI 84%

LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs

LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码

Shichu Sun, Yichen Zhang, Haolin Song, Zonghao Guo, Chi Chen, Yidan Zhang, Yuan Yao, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06283 2025-11-27 cs.CV 83%

TinyChemVL: Advancing Chemical Vision-Language Models via Efficient Visual Token Reduction and Complex Reaction Tasks

TinyChemVL:通过高效视觉标记减少和复杂反应任务推进化学视觉-语言模型

Xuanle Zhao, Shuxin Zeng, Xinyuan Cai, Xiang Cheng, Duzhen Zhang, Xiuyi Chen, Bo Xu

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TinyChemVL通过高效视觉标记减少和复杂反应任务提升化学视觉-语言模型的效率和推理能力,实现更高效的化学任务处理。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16595 2025-11-27 cs.CV cs.AI cs.CL 81%

TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding

TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型

Boshen Xu, Zihan Xiao, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Jian Luan, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。

Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 79%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 70%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20770 2025-11-27 cs.CV 70%

Text-Guided Semantic Image Encoder

基于文本的语义图像编码器

Raghuveer Thirukovalluru, Xiaochuang Han, Bhuwan Dhingra, Emily Dinan, Maha Elbayad

机构 * Duke University(杜克大学) FAIR at Meta(Meta的FAIR)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出基于文本的语义图像编码器,通过文本指导生成图像表示,提升视觉-语言模型在多个基准测试中的性能,并提高推理效率。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL 70%

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20997 2025-11-27 cs.LG cs.AI 62%

FANoise: Singular Value-Adaptive Noise Modulation for Robust Multimodal Representation Learning

FANoise:奇异值自适应噪声调制用于鲁棒多模态表示学习

Jiaoyang Li, Jun Fang, Tianhao Gao, Xiaohui Zhang, Zhiyuan Liu, Chao Liu, Pengzhang Liu, Qixia Jiang

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 FANoise通过自适应噪声注入策略提升多模态表示学习的鲁棒性和性能

Comments 13 pages, 5 figures, accept to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20683 2025-11-27 cs.CL 50%

Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches

动态模板选择用于输出标记生成优化:基于MLP和Transformer的方法

Bharadwaj Yadavalli

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出动态模板选择方法,通过MLP和Transformer路由策略优化输出标记生成,实现成本降低与响应质量的平衡。

Comments 20 pages, 4 figures, includes production-scale experiments across OpenAI GPT-4, Google Gemini, and Anthropic Claude; code available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏