arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2606.17410 2026-06-17 cs.CV 新提交 79%

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL 79%

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26292 2026-06-02 cs.CV cs.CL 79%

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Concordia University(康科迪亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。

Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22276 2026-06-02 cs.CV cs.CL 79%

WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models

WAON:用于对比视觉语言模型文化适应的大规模日语图像-文本数据集

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(日本国家研究所语言模型中心) NII(日本国家研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出WAON,一个从Common Crawl构建的包含约1.55亿样本的最大公开原生日语图像-文本数据集,并通过微调实验证明其在日语文化基准上优于翻译数据。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG 79%

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.LG

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV 79%

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07135 2026-06-01 cs.CV 79%

Few-Shot Adaptation Benchmark for Remote Sensing Vision-Language Models

遥感视觉语言模型的少样本适应基准

Karim El Khoury, Maxime Zanella, Christophe De Vleeschouwer, Benoit Macq

机构 * UCLouvain(乌尔特-洛文大学) UMons(蒙斯大学) Fonds de la Recherche Scientifique(科学基金组织)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出首个遥感视觉语言模型少样本适应基准,通过十个数据集和五种策略评估三个模型,发现零样本性能相似的模型在少样本适应下表现差异显著,需开发更鲁棒的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 79%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.LG

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26601 2026-05-27 cs.CV 79%

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

FTibSuite:面向藏语视觉语言建模的综合资源套件

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

机构 * Hainan International College, Minzu University of China(民族大学海南国际学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对藏语视觉语言建模缺乏可复现训练和评估基础设施的问题,提出FTibSuite资源套件,包含数据集FTibData、基准FTibBench和基线模型FTibVLM,在多项任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21924 2026-05-22 cs.CV 79%

Visual-Advantage On-Policy Distillation for Vision-Language Models

基于视觉优势的在线策略蒸馏用于视觉-语言模型

Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学(UCAS)先进交叉学科学院) Hello Group Inc.(Hello集团有限公司) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉优势的在线策略蒸馏方法,用于提升视觉-语言模型对视觉输入的依赖性,通过引入视觉优势指标来区分关键视觉token与语言token,从而提高蒸馏效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19301 2026-05-20 cs.CV 79%

iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models

iGSP:隐式梯度子空间投影用于高效视觉-语言模型的持续学习

Xuezhi Cui, Dongbo Zhou, Wang Guo, Zeyuan Wang, Ziyu Li, Gaozhi Zhou, Xian Li, Ling Zhao, Wentao Yang, Chao Tao, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出iGSP框架,通过隐式梯度子空间投影实现视觉-语言模型的高效持续学习,解决了传统方法在参数效率和任务间对齐一致性上的不足,显著提升了训练效率和知识重用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI 79%

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 79%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06033 2026-05-01 cs.CV 79%

Analysis of Blood Report Images Using General Purpose Vision-Language Models

使用通用视觉-语言模型分析血检报告图像

Nadia Bakhsheshi, Hamid Beigy

机构 * Sharif University of Technology(谢里夫理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文探讨了通用视觉-语言模型在自动分析血检报告图像中的应用,通过比较三种模型在100张不同血检图像上的表现,验证了其在初步分析中的潜力。

Comments 4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]

Journal ref Proc. 2025 32nd ICBME, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23950 2026-04-28 cs.CV 79%

LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models

LearnPruner: 重新思考基于注意力的视觉语言模型中令牌修剪

Rinyoichi Takezoe, Yaqian Li, Zihao Bo, Anzhou Hou, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(利自动公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出LearnPruner,通过两阶段令牌修剪框架在视觉语言模型中实现高效修剪,保留95%性能的同时减少5.5%视觉令牌使用,提升3.2倍推理速度。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV 79%

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18075 2026-04-21 cs.CV 79%

Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

通过动态前缀加权增强视觉-语言模型的持续学习

Hyeonseo Jang, Hyuk Kwon, Kibok Lee

机构 * Yonsei University(延世大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出动态前缀加权框架,通过动态调整前缀权重和适配器机制,提升视觉-语言模型在领域-类别增量学习中的性能。

Comments CVPR 2026; revised text and figures for improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00553 2026-04-21 cs.CV 79%

HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models

HiPrune:面向视觉-语言模型的层次注意力高效标记修剪

Jizhihui Liu, Feiyi Du, Guangdao Zhu, Niu Lian, Jun Li, Bin Chen, Weili Guan, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HiPrune,通过分析视觉编码器中不同层次的注意力特性,实现高效的标记修剪,无需训练且适用于多种模型,在低token预算下保持高任务准确率。

Comments Accepted at ACL-2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15703 2026-04-20 cs.CV 79%

P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models

P3T: 用于3D视觉-语言模型的增强泛化原型点级提示微调

Geunyoung Jung, Soohong Kim, Kyungwoo Song, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系) Department of Applied Statistics, Yonsei University(延世大学应用统计系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出P3T,一种针对3D视觉-语言模型的高效提示微调方法,通过点级提示器和文本提示器提升模型泛化能力,并引入原型损失减少类别内方差,实验表明其在分类和少样本学习中表现优异。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 79%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11299 2026-04-14 cs.CL cs.AI 79%

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

通过字形驱动微调增强多模态大语言模型用于古汉字演变分析

Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) School of Archaeology, Jilin University, China(吉林大学考古学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出GEVO框架,通过字形驱动微调提升多模态大语言模型在古汉字演变分析中的能力,实验显示模型在多个任务上均取得显著提升。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04972 2026-04-08 cs.CV 79%

RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models

RCP:一种用于缓解大视觉-语言模型中分布偏移的表示一致性剪枝方法

Jianwei Zhang, Chaoning Zhang, Sihan Cao, Wang Liu, Pengcheng Zheng, Jiaxin Huang, Caiyan Qin, Yalan Ye, Wei Dong, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机器人与先进制造学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出RCP框架,通过累积视觉token剪枝与延迟修复机制,有效缓解大视觉-语言模型中的分布偏移问题,实验表明可剪除高达88.9%的视觉token并减少85.7%的FLOPs,同时保持较低的精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02956 2026-04-06 cs.CV 79%

Collaborative Multi-Mode Pruning for Vision-Language Models

多模式协作剪枝用于视觉-语言模型

Zimeng Wu, Yunhong Wang, Donghao Wang, Jiaxin Chen

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CoMP框架,通过联合参数和token剪枝,解决单一模式剪枝导致的性能下降问题,通过协作重要性度量和多模式剪枝策略提升高剪枝率下的模型性能。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01351 2026-04-03 cs.CV 79%

Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model

长尾分布感知的混合专家路由器:用于大规模视觉-语言模型的混合专家架构

Chaoxiang Cai, Longrong Yang, Minghe Weng, Xuewei Li, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electronic and Information, Shanghai Dianji University(上海电机学院电子信息学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出LTDR路由器,针对视觉-语言混合专家架构中的长尾分布问题,通过模态特定的分布感知路由和动态专家激活策略,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 79%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV 79%

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26498 2026-03-30 cs.DC cs.AI 79%

Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference

岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度

Konstantinos Papaioannou, Thaleia Dimitra Doudali

机构 * IMDEA Software Institute(IMDEA软件研究所) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23386 2026-03-25 cs.CV cs.GR cs.RO 79%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22714 2026-03-25 cs.CY cs.AI 79%

PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset

PopResume:基于人口代表性数据集的LLM/VLM简历筛选器因果公平性评估

Sumin Yu, Juhyeon Park, Taesup Moon

机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) IPAI, Seoul National University(首尔国立大学人工智能研究所) ASRI / INMC / AIIS, Seoul National University(首尔国立大学人工智能研究所)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

AI总结 PopResume通过人口统计数据和自然属性关系,实现对LLM和VLM简历筛选系统的因果公平性评估,识别出五种传统指标无法捕捉的歧视模式。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16065 2026-03-24 cs.RO cs.AI 79%

Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models

大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成

Yanru Wu, Weiduo Yuan, Ang Qi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏