arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-18 至 2026-02-18 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2601.10313 2026-02-18 cs.CV cs.MM 81%

Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models

面向视觉语言模型的层次化通用多模态攻击

Peng-Fei Zhang, Zi Huang

机构 * School of Electrical Engineering and Computer Science, the University of Queensland(电气工程与计算机科学学院,昆士兰大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出HRA框架,通过层次化优化路径和文本重要性建模,实现对视觉语言模型的通用多模态攻击,验证了其在多种任务和数据集上的优越迁移性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG 79%

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15190 2026-02-18 cs.CL 79%

AIC CTU@AVerImaTeC: dual-retriever RAG for image-text fact checking

AIC CTU@AVerImaTeC:双检索器RAG用于图像-文本事实核查

Herbert Ullrich, Jan Drchal

专题命中 图文多模态 :image-text(title);multimodal(abstract);分类 cs.CL

AI总结 AIC CTU@AVerImaTeC提出双检索器RAG方法,通过结合文本和图像检索模块,实现高效的图像-文本事实核查,具有低运行成本和易复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15124 2026-02-18 cs.CV 79%

Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition

基于多模态大语言模型的零样本人-物交互检测

Shiyu Xuan, Dongkai Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院) Nanjing Forestry University(南京林业大学)

专题命中 图文多模态 :MLLM(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型的零样本人-物交互检测框架,通过解耦检测与识别任务,结合确定性生成方法和空间感知模块,实现高效准确的零样本交互识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15543 2026-02-18 cs.RO 78%

Selective Perception for Robot: Task-Aware Attention in Multimodal VLA

机器人选择性感知:多模态VLA中的任务感知注意力

Young-Chae Son, Jung-Woo Lee, Yoon-Ji Choi, Dae-Kwan Ko, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出了一种动态信息融合框架,通过任务感知注意力提升机器人多模态VLA模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14073 2026-02-18 cs.CL cs.AI 62%

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

利用LLaVA框架实现波兰语视觉-语言模型的高效标注

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz, Sebastian Cygert, Wojciech Kusa

机构 * NASK National Research Institute(国家研究机构NASK)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏