arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

1712.01892 2019-07-03 cs.CV 57%

Grounding Referring Expressions in Images by Variational Context

Hanwang Zhang, Yulei Niu, Shih-Fu Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments in 2018 Conference on Computer Vision and Pattern Recognition (CVPR'18)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06619 2019-06-18 cs.LG cs.CV stat.ML 57%

Generating Diverse and Informative Natural Language Fashion Feedback

Gil Sadeh, Lior Fritz, Gabi Shalev, Eduard Oks

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.06784 2019-05-17 cs.CV 57%

Harvesting Information from Captions for Weakly Supervised Semantic Segmentation

Johann Sawatzky, Debayan Banerjee, Juergen Gall

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09544 2019-04-23 cs.CV 57%

3G structure for image caption generation

Aihong Yuan, Xuelong Li, Xiaoqiang Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 35 pages, 7 figures, magazine

Journal ref Neurocomputing 330: 17-28 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02755 2019-04-08 cs.CL 57%

ExCL: Extractive Clip Localization Using Natural Language Descriptions

Soham Ghosh, Anuva Agarwal, Zarana Parekh, Alexander Hauptmann

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CL

Comments Accepted at NAACL 2019, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06275 2019-03-18 cs.CV 57%

Show, Translate and Tell

Dheeraj Peri, Shagan Sah, Raymond Ptucha

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.06706 2019-01-23 cs.CV 57%

Visual Entailment: A Novel Task for Fine-Grained Image Understanding

Ning Xie, Farley Lai, Derek Doran, Asim Kadav

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03570 2018-12-11 cs.CV 57%

Learning Style Compatibility for Furniture

Divyansh Aggarwal, Elchin Valiyev, Fadime Sener, Angela Yao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments German Conference on Pattern Recognition(GCPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03213 2018-12-11 cs.CV 57%

PIRC Net : Using Proposal Indexing, Relationships and Context for Phrase Grounding

Rama Kovvuri, Ram Nevatia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted in ACCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06245 2018-10-16 cs.CL 57%

Bringing back simplicity and lightliness into neural image captioning

Jean-Benoit Delbrouck, Stéphane Dupont

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.08205 2018-07-24 cs.CV 57%

Equal But Not The Same: Understanding the Implicit Relationship Between Persuasive Images and Text

Mingda Zhang, Rebecca Hwa, Adriana Kovashka

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments To appear in BMVC2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.05526 2018-07-19 cs.CV 57%

Unpaired Image Captioning by Language Pivoting

Jiuxiang Gu, Shafiq Joty, Jianfei Cai, Gang Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 17 pages, 4 figures, Accepted at ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.00545 2018-05-03 cs.CV 57%

Weakly Supervised Attention Learning for Textual Phrases Grounding

Zhiyuan Fang, Shu Kong, Tianshu Yu, Yezhou Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06047 2017-11-17 cs.CV stat.ML 57%

Deep Matching Autoencoders

Tanmoy Mukherjee, Makoto Yamada, Timothy M. Hospedales

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00234 2016-12-02 cs.CV 57%

Video Captioning with Multi-Faceted Attention

Xiang Long, Chuang Gan, Gerard de Melo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.09186 2016-08-17 cs.CL cs.LG cs.NE 57%

Does Multimodality Help Human and Machine for Translation and Image Captioning?

Ozan Caglayan, Walid Aransa, Yaxing Wang, Marc Masana, Mercedes García-Martínez, Fethi Bougares, Loïc Barrault, Joost van de Weijer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments 7 pages, 2 figures, v4: Small clarification in section 4 title and content

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.07262 2016-07-26 cs.CV 57%

Automatic Attribute Discovery with Neural Activations

Sirion Vittayakorn, Takayuki Umeda, Kazuhiko Murasaki, Kyoko Sudo, Takayuki Okatani, Kota Yamaguchi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments ECCV 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 56%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 图文多模态 :multimodal(abstract,comments)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15948 2025-03-21 cs.CV cs.AI cs.CL 56%

Don't Fight Hallucinations, Use Them: Estimating Image Realism using NLI over Atomic Facts

Elisei Rykov, Kseniia Petrushina, Kseniia Titova, Alexander Panchenko, Vasily Konovalov

专题命中 图文多模态 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)

Comments Proceedings of De-Factify 4: 4nd Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16885 2026-08-18 cs.RO 新提交 50%

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15601 2026-08-18 cs.LG 新提交 50%

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

用于组合概念泛化的多阶段训练量子模型

Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

机构 * University College London(伦敦大学学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 该研究针对多模态学习的组合概念泛化挑战,提出带多阶段训练的量子模型,在CLEVR数据集上验证其可提升分布外关系泛化能力且参数远少于经典基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 50%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03867 2026-08-05 cs.AR 新提交 50%

Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference

面向高效低比特大语言模型推理的异构感知微缩放技术

Junyi Luo, Xinting Jiang, Tai-Hao Wen, Ruichen Qi, Minxing Chu, Hongyi Wu, Gregory Kielian, Ben Laurie, Qirui Zhang, Quan Cheng, Dennis Sylvester, Mehdi Saligane

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究针对低比特LLM推理的MX格式精度损失问题,提出异构感知的AdaMX格式与加速器,在不增加EBW的前提下提升精度、降低存储能耗,在多类LLM及多模态模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13352 2026-08-04 cs.LG 版本更新 50%

GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding

GeoFlowVLM: 基于几何的联合不确定性用于冻结视觉-语言嵌入

Mayank Nautiyal, Li Ju, Andreas Hellander, Ekta Vats, Prashant Singh

机构 * Department of Information Technology, Uppsala University(乌普萨拉大学信息科技系) SciLifeLab, Uppsala University(乌普萨拉大学SciLifeLab)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 GeoFlowVLM通过流匹配学习双编码VLM嵌入的联合分布,解决视觉-语言模型中缺乏联合不确定性的问题,提出条件检索熵和边际典型性得分以量化不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27076 2026-07-30 cs.LG cs.SY eess.SP eess.SY 新提交 50%

Single-Beat Cuffless Blood Pressure Estimation Using Ear-PPG and ECG with a Lightweight Hybrid Learning Framework

采用耳式光电容积描记法(PPG)与心电图(ECG)结合轻量混合学习框架的单搏无袖带血压估计

Kindeep K. Dhatt, Tengyue Wu, Hanbang Hua, Yayun Du

机构 * Vanderbilt University(范德堡大学) Vanderbilt Institute for Surgery and Engineering(范德堡外科工程研究所) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 该研究提出轻量混合学习框架,结合ECG、耳式PPG与6轴IMU,实现单搏无袖带血压估计,在多阶段压力方案与PulseDB数据集上,较基线模型降低28.2%组合MAE,适配可穿戴部署。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04171 2026-07-30 cs.RO cs.LG 版本更新 50%

Teaching Tiny VLA Models Where to Look and How to Move

XS-VLA:将粗粒度空间蒸馏与潜在流匹配相结合用于轻量级机器人控制

Iok Tong Lei, Ying Jie Yap, Wei Huang, Qingchen Xie, Qianzhi Li, Yujie Zhang, Xiaolong Liu, Zhidong Deng

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) Wuxi Dexteroushands Robotic Technology Co.(无锡灵犀机器人技术有限公司)

专题命中 图文多模态 :multimodal(abstract)

AI总结 提出XS-VLA框架,先通过微调从Qwen3-VL-4B向SmolVLM2-0.25B骨干网蒸馏空间语义知识,再用其增强骨干网训练潜在流匹配策略,提升轻量级机器人控制性能,在LIBERO基准测试中表现出色。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 50%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 图文多模态 :multi-modal(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29968 2026-07-27 cs.DB 版本更新 50%

CLIP: Lightweight Cosine-Law-Based Inverted-List Pruning for IVF-Based Vector Search

CLIP:基于余弦定律的轻量级倒排列表剪枝技术用于IVF向量搜索

Yitong Song, Shuhang Lu, Pengcheng Zhang, Jianliang Xu

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对IVF向量搜索中粗粒度执行导致高延迟的问题,提出基于余弦定律的轻量级剪枝技术CLIP,支持簇间和簇内剪枝,显著减少不必要的簇和向量访问,并开发了IVF-CLIP、HIVF-CLIP和LSM-IVF三种变体,实验表明剪枝率达78%,效率提升最高141%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18885 2026-07-22 cs.LG 新提交 50%

KALE: Kernel Alignment with Loss Equilibration for Stable CLIP-DINOv2 Alignment at Web Scale

KALE:通过损失均衡实现网络规模下CLIP与DINOv2的稳定对齐的核对齐方法

Michał Pawłowicz

专题命中 图文多模态 :image-text(abstract)

AI总结 研究在网络规模数据上CLIP与DINOv2对齐问题,引入KALE损失均衡控制器,自适应调整对齐权重,无需数据集微调,在CC12M子集实验中提升了模型图像-文本检索及线性探测性能,零样本性能显著提高。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 50%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 图文多模态 :multimodal(abstract)

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏