arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 47387 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4781 篇

2601.21798 2026-05-18 cs.CV 93%

CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models

CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成

Junming Huang, Chi Wang, Letian Li, Guangkai Xu, Donglin Huang, Hao Chen, Qiang Dai, Weiwei Xu

机构 * Zhejiang University, China(浙江大学)

专题命中 图文多模态 :MLLM(title,title_cn);multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25575 2026-08-27 cs.CV cs.AI 新提交 92%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27389 2026-05-14 cs.CV cs.AI 91%

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试

Bingli Wang, Huanze Tang, Haijun Lv, Zhishan Lin, Lixin Gu, Lei Feng, Qipeng Guo, Kai Chen

机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI

AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-09-18 cs.RO cs.AI 版本更新 91%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: https://worv-ai.github.io/ponderpounce/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16690 2026-09-09 cs.CV 版本更新 91%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 40 pages, 13 tables, 7 figures. v2: added BowTurnHead leave-one-out sensitivity; improved statistical reporting precision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12733 2025-06-17 cs.CV 90%

Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models

Liam Bennett, Mason Clark, Lucas Anderson, Hana Satou, Olivia Martinez

机构 * Alan Mitkiy, Michael Johnson, Sofia García, Hana Satou(未知机构)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15768 2024-06-25 cs.CV 90%

MR-MLLM: Mutual Reinforcement of Multimodal Comprehension and Vision Perception

Guanqun Wang, Xinyu Wei, Jiaming Liu, Ray Zhang, Yichi Zhang, Kevin Zhang, Maurice Chong, Shanghang Zhang

机构 * School of Computer Science, Peking University(北京大学计算机学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(title,abstract);cross-modal(abstract);image-text(abstract)

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00053 2025-09-03 cs.MM cs.AI cs.CL 90%

Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?

Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(title,abstract);image-text(abstract);分类 cs.CL、cs.AI、cs.MM

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06267 2024-08-29 cs.CV cs.AI cs.LG cs.SD eess.AS 90%

Multimodality Helps Unimodality: Cross-Modal Few-Shot Learning with Multimodal Models

Zhiqiu Lin, Samuel Yu, Zhiyi Kuang, Deepak Pathak, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Published at CVPR 2023. Project site: https://linzhiqiu.github.io/papers/cross_modal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23880 2026-08-26 cs.CV 新提交 90%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25040 2026-04-03 cs.LG cs.CL cs.CV 90%

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

Intern-S1-Pro:万亿参数科学多模态基础模型

Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou, Xinyu Zhou, Dongzhan Zhou, Zhiwang Zhou, Yuhao Zhou, Bowen Zhou, Zhanping Zhong, Zhijie Zhong, Haiteng Zhao, Penghao Zhao, Xiaomeng Zhao, Zhiyuan Zhao, Yechen Zhang, Jin Zhang, Wenwei Zhang, Hongjie Zhang, Zhuo Zhang, Wenlong Zhang, Bo Zhang, Chao Zhang, Chen Zhang, Yuhang Zang, Fei Yuan, Jiakang Yuan, Jiashuo Yu, Jinhui Yin, Haochen Ye, Qian Yao, Bowen Yang, Danni Yang, Kaichen Yang, Ziang Yan, Jun Xu, Yicheng Xu, Wanghan Xu, Xuenan Xu, Chao Xu, Ruiliang Xu, Shuhao Xing, Long Xing, Xinchen Xie, Ling-I Wu, Zijian Wu, Zhenyu Wu, Lijun Wu, Yue Wu, Jianyu Wu, Wen Wu, Fan Wu, Xilin Wei, Qi Wei, Bingli Wang, Rui Wang, Ziyi Wang, Zun Wang, Yi Wang, Haomin Wang, Yizhou Wang, Lintao Wang, Yiheng Wang, Longjiang Wang, Bin Wang, Jian Tong, Zhongbo Tian, Huanze Tang, Chen Tang, Shixiang Tang, Yu Sun, Qiushi Sun, Xuerui Su, Qisheng Su, Chenlin Su, Demin Song, Jin Shi, Fukai Shang, Yuchen Ren, Pengli Ren, Xiaoye Qu, Yuan Qu, Jiantao Qiu, Yu Qiao, Biqing Qi, Runyu Peng, Tianshuo Peng, Jiahui Peng, Qizhi Pei, Zhuoshi Pan, Linke Ouyang, Wenchang Ning, Yichuan Ma, Zerun Ma, Ningsheng Ma, Runyuan Ma, Chengqi Lyu, Haijun Lv, Han Lv, Lindong Lu, Kuikun Liu, Jiangning Liu, Yuhong Liu, Kai Liu, Hongwei Liu, Zhoumianze Liu, Mengjie Liu, Ziyu Liu, Wenran Liu, Yang Liu, Liwei Liu, Kaiwen Liu, Junyao Lin, Junming Lin, Tianyang Lin, Dahua Lin, Jianze Liang, Linyang Li, Peiji Li, Zonglin Li, Zehao Li, Pengze Li, Guoyan Li, Lingkai Kong, Linglin Jing, Zhenjiang Jin, Feifei Jiang, Qian Jiang, Junhao Huang, Zixian Huang, Haian Huang, Zhouqi Hua, Ermo Hua, Han Hu, Linfeng Hou, Yinan He, Conghui He, Tianyao He, Xu Guo, Qipeng Guo, Aijia Guo, Yuzhe Gu, Lixin Gu, Jingyang Gong, Qiming Ge, Jiaye Ge, Songyang Gao, Jianfei Gao, Xinyu Fang, Caihua fan, Yue Fan, Yanhui Duan, Zichen Ding, Shengyuan Ding, Ning Ding, Xuanlang Dai, Erfei Cui, Ganqu Cui, Pei Chu, Tao Chu, Guangran Cheng, Yu Cheng, Kai Chen, Yongkang Chen, Chiyu Chen, Guanzhou Chen, Qiaosheng Chen, Sitao Chen, Xin Chen, Haojiong Chen, Yicheng Chen, Weihan Cao, Yuhang Cao, Qinglong Cao, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 Intern-S1-Pro是首个万亿参数科学多模态基础模型,具备跨通用与科学领域的能力提升,融合强推理、图像-文本理解及先进代理能力,专精于100余项科学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02663 2026-03-04 cs.CL cs.CV 90%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21549 2025-06-17 cs.CV cs.CL 90%

Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation

Daniel Csizmadia, Andrei Codreanu, Victor Sim, Vighnesh Prabhu, Michael Lu, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :cross-modal(title,abstract);image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00915 2025-01-10 cs.CV cs.CL 90%

BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs

Sheng Zhang, Yanbo Xu, Naoto Usuyama, Hanwen Xu, Jaspreet Bagga, Robert Tinn, Sam Preston, Rajesh Rao, Mu Wei, Naveen Valluri, Cliff Wong, Andrea Tupini, Yu Wang, Matt Mazzola, Swadheen Shukla, Lars Liden, Jianfeng Gao, Angela Crabtree, Brian Piening, Carlo Bifulco, Matthew P. Lungren, Tristan Naumann, Sheng Wang, Hoifung Poon

机构 * Microsoft Research(微软研究院) Providence Genomics(普罗维登斯基因组学公司)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

Comments The models are released at https://aka.ms/biomedclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02740 2024-10-04 cs.CV cs.AI cs.LG 90%

Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models

Zhengfeng Lai, Vasileios Saveris, Chen Chen, Hong-You Chen, Haotian Zhang, Bowen Zhang, Juan Lao Tebar, Wenze Hu, Zhe Gan, Peter Grasch, Meng Cao, Yinfei Yang

机构 * Apple AI/ML(苹果公司人工智能/机器学习部门)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments CV/ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15306 2024-06-24 cs.LG cs.CL cs.CV 90%

Advanced Multimodal Deep Learning Architecture for Image-Text Matching

Jinyin Wang, Haijing Zhang, Yihao Zhong, Yingbin Liang, Rongwei Ji, Yiru Cang

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments arXiv admin note: text overlap with arXiv:2405.17460 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08263 2022-08-18 cs.NE cs.AI cs.MM 90%

Multimodal foundation models are better simulators of the human brain

Haoyu Lu, Qiongyi Zhou, Nanyi Fei, Zhiwu Lu, Mingyu Ding, Jingyuan Wen, Changde Du, Xin Zhao, Hao Sun, Huiguang He, Ji-Rong Wen

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14510 2026-07-17 cs.AI 新提交 89%

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26787 2026-03-31 cs.CV 89%

Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval

脑启发式多模态脉冲神经网络用于图像-文本检索

Xintao Zong, Xian Zhong, Wenxuan Liu, Jianhao Ding, Zhaofei Yu, Tiejun Huang

机构 * Hubei Key Laboratory of Transportation Internet of Things, Wuhan University of Technology(武汉理工大学交通物联网湖北省重点实验室) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理全国重点实验室)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出脑启发式跨模态脉冲融合网络(CMSF),用于图像-文本检索,通过融合单模态特征提升多模态表示,实现高效检索与低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10148 2026-02-12 cs.CR cs.AI 89%

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型

Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17046 2025-09-29 cs.CL cs.LG 89%

MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models

Xiaolong Wang, Zhaolu Kang, Wangyuxuan Zhai, Xinyue Lou, Yunghwei Lai, Ziyue Wang, Yawen Wang, Kaiyu Huang, Yile Wang, Peng Li, Yang Liu

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);image-text(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16716 2025-07-23 cs.CV 89%

Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation

Yiguo He, Junjie Zhu, Yiying Li, Xiaoyu Zhang, Chunping Qiu, Jun Wang, Qiangjuan Huang, Ke Yang

机构 * Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室)

专题命中 图文多模态 :MLLM(title,abstract);image-text(title,abstract);multimodal(abstract);分类 cs.CV

Comments SUBMIT TO IEEE TRANSACTIONS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01261 2024-10-03 cs.CV 89%

OCC-MLLM:Empowering Multimodal Large Language Model For the Understanding of Occluded Objects

Wenmo Qiu, Xinhan Di

机构 * University of Toronto(多伦多大学) Giant Network AI Lab(巨人网络AI实验室)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(title);multi-modal(abstract);image-text(abstract)

Comments Accepted by CVPR 2024 T4V Workshop (5 pages, 3 figures, 2 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07794 2024-02-06 cs.CL cs.LG cs.SI 89%

Improving Multimodal Classification of Social Media Posts by Leveraging Image-Text Auxiliary Tasks

Danae Sánchez Villegas, Daniel Preoţiuc-Pietro, Nikolaos Aletras

机构 * University of Sheffield(谢菲尔德大学) Bloomberg(彭博公司)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted at EACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13117 2022-03-01 cs.CV 89%

An Unsupervised Cross-Modal Hashing Method Robust to Noisy Training Image-Text Correspondences in Remote Sensing

Georgii Mikriukov, Mahdyar Ravanbakhsh, Begüm Demir

专题命中 图文多模态 :cross-modal(title,abstract);image-text(title,abstract);multi-modal(abstract);分类 cs.CV

Comments https://git.tu-berlin.de/rsim/chnr

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.05134 2019-10-14 cs.CV 89%

Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval

Sijin Wang, Ruiping Wang, Ziwei Yao, Shiguang Shan, Xilin Chen

专题命中 图文多模态 :cross-modal(title,abstract);image-text(title,abstract);multi-modal(abstract);分类 cs.CV

Comments Accepted by WACV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16193 2026-06-16 cs.CV cs.AI cs.LG 新提交 89%

Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs

级联稀疏自编码器在多模态大语言模型中学习多级视觉概念

Yusong Zhao, Hengyi Wang, Tanuja Ganu, Akshay Nambi, Hao Wang

机构 * Rutgers University(罗格斯大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出级联稀疏自编码器(CSAEs),通过在第一级SAE解码器权重上训练第二级SAE来学习层次化视觉概念,避免嵌套或堆叠SAE的缺点,在多个MLLM和数据集上提升了概念层次一致性和干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23482 2026-05-25 cs.CV cs.AI 89%

Multimodal Distribution Matching for Vision-Language Dataset Distillation

多模态分布匹配用于视觉-语言数据集蒸馏

Jongoh Jeong, Hoyong Kwon, Minseok Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)

专题命中 图文多模态 :multimodal(title,summary_cn);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出多模态分布匹配(MDM)框架,通过数据、模型和损失层面的几何感知组件,高效压缩视觉-语言数据集并保持跨模态对齐。

Comments Accepted for publication at CVPR 2026. Project Page: https://andyj1.github.io/mdm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22724 2026-08-25 cs.CE 新提交 89%

Frontiers in FinTech: Multimodal Foundation Models for Financial Reporting and Decision Science

金融科技前沿:面向财务报告与决策科学的多模态基础模型

Yulu Huang, Niannian Yu, Yaxin Yang, Yong Huang

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title);MLLM(abstract_cn);cross-modal(abstract)

AI总结 针对异构财务数据对会计信息系统的挑战,本研究提出多模态大语言模型FinVision,经200家上市公司验证可降低19%估值误差,48名专业用户测试缩短51%任务时间,助力审计自动化与财务分析民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15857 2024-06-21 cs.CL cs.AI cs.MM 89%

A Survey on Image-text Multimodal Models

Ruifeng Guo, Jingxuan Wei, Linzhuang Sun, Bihui Yu, Guiyong Chang, Dawei Liu, Sibo Zhang, Zhengbing Yao, Mingjun Xu, Liping Bu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(title,abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏