arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2602.20723 2026-02-27 cs.AI 79%

Modality-Guided Mixture of Graph Experts with Entropy-Triggered Routing for Multimodal Recommendation

模态引导的图专家混合网络与熵触发路由用于多模态推荐

Ji Dai, Quan Fang, Dengsheng Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University of Technology(天津理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 MAGNET通过模态引导的图专家混合网络与熵触发路由,提升多模态推荐中融合的可控性、稳定性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21952 2026-02-26 cs.CV 79%

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21154 2026-02-25 cs.AI 79%

CG-DMER: Hybrid Contrastive-Generative Framework for Disentangled Multimodal ECG Representation Learning

CG-DMER:一种用于解耦多模态ECG表示学习的对比-生成框架

Ziwei Niu, Hao Sun, Shujun Bian, Xihong Yang, Lanfen Lin, Yuxin Liu, Yueming Jin

机构 * Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of information science and engineering, Ritsumeikan university(立命馆大学信息科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 CG-DMER通过对比-生成框架解耦多模态ECG表示,提升ECG信号在心血管疾病诊断中的建模能力。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02276 2026-02-25 cs.AI 79%

BioX-Bridge: Model Bridging for Unsupervised Cross-Modal Knowledge Transfer across Biosignals

BioX-Bridge:生物信号跨模态知识迁移的模型桥接

Chenqi Li, Yu Liu, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系 奥克大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 BioX-Bridge通过轻量级桥接网络实现生物信号跨模态无监督知识迁移,显著减少可训练参数并提升迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 79%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19702 2026-02-24 cs.IR cs.AI 79%

DReX: An Explainable Deep Learning-based Multimodal Recommendation Framework

DReX:一种基于深度学习的可解释多模态推荐框架

Adamya Shyam, Venkateswara Rao Kagita, Bharti Rana, Vikas Kumar

机构 * University of Delhi, Delhi, India(德里大学) National Institute of Technology, Warangal, India(印度战争格尔国家理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 DReX通过多模态反馈的交互级特征逐步细化用户和物品表示,提升推荐系统的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19140 2026-02-24 cs.CV cs.LG 79%

CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

CaReFlow:循环适应修正流用于多模态融合

Sijie Mai, Shiqin Han

机构 * South China Normal University(华南师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 CaReFlow通过循环适应修正流实现多模态融合,解决模态间隙问题,提升分布对齐和特征转换的鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 79%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06450 2026-02-24 cs.CV cs.LG 79%

Countering Multi-modal Representation Collapse through Rank-targeted Fusion

通过秩目标融合对抗多模态表示崩溃

Seulgi Kim, Kiran Kokilepersaud, Mohit Prabhushankar, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Rank-enhancing Token Fuser框架,通过提升有效秩对抗多模态表示崩溃,验证了深度与RGB融合的平衡性,并在动作预测任务中取得显著性能提升。

Comments Accepted in 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10652 2026-02-24 cs.CL 79%

ViTextVQA: A Large-Scale Visual Question Answering Dataset and a Novel Multimodal Feature Fusion Method for Vietnamese Text Comprehension in Images

ViTextVQA: 一个大规模视觉问答数据集和一种新的多模态特征融合方法用于图像中的越南语文本理解

Quan Van Nguyen, Dan Quang Tran, Huy Quang Pham, Thang Kien-Bao Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University(越南国家大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 ViTextVQA是一个大规模视觉问答数据集,提出了一种新的多模态特征融合方法,用于提升图像中越南语文本的理解能力。

Comments International Journal of Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18752 2026-02-24 cs.CV cs.GR 79%

Optimizing ID Consistency in Multimodal Large Models: Facial Restoration via Alignment, Entanglement, and Disentanglement

多模态大模型中ID一致性优化:通过对齐、纠缠与解纠缠进行面部修复

Yuran Dong, Hang Dai, Mang Ye

机构 * National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 EditedID通过引入对齐、解纠缠和纠缠机制,提升多模态大模型中面部身份一致性的修复能力。

Comments ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15162 2026-02-20 eess.SP cs.AI cs.LG 79%

Multimodal Wireless Foundation Models

多模态无线基础模型

Ahmed Aboulfotouh, Hatem Abou-Zeid

机构 * Department of Electrical and Software Engineering(电气与软件工程系) University of Calgary(卡尔加里大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出首个多模态无线基础模型,能处理IQ流和图像类无线模态,支持多种无线任务,展示了其在不同模态上的广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16245 2026-02-19 cs.CV 79%

HyPCA-Net: Advancing Multimodal Fusion in Medical Image Analysis

HyPCA-Net:在医学图像分析中推进多模态融合

J. Dhar, M. K. Pandey, D. Chakladar, M. Haghighat, A. Alavi, S. Mistry, N. Zaidi

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(RoentGen健康公司) Lulea University of Technology(卢勒奥大学) QUT(昆士兰科技大学) RMIT University(皇家墨尔本理工大学) Curtin University(Curtin大学) Deakin University(德肯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 HyPCA-Net通过高效残差注意力模块和双视角级联注意力模块,提升多模态医学图像分析的性能与效率。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15896 2026-02-19 cs.CL 79%

Every Little Helps: Building Knowledge Graph Foundation Model with Fine-grained Transferable Multi-modal Tokens

每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University, Zhejiang, China(浙江大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CL

AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15740 2026-02-18 cs.LG cs.AI q-bio.QM 79%

MRC-GAT: A Meta-Relational Copula-Based Graph Attention Network for Interpretable Multimodal Alzheimer's Disease Diagnosis

MRC-GAT:一种基于元关系耦合的图注意力网络用于可解释的多模态阿尔茨海默病诊断

Fatemeh Khalvandi, Saadat Izadi, Abdolah Chalechale

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 MRC-GAT通过元关系耦合和多关系注意力机制,实现多模态阿尔茨海默病诊断的高精度与可解释性。

Comments 27 pages, 10 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00168 2026-02-18 cs.CV 79%

SSL4EO-S12 v1.1: A Multimodal, Multiseasonal Dataset for Pretraining, Updated

SSL4EO-S12 v1.1:一种用于预训练的多模态、多季节数据集,更新版

Benedikt Blumenstiel, Nassim Ait Ali Braham, Conrad M Albrecht, Stefano Maurogiovanni, Paolo Fraccaro

机构 * IBM Research Europe(IBM欧洲研究中心) German Aerospace Center(德国航空航天中心) Julich Supercomputing Centre University of Iceland(朱利奇超级计算中心爱沙尼亚大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 SSL4EO-S12 v1.1通过增加多模态数据和改进数据结构,为预训练大规模基础模型提供了更高效、更全面的地球观测数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15461 2026-02-18 cs.CV 79%

Emergent Morphing Attack Detection in Open Multi-modal Large Language Models

开放多模态大语言模型中的涌现形变攻击检测

Marija Ivanovska, Vitomir Štruc

机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。

Comments This manuscript is currently under review at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15346 2026-02-18 cs.CV 79%

Effective and Robust Multimodal Medical Image Analysis

高效且鲁棒的多模态医学图像分析

Joy Dhar, Nayyar Zaidi, Maryam Haghighat

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) Deakin University(德克萨斯大学) Queensland University of Technology(昆士兰理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MAIL网络,通过高效残差学习和多模态交叉注意力模块,提升多模态医学图像分析的效率与鲁棒性,实现实验性能提升9.34%并降低计算成本78.3%。

Comments Accepted at Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14518 2026-02-17 cs.AI 79%

Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning

多模态长链推理中的知识冲突诊断

Jing Tang, Kun Wang, Haolang Lu, Hongjin Chen, KaiTao Chen, Zhongxiang Sun, Qiankun Li, Lingjuan Lyu, Guoshun Nan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Renmin University of China(中国人民大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出了一种统一的知识冲突概念,揭示了多模态长链推理中不同冲突类型的特征和处理机制,为诊断和控制推理失败提供了原理性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10685 2026-02-17 cs.CV 79%

GaussianFormer3D: Multi-Modal Gaussian-based Semantic Occupancy Prediction with 3D Deformable Attention

GaussianFormer3D: 多模态基于高斯的语义占用预测与3D可变形注意力

Lingjun Zhao, Sizhe Wei, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 GaussianFormer3D通过3D可变形注意力机制,结合激光雷达与摄像头数据,实现高效且精确的语义占用预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12108 2026-02-16 cs.SI cs.AI cs.CY cs.HC cs.LG 79%

Multimodal Coordinated Online Behavior: Trade-offs and Strategies

多模态协调在线行为:权衡与策略

Lorenzo Mannocci, Stefano Cresci, Matteo Magnani, Anna Monreale, Maurizio Tesconi

机构 * University of Pisa(比萨大学) Institute for Informatics and Telematics, National Research Council (IIT-CNR)(信息学与电信学研究院,国家研究理事会(IIT-CNR)) InfoLab, Department of Information Technology, Uppsala University(信息实验室,信息科技系,乌普萨拉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究探讨多模态协调在线行为的权衡与策略,通过比较不同方法揭示多模态分析在捕捉协调行为结构方面的优势。

Comments Postprint of the article published in the Information Sciences journal. Please, cite accordingly

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09934 2026-02-11 cs.CV 79%

VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization

VersaViT: 通过任务引导优化增强MLLM视觉骨干

Yikun Liu, Yuan Liu, Shangzhe Di, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jie Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University, China(上海交通大学计算机学院) WeChat AI, Tencent Inc., China(腾讯公司)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 VersaViT通过任务引导优化增强MLLM视觉骨干,解决其在密集预测任务中的性能问题,提升视觉任务的适应性与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09485 2026-02-11 cs.AI 79%

Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models

连接效率与透明性:可解释的CoT压缩在多模态大推理模型中

Yizhi Wang, Linan Yue, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education, China(计算机网络与信息集成重点实验室(SEU))

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 XMCC通过强化学习优化的顺序决策过程,实现多模态大推理模型中可解释的CoT压缩,同时保持推理正确性和生成可解释的压缩解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04121 2026-02-11 cs.CV 79%

Graph-Based Multimodal and Multi-view Alignment for Keystep Recognition

基于图的多模态和多视角对齐用于按键识别

Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于图的多模态和多视角对齐框架,用于提高egocentric视频中按键识别的准确率,通过构建稀疏图结构并利用多模态特征提升性能。

Comments We expanded the paper and resubmitted as a separate submission to arXiv. This submission is outdated and readers can refer to arXiv:2506.01102

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08713 2026-02-10 cs.CV cs.LG 79%

Towards Understanding Multimodal Fine-Tuning: Spatial Features

迈向多模态微调的理解:空间特征

Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr, Ronald Clark, Christian Schroeder de Witt, Constantin Venhoff

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过分阶段模型差分技术,揭示了多模态微调过程中视觉特征如何形成及空间关系编码,提升了多模态训练的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08077 2026-02-10 cs.LG cs.AI 79%

Multimodal normative modeling in Alzheimers Disease with introspective variational autoencoders

在阿尔茨海默病中使用反思变分自编码器的多模态规范建模

Sayantan Kumar, Peijie Qiu, Aristeidis Sotiras

机构 * Washington University in St Louis(华盛顿大学圣路易斯分校) Washington University in St Louis School of Medicine(华盛顿大学圣路易斯医学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出mmSIVAE,通过结合MOPOE聚合提升多模态数据的规范建模效果,提高参考分布保真度和多模态整合能力,用于阿尔茨海默病的偏差分析。

Comments Conference on Health, Inference, and Learning (CHIL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07163 2026-02-06 cs.CV 79%

Test-time Adaptive Hierarchical Co-enhanced Denoising Network for Reliable Multimodal Classification

测试时自适应层次联合增强去噪网络用于可靠的多模态分类

Shu Shen, C. L. Philip Chen, Tong Zhang

机构 * The Guangdong Provincial Key Laboratory of Computational Intelligence and Cyberspace Information, the School of Computer Science and Engineering, South China University of Technology(广东省计算智能与网络信息重点实验室、计算机科学与工程学院、华南理工大学) The Pazhou Laboratory(琶洲实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TAHCD网络,通过自适应稳定子空间对齐和样本自适应置信度对齐,有效去除多模态噪声,提升多模态分类的鲁棒性和泛化能力。

Comments 14 pages,9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04512 2026-02-05 q-bio.NC cs.AI 79%

BrainVista: Modeling Naturalistic Brain Dynamics as Multimodal Next-Token Prediction

BrainVista: 以多模态下一项令牌预测建模自然主义脑动力学

Xuanhua Yin, Runkai Zhao, Lina Yao, Weidong Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 BrainVista通过多模态自回归框架建模自然主义脑动力学,采用网络级令牌化器和空间混合头以解构系统特定动态并捕捉跨网络信息流,通过S2B掩码机制实现严格因果条件,提升fMRI编码性能。

Comments 17 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04670 2026-02-05 cs.AI 79%

Improving Multimodal Brain Encoding Model with Dynamic Subject-awareness Routing

改进多模态脑编码模型的动态主体感知路由

Xuanhua Yin, Runkai Zhao, Weidong Cai

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 AFIRE和MIND通过动态主体感知路由提升多模态脑编码模型的性能,增强跨受试者泛化能力并实现可解释的专家模式。

Comments 7 pages, 4 figures, accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20977 2026-02-05 cs.CL 79%

Evaluating and Steering Modality Preferences in Multimodal Large Language Model

评估和引导多模态大语言模型中的模态偏好

Yu Zhang, Jinlong Ma, Yongshuai Hou, Xuefeng Bai, Kehai Chen, Yang Xiang, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CL

AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。

Comments Modality Preference

详情

展开后加载摘要…

URL PDF HTML 收藏