arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-03 至 2026-02-03 共收录 153 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 30 篇

2511.03774 2026-02-03 cs.LG 78%

Contamination Detection for VLMs using Multi-Modal Semantic Perturbation

使用多模态语义扰动检测VLMs中的污染

Jaden Park, Mu Cai, Feng Yao, Jingbo Shang, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, San Diego(加州大学圣地亚哥分校) Kookmin University(韩国庆北大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出了一种基于多模态语义扰动的检测方法,用于识别和验证受污染的视觉语言模型。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 73%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 73%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03205 2026-02-03 cs.CL cs.AI 73%

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

U-MATH:一个大学级评估LLM数学能力的基准测试

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

机构 * Toloka AI Gradarius Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 U-MATH是一个大学级数学能力评估基准,包含1100个开放性问题,用于评估LLM在多模态推理和解决方案判断方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02233 2026-02-03 cs.HC 71%

CHOMP: Multimodal Chewing Side Detection with Earphones

CHOMP:使用耳phones的多模态咀嚼侧检测

Jonas Hummel, Maximilian Burzer, Felix Schlotter, Michael Küttner, Tobias King, Qiang Yang, Cecilia Mascolo, Michael Beigl, Tobias Röddiger

专题命中 多模态评测 :multimodal(title)

AI总结 CHOMP利用耳phones实现多模态咀嚼侧检测,通过融合多种传感数据提升监测精度,为日常下颌功能评估提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00757 2026-02-03 cs.SE 71%

ScratchEval : A Multimodal Evaluation Framework for LLMs in Block-Based Programming

ScratchEval:一种用于块式编程中LLM的多模态评估框架

Yuan Si, Simeng Han, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 多模态评测 :multimodal(title)

AI总结 ScratchEval是首个用于评估LLM在Scratch块式编程中修复能力的可执行基准,通过多层协议测量功能正确性、修复质量和解释质量,支持领域微调和泛化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01081 2026-02-03 cs.CV 70%

MedAD-R1: Eliciting Consistent Reasoning in Interpretible Medical Anomaly Detection via Consistency-Reinforced Policy Optimization

MedAD-R1: 通过一致性强化策略优化实现可解释医学异常检测中的一致推理

Haitao Zhang, Yingying Wang, Jiaxiang Wang, Haote Xu, Hongyang Zhang, Yirong Chen, Yue Huang, Xinghao Ding

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Zhejiang Expressway Co., Ltd.(浙江高速公路有限公司) School of Science and Engineering, Chinese University of Hong Kong(香港中文大学科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 MedAD-R1通过一致性强化策略优化实现医学异常检测中的可解释推理,提升模型的可信度和可解释性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22161 2026-02-03 cs.LG cs.CV cs.SD eess.AS 62%

Attention Isn't All You Need for Emotion Recognition:Domain Features Outperform Transformers on the EAV Dataset

注意力并非情感识别的全部:在EAV数据集上领域特征优于Transformer

Anmol Guragain

机构 * Universidad Politécnica de Madrid E.T.S. Ingenieros de Telecomunicación(马德里理工大学电信工程学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 在EAV数据集上,领域特征在小数据情感识别中优于Transformer,通过简单修改提升准确率,证明领域知识胜过复杂架构。

Comments 2 figures, 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 62%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01578 2026-02-03 cs.CY cs.AI 57%

DrawSim-PD: Simulating Student Science Drawings to Support NGSS-Aligned Teacher Diagnostic Reasoning

DrawSim-PD:模拟学生科学绘画以支持与NGSS对齐的教师诊断推理

Arijit Chakma, Peng He, Honglu Liu, Zeyuan Wang, Tingting Li, Tiffany D. Do, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 DrawSim-PD通过模拟具有可控教学缺陷的学生科学绘画,为教师提供支持NGSS对齐的诊断推理训练工具,解决真实学生作品隐私限制问题。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23478 2026-02-03 cs.CV 57%

UrbanIng-V2X: A Large-Scale Multi-Vehicle, Multi-Infrastructure Dataset Across Multiple Intersections for Cooperative Perception

UrbanIng-V2X: 一个大规模多车辆、多基础设施数据集,用于多个交叉口的协同感知

Karthikeyan Chandra Sekaran, Markus Geisler, Dominik Rößle, Adithya Mohan, Daniel Cremers, Wolfgang Utschick, Michael Botsch, Werner Huber, Torsten Schön

机构 * Technische Hochschule Ingolstadt(图恩技术高等学院) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 UrbanIng-V2X是一个大规模多车辆、多基础设施数据集,用于多个交叉口的协同感知研究,包含多种传感器数据和标注,旨在提升智能交通系统的感知能力。

Comments Accepted to NeurIPS 2025. Including supplemental material. For code and dataset, see https://github.com/thi-ad/UrbanIng-V2X

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 57%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01038 2026-02-03 cs.CV 57%

From Videos to Conversations: Egocentric Instructions for Task Assistance

从视频到对话:任务协助的视角指令

Lavisha Aggarwal, Vikas Bahirwani, Andrea Colaco

机构 * Google, USA(谷歌)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出从视频自动转换为多模态任务指导对话的框架,并引入HowToDIV数据集,用于多模态任务协助的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09751 2026-02-03 cs.LG cs.AI 57%

Meta-Learning Reinforcement Learning for Crypto-Return Prediction

元学习强化学习用于加密货币收益预测

Junqiao Wang, Zhaoyang Guan, Guanyu Liu, Tianze Xia, Xianzhi Li, Shuo Yin, Xinyuan Song, Chuhan Cheng, Tianyu Shi, Alex Lee

机构 * Sichuan University(四川大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Northwestern University(西北大学) Huazhong University of Science and Technology(华中科技大学) Queen’s University(女王大学) University of Toronto(多伦多大学) TrueNorth Tsinghua University(清华大学) Emory University(埃默里大学) University of Macau(澳门大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Meta-RL-Crypto通过结合元学习和强化学习,构建了一个自我改进的交易代理,有效提升加密货币收益预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00102 2026-02-03 eess.IV cs.AI cs.LG 57%

Radiomics in Medical Imaging: Methods, Applications, and Challenges

医学影像中的放射组学:方法、应用与挑战

Fnu Neha, Deepak kumar Shukla

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文系统分析了放射组学的全流程,探讨了特征稳定性、模型可靠性及临床转化有效性,并提出了标准化、领域转移和临床部署等未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02071 2026-02-03 cs.LG 50%

BAPS: A Fine-Grained Low-Precision Scheme for Softmax in Attention via Block-Aware Precision reScaling

BAPS: 一种针对注意力机制中softmax的细粒度低精度方案 via 块意识精度重标定

Zisheng Ye, Xiaoyu He, Maoyuan Song, Guoliang Qiu, Chao Liao, Chen Wu, Yonggang Sun, Zhichun Li, Xiaoru Xie, Yuanyong Luo, Hu Liu, Pinyan Lu, Heng Liao

机构 * Taylor Lab, Huawei(华为塔利实验室) HiSilicon, Huawei(华为海思) Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉研究重点实验室)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 BAPS提出了一种细粒度低精度方案,通过块意识精度重标定和HiF8格式实现高效softmax,减少数据带宽和指数运算单元面积,提升Transformer推理吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17649 2026-02-03 cs.LG 50%

Longitudinal Progression Prediction of Alzheimer's Disease with Tabular Foundation Model

阿尔茨海默病纵向进展预测的表格基础模型

Yilang Ding, Jiawen Ren, Jiaying Lu, Gloria Hyunjung Kwak, Armin Iraji, Shengpu Tang, Alex Fedorov

机构 * Department of Computer Science Emory University Atlanta GA USA(埃默里大学计算机科学系) Center for Data Science Nell Hodgson Woodruff School of Nursing Emory University Atlanta GA USA(埃默里大学数据科学中心) Department of Computer Science Georgia State University Atlanta GA USA(佐治亚州立大学计算机科学系) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS) Atlanta GA USA(神经影像与数据科学转化研究三机构中心(TReNDS))

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出L2C-TabPFN方法,结合纵向到横断面转换与预训练表格基础模型,用于预测阿尔茨海默病的临床相关生物标志物,特别是在脑室体积预测上取得突破性成果。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00539 2026-02-03 cs.LG 50%

OpenDDI: A Comprehensive Benchmark for DDI Prediction

OpenDDI: 一种全面的DDI预测基准

Xinmo Jin, Bowen Fan, Xunkai Li, Henan Sun, YuXin Zeng, Zekai Chen, Yuxuan Sun, Jia Li, Qiangqiang Dai, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 OpenDDI提出一个全面的DDI预测基准,统一了多种数据集和评估标准,揭示了当前DDI预测的局限性并提供了关键指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00055 2026-02-03 cs.CY cs.DL 50%

Examining The CoVCues Dataset: Supporting COVID Infodemic Research Through A Novel User Assessment Study

审查CoVCues数据集:通过一种新的用户评估研究支持新冠假信息研究

Shreetika Poudel, Ankur Chatterjee

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过CoVCues数据集的用户评估研究,探讨了视觉提示在识别在线健康误导信息中的作用,填补了多模态数据集在该领域的空白。

Comments 10 pages, To Be Published In Proceedings Of The 1st IEEE Workshop on Healthcare and Medical Device Security, Privacy, Resilience, and Trust (IEEE HMD-SPiRiT), Accepted & Presented At The 7th IEEE International Conference on Trust, Privacy & Security in Intelligent Systems, and Applications (IEEE TPS 2025) on Nov. 11, 2025 in Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 9 篇

2602.01854 2026-02-03 cs.CV 83%

Fact or Fake? Assessing the Role of Deepfake Detectors in Multimodal Misinformation Detection

事实还是假象?评估深度伪造检测器在多模态虚假信息检测中的作用

A S M Sharifuzzaman Sagar, Mohammed Bennamoun, Farid Boussaid, Naeha Sharif, Lian Xu, Shaaban Sahmoud, Ali Kishk

机构 * The University of Western Australia(西澳大学) Fatih Sultan Mehmet Vakif University(法提赫·苏丹·梅赫梅特·瓦基夫大学) Aljazeera Media Network Investigative Department(半岛电视台调查部门)

专题命中 多模态Agent :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 研究评估了深度伪造检测器在多模态虚假信息检测中的作用,发现其独立价值有限,而证据驱动的事实核查系统表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02468 2026-02-03 cs.AI cs.CL 81%

Avenir-Web: Human-Experience-Imitating Multimodal Web Agents with Mixture of Grounding Experts

Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合

Aiden Yiliu Li, Xinyue Hao, Shilong Liu, Mengdi Wang

机构 * University College London(伦敦大学学院) The University of Edinburgh(爱丁堡大学) Princeton University(普林斯顿大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00993 2026-02-03 cs.RO cs.AI 79%

HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving

HERMES: 一种集成端到端风险感知多模态具身系统,用于长尾自动驾驶

Weizhe Tang, Junwei You, Jiaxi Liu, Zhaoyi Wang, Rui Gan, Zilin Huang, Feng Wei, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(土木与环境工程系,威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 HERMES通过整合视觉-语言模型和多模态感知,提升自动驾驶在长尾混合交通场景中的风险感知和轨迹规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00454 2026-02-03 cs.AI 79%

Cross-Modal Memory Compression for Efficient Multi-Agent Debate

多模态记忆压缩以实现高效的多智能体辩论

Jing Wu, Yue Sun, Tianpei Xie, Suiyao Chen, Jingyuan Bao, Yaopengxiao Xu, Gaoyuan Du, Inseok Heo, Alexander Gutfraind, Xin Wang

专题命中 多模态Agent :cross-modal(title,abstract);分类 cs.AI

AI总结 DebateOCR通过多模态压缩框架将多智能体辩论的历史文本转换为图像表示,显著减少token使用并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19185 2026-02-03 math.OC 78%

Distributionally Robust Optimization with Multimodal Decision-Dependent Ambiguity Sets

具有多模决策依赖不确定集的分布鲁棒优化

Xian Yu, Beste Basciftci

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出了一种基于ϕ-分歧度的多模决策依赖分布鲁棒优化框架,通过引入多模不确定集和分解算法,改进了DRO模型的求解方法,并通过案例验证了多模性对优化性能的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01983 2026-02-03 cs.AI 74%

Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning

从工具使用者到创作者的进化:通过无训练经验重用在多模态推理中

Xintian Shen, Jiawei Chen, Lihao Zheng, Hao Ma, Tao Wei, Kun Zhan

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 UCT框架通过无训练经验重用,使智能体从工具使用者转变为工具创造者,提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00103 2026-02-03 cond-mat.soft cond-mat.mtrl-sci cs.AI 57%

Autonomous Multi-Agent AI for High-Throughput Polymer Informatics: From Property Prediction to Generative Design Across Synthetic and Bio-Polymers

自主多智能体AI用于高通量聚合物信息学:从性质预测到生成设计跨越合成与生物聚合物

Mahule Roy, Adib Bazgir, Arthur da Silva Sousa Santos, Yuwen Zhang

机构 * Institute of Biomedical Engineering University of Oxford(生物医学工程研究所牛津大学) Department of Mechanical and Aerospace Engineering University of Missouri–Columbia(机械与航空航天工程系密苏里大学-哥伦比亚分校) Center for Engineering, Modeling and Applied Social Sciences Federal University of ABC (UFABC)(工程、建模与应用社会科学中心巴西联邦大学ABC分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出一个自主多智能体AI系统,用于高通量聚合物信息学,实现从性质预测到生成设计的跨合成与生物聚合物应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 50%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22431 2026-02-03 cs.SE 50%

TreeMind: Automatically Reproducing Android Bug Reports via LLM-empowered Monte Carlo Tree Search

TreeMind: 通过LLM赋能的蒙特卡洛树搜索自动重现Android bug报告

Zhengyu Chen, Zhaoyi Meng, Wenxiang Zhao, Wansen Wang, Wenchao Huang, Jie Cui, Hong Zhong, Yan Xiong

专题命中 多模态Agent :multi-modal(abstract)

AI总结 TreeMind结合LLM与MCTS算法,通过语义推理和反馈导航,高效重现Android bug报告。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 24 篇

2502.05568 2026-02-03 cs.CL cs.AI cs.LG 84%

Large Multimodal Models for Low-Resource Languages: A Survey

大规模多模态模型在低资源语言中的应用:综述

Marian Lupascu, Ana-Cristina Rogoz, Mihai Sorin Stupariu, Radu Tudor Ionescu

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大规模多模态模型在低资源语言中的应用,分析了适应技术及挑战,提供了方法导向的贡献比较和开放源代码资源。

Comments Accepted in Information Fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00505 2026-02-03 cs.CV cs.AI 84%

Sparse Shortcuts: Facilitating Efficient Fusion in Multimodal Large Language Models

稀疏快捷键:促进多模态大语言模型中的高效融合

Jingrui Zhang, Feng Liang, Yong Zhang, Wei Wang, Runhao Zeng, Xiping Hu

机构 * Guangdong-Hong Kong-Macao Joint Laboratory for Emotion Intelligence and Pervasive Computing, Artificial Intelligence Research Institute, Shenzhen MSU-BIT University, Shenzhen(粤港澳大湾区情感智能与 pervasive 计算联合实验室,人工智能研究院,深圳MSU-BIT大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SparseCut通过稀疏快捷连接和多粒度特征融合模块,提升多模态大语言模型在跨模态融合中的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏