arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 107 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2602.19001 2026-02-24 cs.CV 79%

A Benchmark and Knowledge-Grounded Framework for Advanced Multimodal Personalization Study

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19715 2026-02-24 cs.CV 74%

Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM-as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision

像素不会说谎(但你的检测器可能会):通过生成器-评估器过程构建MLLM作为判断者以实现可信的深度伪造检测和推理监督

Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall

机构 * MBZUAI Monash University(墨尔本大学)

专题命中 多模态评测 :MLLM(title);分类 cs.CV

AI总结 本文提出DeepfakeJudge框架,通过生成器-评估器过程提升深度伪造检测的推理忠实性,实现高准确率和高一致性的推理监督。

Comments CVPR-2026, Code is available here: https://github.com/KjAeRsTuIsK/DeepfakeJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19828 2026-02-24 cs.CV 70%

TextShield-R1: Reinforced Reasoning for Tampered Text Detection

TextShield-R1: 用于篡改文本检测的强化推理

Chenfan Qu, Yiwu Zhong, Jian Liu, Xuekang Zhu, Bohan Yu, Lianwen Jin

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 TextShield-R1通过强化学习和OCR校正技术,提升篡改文本检测的准确性和鲁棒性,解决现有方法在微特征识别和跨语言评估中的不足。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26961 2026-02-24 cs.CV eess.IV 70%

SYNAPSE-Net: A Unified Framework with Lesion-Aware Hierarchical Gating for Robust Segmentation of Heterogeneous Brain Lesions

SYNAPSE-Net:一种具有病变感知分层门控的统一框架,用于鲁棒分割异质性脑病变

Md. Mehedi Hassan, Shafqat Alam, Shahriar Ahmed Seam, Maruf Ahmed

机构 * Department of Biomedical Engineering, Bangladesh University of Engineering and Technology(生物医学工程系,孟加拉国工程与技术大学) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(计算机科学与工程系,孟加拉国工程与技术大学) Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SYNAPSE-Net通过统一框架和病变感知门控,实现鲁棒的多病理脑病变分割,提升分割精度与稳定性。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 62%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18729 2026-02-24 cs.CV cs.AI 62%

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估

Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。

Comments EACL 2026, Main, Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18520 2026-02-24 cs.CV cs.AI 62%

Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams

Sketch2Feedback: 用于学生STEM图表的基于语法规则的反馈框架

Aayam Bansal

机构 * IEEE

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Sketch2Feedback通过结合语法规则和视觉语言模型,提高了学生STEM图表反馈的准确性与可靠性,展示了语法规则与端到端方法的互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02240 2026-02-24 cs.CV cs.AI 62%

RewardMap: Tackling Sparse Rewards in Fine-grained Visual Reasoning via Multi-Stage Reinforcement Learning

RewardMap: 通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励

Sicheng Feng, Kaiwen Tuo, Song Wang, Lingdong Kong, Jianke Zhu, Huan Wang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RewardMap通过多阶段强化学习解决细粒度视觉推理中的稀疏奖励问题,提升多模态大语言模型的视觉理解和推理能力。

Comments ICLR 2026, website: https://fscdc.github.io/RewardMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19432 2026-02-24 cs.CV 57%

CountEx: Fine-Grained Counting via Exemplars and Exclusion

CountEx:通过实例和排除实现细粒度计数

Yifeng Huang, Gia Khanh Nguyen, Minh Hoai

机构 * Department of Computer Science, Stony Brook University(计算机科学系,石英布鲁克大学) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CountEx通过引入包含和排除的多模态提示,结合判别查询细化模块,实现细粒度视觉计数的准确性和效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23169 2026-02-24 cs.CV 57%

REVEALER: Reinforcement-Guided Visual Reasoning for Element-Level Text-Image Alignment Evaluation

REVEALER: 基于强化引导的视觉推理的元素级文本-图像对齐评估

Fulin Shi, Wenyi Xiao, Bin Chen, Liang Din, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 REVEALER通过强化引导的视觉推理实现元素级文本-图像对齐评估,提升模型对齐判断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21062 2026-02-24 cs.CV 57%

Inverse Virtual Try-On: Generating Multi-Category Product-Style Images from Clothed Individuals

逆虚拟试穿:从着装个体生成多类产品风格图像

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Trento(特伦托大学) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 TEMU-VTOFF通过文本增强和多模态注意力机制,解决虚拟脱衣任务中细节丢失和视觉歧义问题,实现高质量多类产品图像生成。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2602.19304 2026-02-24 cs.RO cs.AI cs.HC cs.MA 79%

Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation

安全且可解释的多模态路径规划用于多智能体协作

Haojun Shi, Suyu Ye, Katherine M. Guerrerio, Jianzhi Shen, Yifan Yin, Daniel Khashabi, Chien-Ming Huang, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18731 2026-02-24 cs.AI 79%

Beyond Description: A Multimodal Agent Framework for Insightful Chart Summarization

超越描述:一种多模态代理框架用于深入的图表摘要

Yuhang Bai, Yujuan Ding, Shanru Lin, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出多模态代理框架Chart Insight Agent Flow,通过结合MLLMs的感知与推理能力,提升图表摘要的深度和多样性,并引入新数据集ChartSummInsights以支持研究。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19346 2026-02-24 cs.RO cs.SY eess.SY 78%

Design and Control of Modular Magnetic Millirobots for Multimodal Locomotion and Shape Reconfiguration

模块化磁性微机器人多模态运动与形状重构设计与控制

Erik Garcia Oyono, Jialin Lin, Dandan Zhang

机构 * Department of Bioengineering, Imperial College London(帝国理工学院生物工程系)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本研究提出一种模块化磁性微机器人平台,通过多模块协同实现多模态运动与形状重构,展示了在受限环境中稳健控制的潜力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19516 2026-02-24 cs.CE 67%

Pixel2Phys: Distilling Governing Laws from Visual Dynamics

Pixel2Phys: 从视觉动态中提炼 governing laws

Ruikun Li, Jun Yao, Yingfan Hua, Shixiang Tang, Biqing Qi, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。

Comments CVPR2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18729 2026-02-24 cs.CV 57%

GuideFlow: Constraint-Guided Flow Matching for Planning in End-to-End Autonomous Driving

GuideFlow: 基于约束的流匹配用于端到端自动驾驶中的规划

Lin Liu, Caiyan Jia, Guanyi Yu, Ziying Song, JunQiao Li, Feiyang Jia, Peiliang Wu, Xiaoshuai Hao, Yadan Luo

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Qcraft Yanshan University(燕山大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Queensland(昆士兰大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 GuideFlow通过约束流匹配技术,在端到端自动驾驶中实现高效规划,直接强制显式约束并提升物理约束满足能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19764 2026-02-24 cs.RO 50%

Towards Dexterous Embodied Manipulation via Deep Multi-Sensory Fusion and Sparse Expert Scaling

通过深度多感官融合与稀疏专家扩展实现灵巧的具身体验

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Zhihao xia, Qionglin Ren, Chunxu tian, Zhongxue Ga

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Engineering, Harbin Institute of Technology(信息科学与工程学院,哈尔滨工业大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 DeMUSE通过深度多感官融合与稀疏专家扩展,实现复杂物理互动的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18572 2026-02-24 cs.LG q-fin.ST 50%

Sub-City Real Estate Price Index Forecasting at Weekly Horizons Using Satellite Radar and News Sentiment

基于卫星雷达和新闻情绪的周频次下辖城市房地产价格指数预测

Baris Arat, Hasan Fehmi Ates, Emre Sefer

机构 * Ozyegin University(奥兹根大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文通过结合卫星雷达与新闻情绪数据,实现了下辖城市房地产价格指数的周频预测,显著提升了长期预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 22 篇

2602.19605 2026-02-24 cs.CV cs.AI cs.MM 85%

CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning

CLCR:多模态学习中的跨层语义协作表示

Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Shantou University(汕头大学) University of Macau(澳门大学) Guangzhou Huashang College(广州华商学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CLCR通过跨层语义协同表示方法,有效解决多模态数据中的语义错位问题,提升多模态学习的表示质量与任务泛化能力。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19585 2026-02-24 cs.MM cs.AI 84%

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

三子空间解耦用于多模态情感分析

Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu, Rong Fu, Zhongxue Gan, Chun Ouyang

机构 * Fudan University(复旦大学) Peking University(北京大学) University of Macau(澳门大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出三子空间解耦框架,通过分解多模态特征为公共、子模态共享和私人子空间,提升多模态情感分析的性能和鲁棒性。

Comments This study has been Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20046 2026-02-24 cs.CV cs.LG 83%

Closing the gap in multimodal medical representation alignment

弥合多模态医学表征对齐的差距

Eleonora Grassucci, Giordano Cicchetti, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种模态无关的框架,用于弥合多模态医学表征对齐中的模态差距,提升放射学图像与临床文本之间的对齐效果。

Comments Accepted at MLSP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19832 2026-02-24 cs.CV 83%

M3S-Net: Multimodal Feature Fusion Network Based on Multi-scale Data for Ultra-short-term PV Power Forecasting

M3S-Net:基于多尺度数据的多模态特征融合网络用于超短期光伏功率预测

Penghui Niu, Taotao Cai, Suqi Zhang, Junhua Gu, Ping Zhang, Qiqi Liu, Jianxin Li

机构 * School of Artificial Intelligence, Hebei University of Technology(人工智能学院,河北工业大学) University of Southern Queensland(南方昆士兰大学) School of Information Engineering, Tianjin University of Commerce(信息工程学院,天津商业大学) Hebei Province Key Laboratory of Big Data Calculation, Hebei University of Technology(大数据计算河北重点实验室,河北工业大学) General AI Lab, School of Engineering, Westlake University(通用人工智能实验室,西湖大学) School of Business and Law, Edith Cowan University(商学院和法学院,埃迪斯科文大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 M3S-Net通过多尺度数据融合和跨模态Mamba交互模块,提升超短期光伏功率预测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19505 2026-02-24 cs.CV 83%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03830 2026-02-24 cs.AI cs.CV cs.CY 81%

Decoding Tourist Perception in Historic Urban Quarters with Multimodal Social Media Data: An AI-Based Framework and Evidence from Shanghai

通过多模态社交媒体数据解码历史城市街区的游客感知:一种基于人工智能的框架及上海的实证

Kaizhen Tan, Yufan Wu, Yuxuan Liu, Haoran Zeng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于人工智能的多模态框架,通过分析社交媒体数据解码游客对历史城市街区的感知,揭示感知与现实之间的差距,并为遗产管理和城市设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18745 2026-02-24 cs.CV cs.AI 81%

Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code

从零开始合成多模态几何数据集并借助绘图代码实现视觉对齐

Haobo Lin, Tianyi Bai, Chen Chen, Jiajun Zhang, Bohan Zeng, Wentao Zhang, Binhang Yuan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoCode数据集,通过代码预测实现视觉对齐,提升多模态几何推理性能。

Comments 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 81%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 79%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19702 2026-02-24 cs.IR cs.AI 79%

DReX: An Explainable Deep Learning-based Multimodal Recommendation Framework

DReX:一种基于深度学习的可解释多模态推荐框架

Adamya Shyam, Venkateswara Rao Kagita, Bharti Rana, Vikas Kumar

机构 * University of Delhi, Delhi, India(德里大学) National Institute of Technology, Warangal, India(印度战争格尔国家理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 DReX通过多模态反馈的交互级特征逐步细化用户和物品表示,提升推荐系统的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19140 2026-02-24 cs.CV cs.LG 79%

CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion

CaReFlow:循环适应修正流用于多模态融合

Sijie Mai, Shiqin Han

机构 * South China Normal University(华南师范大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 CaReFlow通过循环适应修正流实现多模态融合,解决模态间隙问题,提升分布对齐和特征转换的鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 79%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏