arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2606.11749 2026-06-11 cs.IR 新提交 78%

FAST-MEL: A Fast, Accurate, and Storage Efficient Solution for Multimodal Entity Linking

FAST-MEL: 一种快速、准确且存储高效的多模态实体链接解决方案

Derrien Thomas, Laurent Amsaleg, Pascale Sébillot

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出FAST-MEL,通过紧凑的固定大小向量化表示文本和视觉信息,在保持高准确率的同时实现三个数量级的加速和一个数量级的存储节省。

Journal ref SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21639 2026-06-11 cs.CY cs.LG 版本更新 78%

A Multi-Modal Sensor Fusion Instrument for Measuring Regional Human Mobility: The Distributed Human Data Engine (DHDE)

多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)

Amil Khanzada, Takuji Takemoto

机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。

Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19276 2026-06-11 cs.IR 版本更新 78%

MOTOR: Learning ID-free Item Representation with Token Crossing for Embedding-based Multimodal Recommendation

MOTOR:基于令牌交叉的无ID多模态物品表示学习用于嵌入推荐

Kangning Zhang, Jiarui Jin, Yingjie Qin, Ruilong Su, Jianghao Lin, Yong Yu, Weinan Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MOTOR框架,用可学习共享多模态令牌替代物品ID嵌入,通过产品量化和令牌交叉网络实现语义共享与冷启动改进。

Comments Accepted by ECML-PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03063 2026-06-10 cs.SI 78%

Unsupervised Multimodal Graph-based Model for Geo-social Analysis

无监督多模态图模型用于地理社交分析

Ehsaneddin Jalilian, Bernd Resch

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出无监督多模态图模型,整合语义与地理信息,提升灾难管理和舆论监控中的内容分析效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08553 2026-06-09 cs.SE 新提交 78%

FusionVul: A Multimodal Feature Fusion Framework for Source Code Vulnerability Detection

FusionVul:一种用于源代码漏洞检测的多模态特征融合框架

Hongyu Yang, Yaping Zhu, Jingchuan Luo, Hiroshi Nomaguchi, Chunhua Su, Willy Susilo

专题命中 多模态训练与对齐 :multimodal(title);cross-modal(abstract)

AI总结 提出FusionVul框架,融合Transformer和GNN分别提取序列语法与结构语义,通过交叉注意力融合网络和样本感知加权机制,在SVulD等数据集上取得更优F1分数,有效捕获复杂多样的漏洞模式。

Comments Accepted by The Journal of Systems and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22243 2026-06-09 cs.RO 版本更新 78%

SODA-CitrON: Static Object Data Association by Clustering Multi-Modal Sensor Detections Online

SODA-CitrON:通过在线聚类多模态传感器检测实现静态物体数据关联

Jan Nausner, Kilian Wohlleben, Michael Hubner

机构 * Jan Nausner, Kilian Wohlleben, Michael Hubner

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出SODA-CitrON方法,通过在线聚类多模态传感器检测实现静态物体的数据关联,同时估计位置并维持持久跟踪,优于现有方法在F1分数、位置RMSE、MOTP和MOTA指标上。

Comments 8 pages, 5 figures; \c{opyright} 2026 IEEE. Accepted for the 2026 International Conference on Information Fusion (FUSION 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.06040 2026-06-04 stat.ME cs.NA math.NA stat.AP stat.ML 78%

Tensor Analysis and Fusion of Multimodal Brain Images

张量分析与多模态脑图像融合

Esin Karahan, Pedro A. Rojas-Lopez, Maria L. Bringas-Vega, Pedro A. Valdes-Hernandez, Pedro A. Valdes-Sosa

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用张量结构分析多模态神经影像数据,引入马尔可夫-彭罗斯图进行建模,首次将Granger因果分析视为张量回归问题,展示其在脑网络分解中的潜力。

Comments 23 pages, 15 figures, submitted to Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01471 2026-06-03 cs.IR cs.LG 78%

Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning

通过协同注意力重建内容以提升多模态嵌入质量

Jiahan Chen, Da Li, Hengran Zhang, Yinqiong Cai, Lixin Su, Jiafeng Guo, Daiting Shi, Dawei Yin, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31193 2026-06-01 cs.LG 78%

Geometry-based Schrödinger Bridges for Trustworthy Multimodal Fusion

基于几何的薛定谔桥用于可信多模态融合

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

机构 * Department of Computer Science(计算机科学系) Techonology, Huaqiao University(技术学系,华侨大学) Xiamen Key Laboratory of Computer Vision(厦门计算机视觉实验室) Pattern Recognition, Huaqiao University(模式识别,华侨大学) Tongji University(同济大学) School of Cyber Science(网络科学学院) Engineering, Wuhan University(工程学院,武汉大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于几何的多模态融合方法GMF,利用扩散薛定谔桥的初始速度平方作为独立于预测的可靠性信号,以提升对低质量数据的鲁棒性。

Comments ICML 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27678 2026-05-28 cs.LG cs.DC 78%

Heterogeneous Parallelism for Multimodal Large Language Model Training

多模态大语言模型训练的异构并行

Yashaswi Karnati, Kamran Jafari, Akash Mehra, Li Ding, Pranav Prashant Thombre, Ali Roshan Ghias, Shifang Xu, Parth Mannan, Yu Yao, Hao Wu, Eric Harper, Ashwath Aithal, Nima Tajbakhsh

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态大语言模型训练中单一LLM中心并行布局导致的吞吐量瓶颈,提出异构并行抽象,允许各模块独立布局和放置,并通过边界通信器实现张量语义保持,实验表明可提升TFLOPS/GPU最高49.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27583 2026-05-28 cs.LG 78%

Information-theoretic Multimodal Representation Learning for Electrocardiogram Signals

基于信息论的心电图信号多模态表示学习

Phu X. Nguyen, Konstantinos Kontras, Wei Dai, Huy Phan, Christos Chatzichristos, Paul Pu Liang, Bert Vandenberk, Maarten De Vos

机构 * KU Leuven(库勒芬大学) University Hospitals Leuven(鲁文大学医院) MIT(麻省理工学院) DFKI(德国达姆施塔特研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出MERIT框架,通过信息论视角结合掩码心电图建模与心电图-文本对比对齐,学习保留信号结构并整合临床语义的心电图表示,在分类、零样本和文本生成任务中取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20480 2026-05-28 cs.RO 78%

Degradation-Aware Cooperative Multi-Modal GNSS-Denied Localization Leveraging LiDAR-Based Robot Detections

基于激光雷达机器人检测的退化感知协同多模态GNSS拒止定位

Václav Pritzl, Xianjia Yu, Tomi Westerlund, Petr Štěpán, Martin Saska

机构 * Multi-robot Systems Group, Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(布拉格捷克技术大学电气工程学院控制学系多机器人系统组) Turku Intelligent Embedded and Robotic Systems (TIERS) Lab, University of Turku(图尔库大学智能嵌入式与机器人系统实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出一种因子图框架下的自适应多模态多机器人协同定位方法,融合异步VIO、LIO和3D机器人间检测,通过插值因子和Wasserstein距离加权处理传感器退化,显著提升定位精度。

Comments Preprint version. This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25726 2026-05-26 cs.IR 78%

SIREN: Unified Multi-Granularity Semantic Interaction for Multi-Modal Lifelong User Interest Modeling

SIREN:面向多模态终身用户兴趣建模的统一多粒度语义交互

Yaqian Zhang, Ruyi Yu, Tianyi Li, Bohan Liu, Maoquan Ye, Ke Wang, Shifeng Wen, Junwei Pan, Lijie Wang, Qi Zhou, Yeshou Cai, Chengguo Yin, Lifeng Wang, Hui Li, Lei Xiao, Haijie Gu

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 提出SIREN框架,通过统一多粒度语义交互(包括基于多模态相似性的软检索和基于语义ID的硬检索)解决多模态与协同空间的对齐问题,在离线数据集上达到最优GAUC,并在腾讯广告平台多个场景中取得GMV提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25540 2026-05-26 cs.SD cs.LG 78%

A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning

基于语言和声学表征学习的多模态痴呆检测框架

Loukas Ilias, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(决策支持系统实验室,电气与计算机工程学院,国家技术大学雅典)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出一个端到端可训练的多模态深度学习框架,通过预训练模型提取声学和文本特征,结合注意力融合与互信息最大化,实现自动痴呆检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25161 2026-05-26 physics.geo-ph 78%

FMSIM: A Multimodal Flow Matching Framework for Conditional Geomodeling

FMSIM: 一种用于条件地质建模的多模态流匹配框架

Jiayuan Huang, Suihong Song, Tapan Mukerji

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract)

AI总结 提出FMSIM多模态条件流匹配框架,通过深度学习速度场、语义表示、迭代投影和时间引导门控机制,融合概念地质描述、稀疏井观测和空间先验约束,实现高效稳定的地下相模型生成。

Comments Preprint version of a manuscript submitted to Water Resources Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20674 2026-05-21 cs.LG 78%

Modular Multimodal Classification Without Fine-Tuning: A Simple Compositional Approach

无需微调的模块化多模态分类:一种简单的组合方法

Herman Bergström, Aditya Mehrotra, Rahul G. Krishnan

机构 * Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) Vector Institute(向量研究所) University of Toronto(多伦多大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出CoMET,一种无需微调的多模态分类方法,通过冻结预训练的backbone对每个模态进行处理,使用PCA压缩嵌入并输入到表格基础模型中进行预测,展示了PCA作为适配器在不同模态上的强大鲁棒性能,并提出了PALPooling来提升表示质量,实现了无需训练的多模态学习最佳结果。

Comments 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19135 2026-05-20 cs.LG 78%

Identifiable Multimodal Causal Representation Learning under Partial Latent Sharing

部分潜在变量共享下的可识别多模态因果表示学习

Manal Benhamza, Marianne Clausel, Myriam Tami

机构 * Paris-Saclay University, CentraleSupélec, MICS Lab(巴黎-萨克雷大学,中央理工-巴黎高等电力学院,MICS实验室) Lorraine University, CRAN(洛林大学,CRAN)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在部分潜在变量共享设定下多模态因果表示学习的可识别性问题,通过非线性混合函数生成各模态数据,并在不假设潜在变量分布的情况下,建立了因果潜在表示的组件可识别性保证,进一步验证了在欠定情况下方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17369 2026-05-19 astro-ph.SR 78%

The Deep Learning-Based Dual-Branch Multimodal Fusion Model for Solar Flare Prediction

基于深度学习的双分支多模态融合模型用于太阳耀斑预测

Limin Zhao, Xingyao Chen, Xiaoshuai Zhu, Dong Zhao, and Yihua Yan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种双分支多模态融合深度学习模型,用于预测24小时内的太阳耀斑,通过交叉注意力机制整合磁图和磁参数,并在特征层面进行跨尺度交互以增强多尺度表示,同时实现了二分类和多分类任务,实验结果表明模型在预测X级耀斑方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17366 2026-05-19 cs.IR 78%

Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation

基于文本引导的视觉表示学习用于鲁棒的多模态电子商务推荐

Yufei Guo, Jing Ma, Tianlu Zhang, Shijie Yang, Yanlong Zang, Weijie Ding, Pinghua Gong, Jungong Han

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出Text-Guided Q-Former框架,通过结构化元数据指导视觉令牌提取,提升多模态检索的鲁棒性,实验表明其在电子商务数据集上显著提升了检索性能。

Comments 12 pages, 5 figures. Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16639 2026-05-19 cs.LG 78%

MedMIX: Modality-Internal Expert Fusion for Multimodal Medical Diagnosis

MedMIX:多模态医学诊断中的模态内部专家融合

Seungik Cho, Anqi Li, Wei Qiu

机构 * Department of Physics and Astronomy(物理与天文学系) Department of Electrical and Computer Engineering(电气与计算机工程系) Rice University(里奇大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MedMIX通过融合模态内部专家、跨模态学习融合及大-小模型协作,提升多模态医学预测的鲁棒性,适用于缺失模态的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15235 2026-05-18 cs.LG 78%

MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion

MuteBench: 多模态融合不完整性容忍性评估

Wugeng Zheng, Ziwen Kan, Tianlong Chen, Chen Chen, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MuteBench评估多模态融合在模态缺失和内模态缺失下的鲁棒性,发现架构类型是预测鲁棒性的最强因素,且通道独立模型对模态缺失容忍性高但对内模态缺失敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21294 2026-05-18 cs.LG stat.ML 78%

Missing-Data-Induced Phase Transitions in Spectral PLS for Multimodal Learning

谱PLS中缺失数据诱导的相变在多模态学习中的研究

Anders Gjølbye, Ida Kargaard, Emma Kargaard, Lina Skerath, Lars Kai Hansen

机构 * Technical University of Denmark(丹麦技术大学) Department of Applied Mathematics and Computer Science(应用数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文研究了在高维 spiked 模型下,缺失数据对谱 PLS 的影响,揭示了信号强度与噪声阈值之间的相变现象,并通过模拟验证了理论结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13312 2026-05-14 cs.LG 78%

Supervised Deep Multimodal Matrix Factorization for Interpretable Brain Network Analysis

监督深度多模态矩阵分解用于可解释性脑网络分析

Amjad Seyedi, Lifang He, Songlin Zhao, Akwum Onwunta, Nicolas Gillis

机构 * Dept. of Mathematics & Operational Research University of Mons(数学与运筹学系蒙斯大学) Dept. of Computer Science & Engineering Lehigh University(计算机科学与工程系莱斯大学) Dept. of Industrial & Systems Engineering Lehigh University(工业与系统工程系莱斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SD3MF框架,通过深度层次分解和共享潜在表示整合多模态脑网络数据,实现可解释的群体预测。实验表明SD3MF在多模态连接组数据上优于CNN和GNN等基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12852 2026-05-14 cs.LG q-bio.QM 78%

Multitask Multimodal Fusion with Tabular Foundation Models for Peak and Durability Prediction of Pertussis Booster Response

多任务多模态融合:基于表格基础模型的百日咳加强针反应峰值和持续性预测

Divya Sitani

机构 * Berlin, Germany(柏林,德国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出多任务对比多模态融合架构,用于预测百日咳加强针反应的峰值和持续性,通过结合冻结的TabPFN-v2模态编码器、双标签监督对比损失、模态dropout和缺失性掩码注意力融合,实现了对两个任务的联合预测。

Comments 22 pages, 8 figures, 4 tables. Code available at https://github.com/Divya1205/cmi-pb-multitask

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15953 2026-05-14 cs.RO 78%

ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation

ViTacFormer:学习跨模态表示以实现视觉-触觉灵巧操作

Liang Heng, Haoran Geng, Kaifeng Zhang, Pieter Abbeel, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) Sharpa

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出ViTacFormer,通过跨注意力编码器融合高分辨率视觉与触觉,并结合自回归触觉预测头提升精度与鲁棒性,实现多指手的模仿学习,成功完成高精度灵巧操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09355 2026-05-12 cs.LG 78%

FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning

FLAME:适应性专家混合用于连续多模态多任务学习

Xing Han, Shravan Chaudhari, Tanvi Ranade, Rama Chellappa, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。

Comments 37 pages, 25 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04323 2026-05-11 cs.LG cs.DB 78%

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

LUCAS-MEGA:一个大规模多模态数据集,用于土壤-环境系统的表示学习

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer

机构 * Earth Rover Program(Earth Rover项目) Centre for Crop and Environmental Science(作物与环境科学中心) European Commission Joint Research Centre(欧盟联合研究中心) Department of Mathematics and Statistics & Center for Environmental Intelligence(数学与统计系及环境智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 LUCAS-MEGA通过系统数据融合构建了大规模多模态数据集,用于提升土壤-环境系统的表示学习能力,通过SoilFuser管道标准化数据并生成统一特征空间,预训练SoilFormer模型实现了稳定的训练和预测性能。

Comments 27 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 78%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 多模态训练与对齐 :multi-modal(title);image-text(abstract)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22991 2026-05-08 cs.LG 78%

Fusion or Confusion? Multimodal Complexity Is Not All You Need

融合还是混淆?多模态复杂性并不都是你需要的

Tillmann Rheude, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林查理医院) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文通过大规模实验挑战多模态学习中复杂架构提升性能的假设,发现增加复杂性常导致混淆而非有效融合,强调需转向方法论严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19423 2026-05-01 cs.IR 78%

UniRec: Unified Multimodal Encoding for LLM-Based Recommendations

UniRec:基于LLM的推荐系统的统一多模态编码

Zijie Lei, Tao Feng, Zhigang Hua, Yan Xie, Guanyu Lin, Shuang Yang, Ge Liu, Jiaxuan You

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 UniRec通过统一多模态编码解决推荐系统中多模态信息的理解挑战,提出三元组表示和分层Q-Former结构,实现在多个基准测试中提升15%的性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏