arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-17 至 2026-02-17 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2602.13715 2026-02-17 cs.IR 89%

DMESR: Dual-view MLLM-based Enhancing Framework for Multimodal Sequential Recommendation

DMESR: 基于双视角的多模态序列推荐增强框架

Mingyao Huang, Qidong Liu, Wenxuan Yang, Moranxin Wang, Yuqi Sun, Haiping Zhu, Feng Tian, Yan Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(title,abstract);cross-modal(abstract)

AI总结 DMESR通过双视角机制解决多模态序列推荐中的语义对齐和细粒度语义丢失问题,提升推荐效果。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13606 2026-02-17 cs.NI cs.AI cs.ET cs.LG 85%

Multi-Modal Sensing and Fusion in mmWave Beamforming for Connected Vehicles: A Transformer Based Framework

毫米波波束成形中多模态感知与融合:基于变换器的框架

Muhammad Baqer Mollah, Honggang Wang, Mohammad Ataul Karim, Hua Fang

机构 * Department of Electrical and Computer Engineering, University of Massachusetts Dartmouth(电子与计算机工程系,马萨诸塞大学达特茅斯分校) Department of Graduate Computer Science and Engineering, Katz School of Science and Health, Yeshiva University(研究生计算机科学与工程系,耶鲁大学科学与健康学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于变换器的多模态感知与融合框架,用于毫米波波束成形,以减少波束训练开销并提高连接车辆的通信效率。

Comments 13 Pages. arXiv admin note: text overlap with arXiv:2509.11112

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13857 2026-02-17 cs.LG eess.SP 82%

sleep2vec: Unified Cross-Modal Alignment for Heterogeneous Nocturnal Biosignals

sleep2vec:用于异构夜间生物信号的统一跨模态对齐

Weixuan Yuan, Zengrui Jin, Yichen Wang, Donglin Xie, Ziyi Ye, Chao Zhang, Xuesong Chen

机构 * Five Seasons Medical(五 Seasons 医疗) Tsinghua University(清华大学) Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) Peking University(北京大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14518 2026-02-17 cs.AI 79%

Diagnosing Knowledge Conflict in Multimodal Long-Chain Reasoning

多模态长链推理中的知识冲突诊断

Jing Tang, Kun Wang, Haolang Lu, Hongjin Chen, KaiTao Chen, Zhongxiang Sun, Qiankun Li, Lingjuan Lyu, Guoshun Nan, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Renmin University of China(中国人民大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出了一种统一的知识冲突概念,揭示了多模态长链推理中不同冲突类型的特征和处理机制,为诊断和控制推理失败提供了原理性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10685 2026-02-17 cs.CV 79%

GaussianFormer3D: Multi-Modal Gaussian-based Semantic Occupancy Prediction with 3D Deformable Attention

GaussianFormer3D: 多模态基于高斯的语义占用预测与3D可变形注意力

Lingjun Zhao, Sizhe Wei, James Hays, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 GaussianFormer3D通过3D可变形注意力机制,结合激光雷达与摄像头数据,实现高效且精确的语义占用预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13315 2026-02-17 cs.CV cs.AI 73%

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner: 在视觉令牌修剪中协调重要性与多样性

Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

机构 * School of Software, Tsinghua University(清华大学软件学院) Tencent(腾讯)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 IDPruner通过协调重要性与多样性,提出了一种高效的视觉令牌修剪方法,实现最优平衡并提升多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13689 2026-02-17 cs.RO cs.CV 70%

Symmetry-Aware Fusion of Vision and Tactile Sensing via Bilateral Force Priors for Robotic Manipulation

通过双侧力先验实现视觉与触觉感知的对称感知融合用于机器人操作

Wonju Lee, Matteo Grimaldi, Tao Yu

机构 * DexAI, Emergent Business Unit, Analog Devices Inc.(DexAI,新兴业务部,安森通公司)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于双侧力先验的跨模态Transformer,通过结构化注意力机制实现视觉与触觉融合,在机器人操作中实现了96.59%的插入成功率,展示了触觉感知的重要性及物理启发正则化的有效性。

Comments Accepted By ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03407 2026-02-17 cs.GR cs.AI cs.CV cs.LG 62%

Multi-Spectral Gaussian Splatting with Neural Color Representation

多光谱高斯点云渲染与神经颜色表示

Lukas Meyer, Josef Grün, Maximilian Weiherer, Bernhard Egger, Marc Stamminger, Linus Franke

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MS-Splatting框架,通过神经颜色表示实现多光谱3D高斯点云渲染,提升多光谱和单光谱渲染质量,应用于植被指数渲染。

Comments for project page, see https://meyerls.github.io/ms_splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL 57%

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 50%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏