arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-17 至 2026-02-17 共收录 101 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 10 篇

2602.13689 2026-02-17 cs.RO cs.CV 70%

Symmetry-Aware Fusion of Vision and Tactile Sensing via Bilateral Force Priors for Robotic Manipulation

通过双侧力先验实现视觉与触觉感知的对称感知融合用于机器人操作

Wonju Lee, Matteo Grimaldi, Tao Yu

机构 * DexAI, Emergent Business Unit, Analog Devices Inc.(DexAI,新兴业务部,安森通公司)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于双侧力先验的跨模态Transformer,通过结构化注意力机制实现视觉与触觉融合,在机器人操作中实现了96.59%的插入成功率,展示了触觉感知的重要性及物理启发正则化的有效性。

Comments Accepted By ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03407 2026-02-17 cs.GR cs.AI cs.CV cs.LG 62%

Multi-Spectral Gaussian Splatting with Neural Color Representation

多光谱高斯点云渲染与神经颜色表示

Lukas Meyer, Josef Grün, Maximilian Weiherer, Bernhard Egger, Marc Stamminger, Linus Franke

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MS-Splatting框架,通过神经颜色表示实现多光谱3D高斯点云渲染,提升多光谱和单光谱渲染质量,应用于植被指数渲染。

Comments for project page, see https://meyerls.github.io/ms_splatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL 57%

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 50%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 7 篇

2602.13289 2026-02-17 cs.CV cs.AI 84%

Evaluating the Impact of Post-Training Quantization on Reliable VQA with Multimodal LLMs

评估后训练量化对多模态大语言模型可靠视觉问答的影响

Paul Jonas Kurz, Tobias Jan Wieczorek, Mohamed A. Abdelsalam, Rahaf Aljundi, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了后训练量化对多模态大语言模型可靠视觉问答的影响,提出通过选择器置信度估计器提升可靠性,并在不同量化方法中实现了效率与可靠性的最佳平衡。

Comments Accepted poster at the 1st Workshop on Epistemic Intelligence in Machine Learning (EIML) @ EURIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12027 2026-02-17 math.ST math.PR stat.TH 78%

General-purpose post-sampling reweighting method for multimodal target measures

通用多模态目标度量后采样重加权方法

Pierre Monmarché

专题命中 其他多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出了一种通用方法,通过最小化加权经验分布与目标度量之间的Kullback-Leibler散度来改进多模态分布采样中的重加权估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15307 2026-02-17 stat.CO physics.comp-ph 78%

An ILUES-based adaptive Gaussian process method for multimodal Bayesian inverse problems

基于ILUES的自适应高斯过程方法用于多模态贝叶斯反问题

Zhihang Xu, Xiaoyu Zhu, Daoji Li, Qifeng Liao

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出基于ILUES的自适应高斯过程方法,用于解决多模态贝叶斯反问题中的高效采样问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 70%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 其他多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14788 2026-02-17 cs.CV cs.AI 62%

VIPA: Visual Informative Part Attention for Referring Image Segmentation

VIPA: 视觉信息部分注意力用于指认图像分割

Yubin Cho, Hyunwoo Yu, Kyeongbo Kong, Kyomin Sohn, Bongjoon Hyun, Suk-Ju Kang

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VIPA通过视觉信息部分注意力和视觉表达生成器提升指认图像分割的细粒度分割性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13264 2026-02-17 cs.LG cs.AI cs.CL 62%

Directional Concentration Uncertainty: A representational approach to uncertainty quantification for generative models

方向性集中不确定性:一种代表方法用于生成模型的不确定性量化

Souradeep Chattopadhyay, Brendan Kennedy, Sai Munikoti, Soumik Sarkar, Karl Pazdernik

机构 * Department of Mechanical Engineering, Iowa State University, Ames, IA, USA(机械工程系,爱荷华州立大学) Pacific Northwest National Laboratory, Richland, WA, USA(太平洋西北国家实验室) Department of Statistics, North Carolina State University, Raleigh, NC, USA(统计系,北卡罗来纳州立大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出方向性集中不确定性(DCU)方法,通过基于vMF分布的嵌入集中度量化,提升生成模型的不确定性量化性能,并在多模态任务中展现良好泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14491 2026-02-17 physics.app-ph 50%

A Low-Dispersion Depressed Core Waveguide for Dielectric Waveguide Interconnects

一种低色散压低芯波导用于介质波导互连

Mohamed Elsawaf, Neelam Prabhu Gaunkar, Georgios C. Dogiamis, Constantine Sideris

专题命中 其他多模态 :cross-modal(abstract)

AI总结 本研究提出一种低色散压低芯波导,通过包裹材料提高基模限制并减少高阶模式耦合,实验验证其群延迟性能优于未包裹波导。

详情

展开后加载摘要…

URL PDF HTML 收藏