arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-22 至 2026-01-22 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2407.19030 2026-01-22 stat.ME math.ST stat.TH 86%

Multimodal data integration and cross-modal querying via orchestrated approximate message passing

多模态数据整合与跨模态查询 via 协调近似消息传递

Sagnik Nandy, Zongming Ma

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title)

AI总结 本文提出了一种协调近似消息传递算法,用于多模态数据整合与跨模态查询,通过统计最优信号恢复和渐近有效的预测集构建,提升单细胞数据的分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14274 2026-01-22 cs.LG cs.AI 83%

Divide and Refine: Enhancing Multimodal Representation and Explainability for Emotion Recognition in Conversation

分割与精炼:提升对话中情感识别的多模态表示与可解释性

Anh-Tuan Mai, Cam-Van Thi Nguyen, Duc-Trong Le

机构 * VNU University of Engineering and Technology(越南工程大学) FPT Software AI Center(FPT软件人工智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出DnR框架,通过分割和精炼多模态表示提升对话中情感识别的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14448 2026-01-22 cs.CV 79%

Gaussian Based Adaptive Multi-Modal 3D Semantic Occupancy Prediction

基于高斯的自适应多模态3D语义占位预测

A. Enes Doruk

机构 * Abdullah Enes Doruk (2025)(Abdullah Enes Doruk)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于高斯的自适应多模态3D语义占位预测模型,通过高效3D高斯模型融合相机与激光雷达数据,提升自动驾驶安全性能。

Comments Master Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14942 2026-01-22 cs.LG eess.SP 78%

Communication-Efficient Multi-Modal Edge Inference via Uncertainty-Aware Distributed Learning

通过不确定性感知的分布式学习实现高效的多模态边缘推断

Hang Zhao, Hongru Li, Dongfang Xu, Shenghui Song, Khaled B. Letaief

机构 * Dept. of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种三阶段通信感知分布式学习框架,通过减少通信开销和提升稳健性,实现高效的多模态边缘推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14697 2026-01-22 cs.IR cs.AI 70%

When Text-as-Vision Meets Semantic IDs in Generative Recommendation: An Empirical Study

当文本作为视觉信号与语义ID在生成推荐中相遇:一项实证研究

Shutong Qiao, Wei Yuan, Tong Chen, Xiangyu Zhao, Quoc Viet Hung Nguyen, Hongzhi Yin

机构 * The University of Queensland(昆士兰大学) City University of Hong Kong(香港城市大学) Griffith University(格里菲斯大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出将文本视为视觉信号,通过OCR技术提升生成推荐中语义ID学习的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14797 2026-01-22 cs.CV 57%

UniRoute: Unified Routing Mixture-of-Experts for Modality-Adaptive Remote Sensing Change Detection

UniRoute: 一种统一的路由混合专家模型用于模态自适应的遥感变化检测

Qingling Shu, Sibao Chen, Wei Lu, Zhihui You, Chengzhuang Liu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 UniRoute通过统一的路由混合专家框架,实现模态自适应的遥感变化检测,提升异质数据下的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13664 2026-01-22 cs.CV 57%

VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement

VIAFormer:用于高保真体素细化的体素-图像对齐变换器

Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lyu, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 VIAFormer通过体素-图像对齐变换器实现高保真体素细化,结合图像索引、校正流目标和混合流变换器,提升多视角条件下体素修复的精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏