arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2601.16381 2026-01-26 cs.CV 83%

VTFusion: A Vision-Text Multimodal Fusion Network for Few-Shot Anomaly Detection

VTFusion: 一种面向少样本异常检测的视觉-文本多模态融合网络

Yuxin Jiang, Yunkang Cao, Yuqi Cheng, Yiheng Zhang, Weiming Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VTFusion通过自适应特征提取和多模态融合模块,提升少样本异常检测性能,实现96.8%的AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05855 2026-01-26 cs.CV 79%

Decoupling Multi-Contrast Super-Resolution: Self-Supervised Implicit Re-Representation for Unpaired Cross-Modal Synthesis

解耦多对比超分辨率:自监督隐式重表示用于无配对跨模态合成

Yinzhe Wu, Hongyu Rui, Fanwen Wang, Jiahao Huang, Zhenxuan Zhang, Haosen Zhang, Zi Wang, Guang Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了解耦多对比超分辨率框架,通过自监督隐式重表示实现无配对跨模态合成,提升极端尺度下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16788 2026-01-26 cs.CV cs.AI 62%

REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion

REL-SF4PASS:基于REL深度表示和球形融合的全景语义分割

Xuewei Li, Xinghan Bao, Zhimin Chen, Xi Li

机构 * School of Electronic and Information Engineering, Shanghai DianJi University(电子信息学院,上海电机大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 REL-SF4PASS通过REL深度表示和球形动态多模态融合方法,提升全景语义分割的性能和鲁棒性。

Comments submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02368 2026-01-26 cs.CV cs.AI 62%

MoE-Enhanced Multi-Domain Feature Selection and Fusion for Fast Map-Free Trajectory Prediction

增强型多域特征选择与融合的无地图轨迹预测

Wenyi Xiong, Jian Chen, Ziheng Qi, Wenhua Chen

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Leapmotor Technology(Leapmotor科技) Department of Aeronautical and Automotive Engineering, Loughborough University(伦敦大学洛桑学院航空与汽车工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无地图轨迹预测方法,通过多域特征选择与融合,提升轨迹预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 57%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11931 2026-01-26 cs.CV 57%

Language-Guided and Motion-Aware Gait Representation for Generalizable Recognition

基于语言引导和运动感知的通用识别姿态表示

Zhengxian Wu, Chuanrui Zhang, Shenao Jiang, Hangrui Xu, Zirui Liao, Luyuan Zhang, Huaqiu Li, Peng Jiao, Haoqian Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 LMGait通过引入自然语言描述作为语义先验,结合运动感知模块和时间捕获模块,提升了姿态识别的通用性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00778 2026-01-26 stat.ML cs.AI cs.LG stat.CO stat.ME 57%

Bayesian Joint Additive Factor Models for Multiview Learning

贝叶斯联合加性因子模型用于多视图学习

Niccolo Anceschi, Federico Ferrari, David B. Dunson, Himel Mallick

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出贝叶斯联合加性因子模型用于多视图学习,通过分解共享和视图特定成分提升多模态数据预测性能。

Comments To be published in Biometrics

详情

展开后加载摘要…

URL PDF HTML 收藏