arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 42 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2506.16295 2026-01-26 stat.CO 50%

Understanding uncertainty in Bayesian cluster analysis

理解贝叶斯聚类分析中的不确定性

Cecilia Balocchi, Sara Wade

专题命中 多模态评测 :multimodal(abstract)

AI总结 WASABI通过多聚类估计近似后验分布,提升贝叶斯聚类分析中对不确定性的理解,尤其在聚类不明显或模型不恰当时表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2601.16378 2026-01-26 cs.CV cs.AI q-bio.NC 81%

Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models

具有认知启发的标记克服了多模态模型中的自我中心偏差

Bridget Leonard, Scott O. Murray

机构 * Department of Psychology University of Washington(心理学系华盛顿大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13976 2026-01-26 cs.CV cs.RO 79%

FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation

FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航

Jing Zuo, Lingzhou Mu, Fan Jiang, Chengcheng Ma, Mu Xu, Yonggang Qi

机构 * Fantasy AIGC Team(幻想AIGC团队) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 57%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 7 篇

2601.16381 2026-01-26 cs.CV 83%

VTFusion: A Vision-Text Multimodal Fusion Network for Few-Shot Anomaly Detection

VTFusion: 一种面向少样本异常检测的视觉-文本多模态融合网络

Yuxin Jiang, Yunkang Cao, Yuqi Cheng, Yiheng Zhang, Weiming Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VTFusion通过自适应特征提取和多模态融合模块,提升少样本异常检测性能,实现96.8%的AUROC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05855 2026-01-26 cs.CV 79%

Decoupling Multi-Contrast Super-Resolution: Self-Supervised Implicit Re-Representation for Unpaired Cross-Modal Synthesis

解耦多对比超分辨率:自监督隐式重表示用于无配对跨模态合成

Yinzhe Wu, Hongyu Rui, Fanwen Wang, Jiahao Huang, Zhenxuan Zhang, Haosen Zhang, Zi Wang, Guang Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出了解耦多对比超分辨率框架,通过自监督隐式重表示实现无配对跨模态合成,提升极端尺度下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16788 2026-01-26 cs.CV cs.AI 62%

REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion

REL-SF4PASS:基于REL深度表示和球形融合的全景语义分割

Xuewei Li, Xinghan Bao, Zhimin Chen, Xi Li

机构 * School of Electronic and Information Engineering, Shanghai DianJi University(电子信息学院,上海电机大学) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 REL-SF4PASS通过REL深度表示和球形动态多模态融合方法,提升全景语义分割的性能和鲁棒性。

Comments submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02368 2026-01-26 cs.CV cs.AI 62%

MoE-Enhanced Multi-Domain Feature Selection and Fusion for Fast Map-Free Trajectory Prediction

增强型多域特征选择与融合的无地图轨迹预测

Wenyi Xiong, Jian Chen, Ziheng Qi, Wenhua Chen

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Guangdong Provincial Key Laboratory of Fully Actuated System Control Theory and Technology, School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Leapmotor Technology(Leapmotor科技) Department of Aeronautical and Automotive Engineering, Loughborough University(伦敦大学洛桑学院航空与汽车工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无地图轨迹预测方法,通过多域特征选择与融合,提升轨迹预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 57%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11931 2026-01-26 cs.CV 57%

Language-Guided and Motion-Aware Gait Representation for Generalizable Recognition

基于语言引导和运动感知的通用识别姿态表示

Zhengxian Wu, Chuanrui Zhang, Shenao Jiang, Hangrui Xu, Zirui Liao, Luyuan Zhang, Huaqiu Li, Peng Jiao, Haoqian Wang

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 LMGait通过引入自然语言描述作为语义先验,结合运动感知模块和时间捕获模块,提升了姿态识别的通用性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00778 2026-01-26 stat.ML cs.AI cs.LG stat.CO stat.ME 57%

Bayesian Joint Additive Factor Models for Multiview Learning

贝叶斯联合加性因子模型用于多视图学习

Niccolo Anceschi, Federico Ferrari, David B. Dunson, Himel Mallick

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出贝叶斯联合加性因子模型用于多视图学习,通过分解共享和视图特定成分提升多模态数据预测性能。

Comments To be published in Biometrics

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2601.16234 2026-01-26 cs.CR 50%

Algorithmic Identity Based on Metaparameters: A Path to Reliability, Auditability, and Traceability

基于元参数的算法身份:可靠性、可审计性与可追溯性的一条路径

Juliao Braga, Percival Henriques, Juliana C. Braga, Itana Stiubiener

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出通过DOI标识算法以提升AI应用的可靠性、可审计性和可追溯性,探讨了其在多模态LLMs中的应用及加密认证协议。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏