arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-13 至 2026-02-13 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2506.18314 2026-02-13 q-bio.QM cs.LG q-bio.NC 86%

BrainSymphony: A parameter-efficient multimodal foundation model for brain dynamics with limited data

BrainSymphony: 一种参数高效、多模态的基础模型,用于在有限数据下的脑动态

Moein Khajehnejad, Forough Habibollahi, Devon Stoliker, Adeel Razi

机构 * Turner Institute for Brain and Mental Health(大脑与心理健康Turner研究所) School of Psychological Sciences, Monash University(墨尔本大学心理学科学学院) Cortical Labs(皮层实验室) CIFAR Azrieli Global Scholars Program(CIFAR阿兹里埃利全球学者计划)

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 BrainSymphony是一种参数高效、多模态的基础模型,通过整合fMRI和扩散MRI数据,实现有限数据下的脑动态分析,优于更大模型并提升神经科学应用。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11455 2026-02-13 cs.AI 83%

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

应得之 credit:跨模态连接驱动精确强化学习用于 MLLM 推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, SJTU(EPIC实验室,上海交通大学)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 通过跨模态连接驱动精确强化学习,提升多模态大语言模型的推理能力,仅引入1.2%开销即超越基线模型。

Comments 20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22335 2026-02-13 cs.RO cs.CV 57%

UP-SLAM: Adaptively Structured Gaussian SLAM with Uncertainty Prediction in Dynamic Environments

UP-SLAM:适应性结构高斯SLAM与动态环境中的不确定性预测

Wancai Zheng, Linlin Ou, Jiajie He, Libo Zhou, Xinyi Yu, Yan Wei

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UP-SLAM通过并行框架解耦跟踪与建图,利用概率八叉树和不确定性估计器提升动态环境中的SLAM性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏