arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-26 至 2026-01-26 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2601.16652 2026-01-26 cs.CV cs.NE 57%

Reliable Brain Tumor Segmentation Based on Spiking Neural Networks with Efficient Training

基于高效训练的脉冲神经网络的可靠脑肿瘤分割

Aurora Pia Ghiardelli, Guangzhi Tang, Tao Sun

机构 * Department of Advanced Computing Sciences, Maastricht University, Maastricht, The Netherlands(先进计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于高效训练的脉冲神经网络框架,用于可靠且节能的3D脑肿瘤分割,实验显示在准确性、不确定性校准和计算成本降低方面均表现优异。

Comments Accepted at ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16079 2026-01-26 cs.CV 57%

Masked Modeling for Human Motion Recovery Under Occlusions

遮蔽建模用于遮挡下的人体运动恢复

Zhiyin Qian, Siwei Zhang, Bharat Lal Bhatnagar, Federica Bogo, Siyu Tang

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(Meta现实实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MoRo通过遮蔽建模方法,在遮挡条件下实现高效且鲁棒的人体运动恢复,结合多模态先验提升推理性能。

Comments Project page: https://mikeqzy.github.io/MoRo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08957 2026-01-26 cs.LG cs.AI 57%

LUMOS: Large User MOdels for User Behavior Prediction

LUMOS:大规模用户模型用于用户行为预测

Dhruv Nigam, Naman Agarwal, Krishna Murthy, Susmit Saha

机构 * Dream11 Dream Sports

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 LUMOS通过基于Transformer的架构,利用原始用户活动数据联合学习多个任务,实现用户行为预测的高效与准确,提升业务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏