arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-03 至 2025-12-03 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2512.02651 2025-12-03 cs.HC cs.CV cs.SE 79%

Real-Time Multimodal Data Collection Using Smartwatches and Its Visualization in Education

利用智能手表进行实时多模态数据采集及其在教育中的可视化

Alvaro Becerra, Pablo Villegas, Ruth Cobos

机构 * Universidad Autónoma de Madrid(马德里自治大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用智能手表进行实时多模态数据采集及可视化,用于教育场景中的学习分析。

Comments Accepted in Technological Ecosystems for Enhancing Multiculturality (TEEM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02609 2025-12-03 cs.RO cs.CV 79%

SAM2Grasp: Resolve Multi-modal Grasping via Prompt-conditioned Temporal Action Prediction

SAM2Grasp:通过提示条件化的时序动作预测解决多模态抓取

Shengkai Wu, Jinrong Yang, Wenqiu Luo, Linfeng Gao, Chaohui Shang, Meiyu Zhi, Mingshan Sun, Fangping Yang, Liangliang Ren, Yong Zhao

机构 * CVTE(中国中车)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 SAM2Grasp通过提示条件化的时序动作预测,解决多模态抓取中的冲突问题,实现高精度抓取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02584 2025-12-03 cs.MM 70%

Stepwise Schema-Guided Prompting Framework with Parameter Efficient Instruction Tuning for Multimedia Event Extraction

分步模式引导提示框架与参数高效指令微调用于多模态事件提取

Xiang Yuan, Xinrong Chen, Haochen Li, Hang Yang, Guanyu Wang, Weiping Li, Tong Mo

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.MM

AI总结 本文提出分步模式引导提示框架与参数高效指令微调方法,用于提升多模态事件提取任务的性能。

Comments Accepted by 2025 IEEE International Conference on Multimedia and Expo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05332 2025-12-03 cs.CV cs.CL 62%

Unleashing Hour-Scale Video Training for Long Video-Language Understanding

释放小时级视频训练以实现长视频-语言理解

Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出VideoMarathon数据集和Hour-LLaVA模型,通过小时级视频训练提升长视频-语言理解能力。

Comments NeurIPS 2025, Project page: https://videomarathon.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO 50%

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

专题命中 视频多模态 :multimodal(abstract)

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02260 2025-12-03 q-bio.QM stat.ML 50%

EcoCast: A Spatio-Temporal Model for Continual Biodiversity and Climate Risk Forecasting

EcoCast:一种用于持续生物多样性和气候风险预测的空间时间模型

Hammed A. Akande, Abdulrauf A. Gidado

专题命中 视频多模态 :multi-modal(abstract)

AI总结 EcoCast通过多源数据和序列Transformer模型,实现持续的生物多样性和气候风险预测,提升非洲生态保护策略的科学依据。

Comments 9 pages, 3 figures, 1 table. Accepted to the NeurIPS 2025 Workshop on Tackling Climate Change with Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏