arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-12 至 2025-12-12 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2507.00752 2025-12-12 cs.CV cs.RO 79%

Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation

多模态图卷积网络与正弦编码用于鲁棒的人体动作分割

Hao Xing, Kai Zhe Boey, Yuankai Wu, Darius Burschka, Gordon Cheng

机构 * Institute for Cognitive Systems(认知系统研究所) Chair of Media Technology(媒体技术教授职位) Machine Vision and Perception Group(机器视觉与感知小组) School of Computation, Information and Technology(计算、信息与技术学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态图卷积网络与正弦编码方法,通过融合低帧率和高帧率数据提升人体动作分割的鲁棒性,实验表明在双手动作数据集上显著提高分割准确率。

Comments 8 pages, 5 figures, accepted in IROS25, Hangzhou, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08051 2025-12-12 cs.LG 67%

ST-GraphNet: A Spatio-Temporal Graph Neural Network for Understanding and Predicting Automated Vehicle Crash Severity

ST-GraphNet:一种用于理解和预测自动驾驶车辆碰撞严重程度的时空图神经网络

Mahmuda Sultana Mimi, Md Monzurul Islam, Anannya Ghosh Tusti, Shriyank Somvanshi, Subasish Das

机构 * Texas State University(德克萨斯州立大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 ST-GraphNet通过时空图神经网络整合多模态数据,以高准确率预测自动驾驶车辆碰撞严重程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05537 2025-12-12 cs.CV cs.AI 62%

Towards Efficient Real-Time Video Motion Transfer via Generative Time Series Modeling

通过生成时间序列建模实现高效的实时视频运动迁移

Tasmiah Haque, Md. Asif Bin Syed, Byungheon Jeong, Xue Bai, Sumit Mohan, Somdyuti Paul, Imtiaz Ahmed, Srinjoy Das

机构 * Coupa Software(Coupa软件) Intel Corporation(英特尔公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于生成时间序列模型的实时视频运动迁移框架,通过关键点预测和光流模块实现高效低帧率视频传输,提升带宽效率与视频生成的可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏