arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-15 至 2026-01-15 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2601.09524 2026-01-15 cs.CV cs.HC 57%

Video Joint-Embedding Predictive Architectures for Facial Expression Recognition

视频联合嵌入预测架构用于面部表情识别

Lennart Eing, Cristina Luna-Jiménez, Silvan Mertes, Elisabeth André

机构 * Chair for Human-Centered Artificial Intelligence(人中心人工智能教研室) University of Augsburg(奥斯特拉赫大学) Faculty of Computer Science(计算机科学学院) Technical University of Applied Sciences Augsburg(应用科学大学奥斯特拉赫)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出了一种基于嵌入的预训练方法,用于提升面部表情识别的性能,在RAVDESS和CREMA-D数据集上取得了显著成果。

Comments To appear in 2025 Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction (ACII), submitted to IEEE. \c{opyright} 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08871 2026-01-15 cs.SD cs.AI eess.AS 50%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 视频理解 :video understanding(abstract)

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏