arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-04 至 2025-12-04 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2512.03918 2025-12-04 cs.CV 57%

UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework

UniMo:基于自回归框架统一2D视频与3D人体运动

Youxin Pang, Yong Zhang, Ruizhi Shao, Xiang Deng, Feng Gao, Xu Xiaoming, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。

Comments https://carlyx.github.io/UniMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03837 2025-12-04 cs.CV 57%

Heatmap Pooling Network for Action Recognition from RGB Videos

用于RGB视频中动作识别的热图池化网络

Mengyuan Liu, Jinfu Liu, Yongkang Jiang, Bin He

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) Imaging Department, DJI Technology Co., Ltd(大疆技术创新有限公司影像部) TongJi University(同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种用于视频中动作识别的热图池化网络,通过反馈池化模块提取稳健且简洁的人体特征,并结合多模态数据提升识别性能。

Comments Final Version of IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03687 2025-12-04 cs.CV 57%

Active Visual Perception: Opportunities and Challenges

主动视觉感知:机遇与挑战

Yian Li, Xiaoyu Guo, Hao Zhang, Shuiwang Li, Xiaowei Dai

机构 * College of Computer Science and Engineering, Guilin University of Technology(桂林理工大学计算机科学与工程学院) New Engineering Industry College, Putian University(莆田大学新工程产业学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了主动视觉感知在复杂环境中的应用与挑战,分析了其在机器人、自动驾驶等领域的潜力及面临的实时处理与多模态整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03580 2025-12-04 cs.CV cs.CR 57%

Dynamic Optical Test for Bot Identification (DOT-BI): A simple check to identify bots in surveys and online processes

动态光学测试用于机器人识别(DOT-BI):一种简单的检查以在调查和在线过程中识别机器人

Malte Bleeker, Mauro Gotsch

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 DOT-BI通过利用人类对运动的感知来识别自动化系统,通过隐藏数字的动态特性区分人类与机器人,实验表明其在调查和在线过程中具有高识别率和良好的用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 57%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏