arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-05 至 2026-01-05 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2512.22905 2026-01-05 cs.CV 83%

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22979 2026-01-05 cs.CV 79%

PoseStreamer: A Multi-modal Framework for 3D Tracking of Unseen Moving Objects

PoseStreamer: 一种多模态框架用于未见移动物体的3D跟踪

Huiming Yang, Linglin Liao, Fei Ding, Sibo Wang, Zijian Zeng

机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 PoseStreamer是一种多模态框架,通过结合自适应姿态内存队列、以对象为中心的2D跟踪器和射线姿态滤波器,实现高速移动物体的高精度3D跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00369 2026-01-05 cs.CV 70%

BHaRNet: Reliability-Aware Body-Hand Modality Expertized Networks for Fine-grained Skeleton Action Recognition

BHaRNet: 以可靠性为关注点的多模态专家化网络用于细粒度骨骼动作识别

Seungyeon Cho, Tae-kyun Kim

机构 * School of Computing, KAIST(韩国釜山国立大学计算机学院)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 BHaRNet通过可靠性建模和多模态整合,提升细粒度骨骼动作识别的鲁棒性和准确性。

Comments 16 pages; 8 figures. Extension of previous conference paper. Project page: https://github.com/VinnyCSY/BHaRNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00504 2026-01-05 cs.CV cs.AI cs.GR 62%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14960 2026-01-05 cs.CV 57%

Body-Hand Modality Expertized Networks with Cross-attention for Fine-grained Skeleton Action Recognition

具有交叉注意力的体-手模态专家化网络用于细粒度骨骼动作识别

Seungyeon Cho, Tae-Kyun Kim

机构 * School of Computing, KAIST(韩国成均馆大学计算机学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出BHaRNet,通过体-手专家化网络和交叉注意力机制,提升细粒度骨骼动作识别的准确率,同时降低计算成本。

Comments 7 figures, 8 pages. Accepted to IROS 2025, project page: https://github.com/VinnyCSY/BHaRNet

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 11614-11621

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00607 2026-01-05 cs.LG 50%

Traffic-Aware Optimal Taxi Placement Using Graph Neural Network-Based Reinforcement Learning

基于图神经网络强化学习的交通感知出租车最优布置

Sonia Khetarpaul, P Y Sharan

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出基于图神经网络强化学习的交通感知出租车最优布置方法,通过实时整合交通数据优化出租车热点,有效减少乘客等待时间和司机行驶距离。

详情

展开后加载摘要…

URL PDF HTML 收藏