arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 10 篇

2601.12432 2026-01-21 cs.CV cs.MM 81%

SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition

SkeFi: 无线传感器跨模态知识转移用于基于骨骼的动作识别

Shunyu Huang, Yunjiao Zhou, Jianfei Yang

机构 * School of Electrical and Electronics Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 SkeFi通过跨模态知识转移方法,利用无线传感器提升基于骨骼的动作识别性能,实现毫米波和LiDAR上的先进表现。

Comments Published in IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 79%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12330 2026-01-21 cs.LG cs.AI 79%

IceWatch: Forecasting Glacial Lake Outburst Floods (GLOFs) using Multimodal Deep Learning

IceWatch: 使用多模态深度学习预测冰湖溃决洪水(GLOFs)

Zuha Fatima, Muhammad Anser Sohaib, Muhammad Talha, Ayesha Kanwal, Sidra Sultana, Nazia Perwaiz

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 IceWatch通过多模态深度学习结合空间和时间视角,实现对冰湖溃决洪水的高效预测,提升预警系统的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11990 2026-01-21 cs.CV 79%

DAOS: A Multimodal In-cabin Behavior Monitoring with Driver Action-Object Synergy Dataset

DAOS: 一种基于驾驶员行为与物体协同的多模态舱内行为监测数据集

Yiming Li, Chen Cai, Tianyi Liu, Dan Lin, Wenqian Wang, Wenfei Liang, Bingbing Li, Kim-Hui Yap

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) College of Computer Science and Technology, Harbin Engineering University(哈尔滨工程大学计算机科学与技术学院) Singapore University of Technology and Design (SUTD), Singapore(新加坡科技设计大学) Continental Automotive Singapore Pte. Ltd.

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 DAOS数据集通过多模态数据和动作-物体关系网络提升驾驶员行为识别的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13207 2026-01-21 cs.CV 70%

GTPred: Benchmarking MLLMs for Interpretable Geo-localization and Time-of-capture Prediction

GTPred:评估多模态大语言模型在可解释地理定位和拍摄时间预测中的基准测试

Jinnao Li, Zijian Chen, Tingzhu Chen, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究院) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 GTPred是一个新的地理-时间预测基准测试,通过评估多模态大语言模型在可解释地理定位和拍摄时间预测中的表现,揭示了当前模型在世界知识和时空推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 62%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14250 2026-01-21 cs.CV 57%

OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer

OmniTransfer: 一种用于时空视频转换的综合框架

Pengze Zhang, Yanze Wu, Mengtian Li, Xu Bai, Songtao Zhao, Fulong Ye, Chong Mou, Xinghui Li, Zhuowei Chen, Qian He, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。

Comments Github Page: https://pangzecheung.github.io/OmniTransfer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19546 2026-01-21 cs.CV 57%

ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars

ActAvatar: 时空感知的精确动作控制用于对话虚拟角色

Ziqiao Peng, Yi Chen, Yifeng Ma, Guozhen Zhang, Zhiyao Sun, Zixiang Zhou, Youliang Zhang, Zhengguang Zhou, Zhaoxin Fan, Hongyan Liu, Yuan Zhou, Qinglin Lu, Jun He

机构 * Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯文yne) Tsinghua University(清华大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 ActAvatar通过文本引导实现对话虚拟角色的相位级动作控制,引入相位感知交叉注意力、渐进式音频-视觉对齐和双阶段训练策略,提升动作控制精度和视觉质量。

Comments Project Page: https://ziqiaopeng.github.io/ActAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11634 2026-01-21 cs.CV 57%

When Rules Fall Short: Agent-Driven Discovery of Emerging Content Issues in Short Video Platforms

当规则不足时:基于智能体的短视频平台新兴内容问题发现

Chenghui Yu, Hongwei Wang, Junwen Chen, Zixuan Wang, Bingfeng Deng, Zhuolin Hao, Hongyu Xiong, Yang Song

机构 * TikTok Inc.(TikTok公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于多模态大语言模型智能体的自动问题发现方法,有效提升短视频平台新兴内容问题的发现与治理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11857 2026-01-21 physics.optics physics.app-ph physics.class-ph 50%

Integrated nano electro-optomechanical spiking neuron

集成的纳米电光机械脉冲神经元

Gregorio Beltramo, Róbert Horváth, Grégoire Beaudoin, Isabelle Sagnes, Sylvain Barbay, Rémy Braive

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究展示了一种集成纳米电光机械脉冲神经元,实现高效数据处理与多模功能,适用于低延迟边缘计算和脑启发光学机械计算。

Comments 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏