arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2512.17154 2025-12-22 cs.SD 50%

InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing

InstructDubber:基于指令的零样本电影配音对齐

Zhedong Zhang, Liang Li, Gaoxiang Cong, Chunshan Liu, Yuhan Gao, Xiaowan Wang, Tao Gu, Yuankai Qi

机构 * VIPL group, ICT, CAS(中国科学院信息科技研究所VIPL小组)

专题命中 视频多模态 :multimodal(abstract)

AI总结 InstructDubber通过指令生成和持续时间蒸馏模块,实现鲁棒的领域内和零样本电影配音对齐。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08107 2025-12-22 cs.CR cs.HC 50%

Detecting Ambiguity Aversion in Cyberattack Behavior to Inform Cognitive Defense Strategies

检测网络攻击行为中的模糊厌恶以指导认知防御策略

Stephan Carney, Soham Hans, Sofia Hirschmann, Stacey Marsella, Yvonne Fonken, Peggy Wu, Nikolos Gurney

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究通过分析网络攻击行为中的模糊厌恶,提出了一种基于多模态数据和大语言模型的框架,用于实时推断攻击者倾向,以指导认知防御策略的开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15681 2025-12-18 eess.IV 50%

Radiomics and Clinical Features in Predictive Modelling of Brain Metastases Recurrence

放射组学与临床特征在脑转移瘤复发预测模型中的应用

Ines Faria, Matheus Silva, Crystian Saraiva, Jose Soares, Victor Alves

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究利用放射组学和临床数据构建模型,预测脑转移瘤复发并探讨辐射剂量差异与复发风险的关系。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13073 2025-12-16 math.ST stat.TH 50%

Spectral Equivariance and Geometric Transport in Reproducing Kernel Hilbert Spaces: A Unified Framework for Orthogonal Polynomial and Kernel Estimation

谱等变性与几何传输在再生核希尔伯特空间中的统一框架:一种用于正交多项式和核估计的统一方法

Jocelyn Nembé

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于双核空间的统一几何框架,通过谱等变性定理揭示了正交多项式估计器、核估计器和谱平滑方法之间的联系,为非参数估计提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13067 2025-12-16 math.PR cs.IT math.GR math.IT stat.CO 50%

Group-averaged Markov chains II: tuning of group action in finite state space

群平均马尔可夫链II:在有限状态空间中调节群作用

Michael C. H. Choi, Ryan J. Y. Lim, Youjia Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了群平均马尔可夫链,分析了轨道核及其混合方法,并提出调节群作用的启发式方法,展示了GPG在信息投影中的应用及在不同模型中的混合性能。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12318 2025-12-16 hep-ph hep-ex 50%

Interference Effects in Resonant Standard Model di-Higgs Production and Decay into $4b$ Final States: the Role of Machine Learning Analysis

共振标准模型双Higgs生产与衰变成4b最终态中的干涉效应:机器学习分析的作用

A. Hammad, S. Moretti, A. P. Przybyl, H. Waltari

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究利用多模式Transformer机器学习分析,探讨共振标准模型双Higgs衰变成4b最终态中的干涉效应,发现其能提升显著性并适应复杂数据集,但忽视干涉可能导致错误结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11245 2025-12-15 cs.HC 50%

Breast-Rehab: A Postoperative Breast Cancer Rehabilitation Training Assessment System Based on Human Action Recognition

Breast-Rehab: 一种基于人体动作识别的术后乳腺癌康复训练评估系统

Zikang Chen, Tan Xie, Qinchuan Wang, Heming Zheng, Xudong Lu

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Breast-Rehab通过结合人体动作识别与RAG框架,提供低成本的居家乳腺癌术后上肢康复训练评估系统,提升患者康复依从性。

Comments has been accepted by CHIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09608 2025-12-11 cs.RO 50%

Super4DR: 4D Radar-centric Self-supervised Odometry and Gaussian-based Map Optimization

Super4DR: 基于4D雷达的自监督里程计与高斯基于地图优化

Zhiheng Li, Weihua Wang, Qiang Shen, Yichen Zhao, Zheng Fang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 Super4DR通过基于4D雷达的自监督里程计和高斯地图优化,在恶劣天气中实现更准确的定位与地图重建。

Comments 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09589 2025-12-11 eess.SP 50%

Temporal Windows of Integration for Multisensory Wireless Systems as Enablers of Physical AI

多感官无线系统的时间窗口集成:物理人工智能的赋能者

Anup Mishra, João Henrique Inacio de Souza, Petar Popovski

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于时间窗口集成和因果性的方法,用于优化物理人工智能在有限空间范围内的决策时间一致性,通过凸优化问题实现全局最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18473 2025-12-08 math.OC 50%

PDPO: Parametric Density Path Optimization

PDPO:参数密度路径优化

Sebastian Gutierrez Hernandez, Peng Chen, Haomin Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 PDPO通过参数映射将无限维密度优化转化为有限维问题,有效解决多模态和高维路径优化问题,优于现有方法。

Comments 28 pages, 16 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO 50%

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

专题命中 视频多模态 :multimodal(abstract)

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02260 2025-12-03 q-bio.QM stat.ML 50%

EcoCast: A Spatio-Temporal Model for Continual Biodiversity and Climate Risk Forecasting

EcoCast:一种用于持续生物多样性和气候风险预测的空间时间模型

Hammed A. Akande, Abdulrauf A. Gidado

专题命中 视频多模态 :multi-modal(abstract)

AI总结 EcoCast通过多源数据和序列Transformer模型,实现持续的生物多样性和气候风险预测,提升非洲生态保护策略的科学依据。

Comments 9 pages, 3 figures, 1 table. Accepted to the NeurIPS 2025 Workshop on Tackling Climate Change with Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21500 2025-11-27 cs.LG 50%

Lost in Time? A Meta-Learning Framework for Time-Shift-Tolerant Physiological Signal Transformation

时光流逝?一种用于时间偏移容忍生理信号转换的元学习框架

Qian Hong, Cheng Bian, Xiao Zhou, Xiaoyu Li, Yelei Li, Zijing Zeng

专题命中 视频多模态 :multimodal(abstract)

AI总结 ShiftSyncNet通过元学习框架自动缓解时间偏移对生理信号转换的影响,提升转换精度和标签质量。

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04749 2025-11-27 astro-ph.HE 50%

Bayesian Black Hole Photogrammetry

贝叶斯黑洞摄影测量

Dominic O. Chang, Michael D. Johnson, Paul Tiede, Daniel C. M. Palumbo

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出了一种双锥吸积模型,用于分析EHT观测的黑洞图像,并通过贝叶斯推断确定质量-距离比和倾角的范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13789 2025-11-26 cs.LG cs.SI math.AT 50%

T3former: Temporal Graph Classification with Topological Machine Learning

T3former: 基于拓扑机器学习的时序图分类

Md. Joshem Uddin, Soham Changani, Baris Coskunuzer

专题命中 视频多模态 :cross-modal(abstract)

AI总结 T3former通过结合拓扑和谱信息,提出了一种新颖的时序图分类方法,实现了跨模态融合和理论稳定性保证。

Comments 14 pages, 8 figures

Journal ref AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01248 2025-11-25 cs.HC 50%

FocusView: Understanding and Customizing Informational Video Watching Experiences for Viewers with ADHD

FocusView:为ADHD观众理解并定制信息视频观看体验

Hanxiu 'Hazel' Zhu, Ruijia Chen, Yuhang Zhao

专题命中 视频多模态 :multimodal(abstract)

AI总结 FocusView通过定制信息视频界面,帮助ADHD观众减少干扰,提升视频观看体验。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17926 2025-11-25 cs.SD cs.HC 50%

Three-Class Emotion Classification for Audiovisual Scenes Based on Ensemble Learning Scheme

基于集成学习方案的音频视觉场景三类情感分类

Xiangrui Xiong, Zhou Zhou, Guocai Nong, Junlin Deng, Ning Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出基于音频的集成学习框架,用于对电影场景进行三类情感分类,实验结果显示在现实数据集上达到86%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17898 2025-11-25 cs.RO 50%

L1 Sample Flow for Efficient Visuomotor Learning

L1样本流用于高效视觉-运动学习

Weixi Song, Zhetao Chen, Tao Xu, Xianchao Zeng, Xinyu Zhou, Lixin Yang, Donglin Wang, Cewu Lu, Yong-Lu Li

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 L1流通过结合去噪模型的多模分布捕捉能力与L1回归的高效性,实现高效的视觉-运动学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14661 2025-11-19 cs.HC 50%

M-CALLM: Multi-level Context Aware LLM Framework for Group Interaction Prediction

Diana Romero, Xin Gao, Daniel Khalkhali, Salma Elmalaki

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13419 2025-11-18 cs.LG physics.ao-ph 50%

MMWSTM-ADRAN+: A Novel Hybrid Deep Learning Architecture for Enhanced Climate Time Series Forecasting and Extreme Event Prediction

Shaheen Mohammed Saleh Ahmed, Hakan Hakan Guneyli

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09862 2025-11-18 cs.LG 50%

RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-Wave Point Cloud Sequence

Zengyuan Lai, Jiarui Yang, Songpengcheng Xia, Lizhou Lin, Lan Sun, Renwen Wang, Jianran Liu, Qi Wu, Ling Pei

专题命中 视频多模态 :cross-modal(abstract)

Comments Accepted by AAAI 2026 (extended version with supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25725 2025-11-17 cs.RO 50%

A Humanoid Visual-Tactile-Action Dataset for Contact-Rich Manipulation

Eunju Kwon, Seungwon Oh, In-Chang Baek, Yucheon Park, Gyungbo Kim, JaeYoung Moon, Yunho Choi, Kyung-Joong Kim

机构 * GIST(全州科学技术大学)

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08892 2025-11-13 cs.HC cs.RO 50%

Help or Hindrance: Understanding the Impact of Robot Communication in Action Teams

Tauhid Tanjim, Jonathan St. George, Kevin Ching, Angelique Taylor

机构 * Department of Information Science at Cornell University(康奈尔大学信息科学系) Weill Cornell Medicine, Cornell University(韦尔医学院,康奈尔大学)

专题命中 视频多模态 :multimodal(abstract)

Comments This is the author's original submitted version of the paper accepted to the 2025 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN). \c{opyright} 2025 IEEE. Personal use of this material is permitted. For any other use, please contact IEEE

Journal ref 2025 34th IEEE International Conference on Robot and Human Interactive Communication RO-MAN pp. 1460-1465

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05555 2025-11-11 cs.CY cs.SI 50%

Deception Decoder: Proposing a Human-Focused Framework for Identifying AI-Generated Content on Social Media

C. Bowman Kerbage

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03750 2025-11-07 stat.AP 50%

Centralized Health and Exposomic Resource (C-HER): Analytic and AI-Ready Data for External Exposomic Research

Heidi A. Hanson, Joemy Ramsay, Josh Grant, Maggie Davis, Janet O. Agbaje, Dakotah Maguire, Jeremy Logan, Marissa Taddie, Chad Melton, Midgie MacFarland, James VanDerslice

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02484 2025-11-05 eess.SY cs.SY eess.SP 50%

Using ensemble learning with hybrid graph neural networks and transformers to predict traffic in cities

Ismail Zrigui, Samira Khoulji, Mohamed Larbi Kerkeb

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27058 2025-11-03 cs.HC 50%

Adaptive Human-Computer Interaction Strategies Through Reinforcement Learning in Complex

Rui Liu, Yifan Zhuang, Runsheng Zhang

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15395 2025-11-03 eess.SP 50%

FAST: Flexible and Adaptive Semantic Transmission for Resource-constrained Multi-user Generative Semantic Communication

Yiru Wang, Wanting Yang, Fangli Mou, Zehui Xiong, Zide Fan, Shiwen Mao, Tony Q. S. Quek

专题命中 视频多模态 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26628 2025-10-31 cs.NI eess.SP 50%

Low-Altitude UAV-Carried Movable Antenna for Joint Wireless Power Transfer and Covert Communications

Chuang Zhang, Geng Sun, Jiahui Li, Jiacheng Wang, Qingqing Wu, Dusit Niyato, Shiwen Mao, Tony Q. S. Quek

专题命中 视频多模态 :multimodal(abstract)

Comments This paper has been submitted to IEEE Journal on Selected Areas in Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24055 2025-10-29 cs.RO cs.LG 50%

Language-Conditioned Representations and Mixture-of-Experts Policy for Robust Multi-Task Robotic Manipulation

Xiucheng Zhang, Yang Jiang, Hongwei Qing, Jiashuo Bai

机构 * Xiucheng Zhang(未知) Yang Jiang(未知) Jiashuo Bai(未知)

专题命中 视频多模态 :multimodal(abstract)

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏