arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

2505.24309 2025-06-02 cs.SE cs.DC 50%

Supporting Long-term Transactions in Smart Contracts Generated from Business Process Model and Notation (BPMN) Models

Christian Gang Liu

专题命中 视频多模态 :multi-modal(abstract)

Comments Ph.D. Dissertation Ph.D. Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04445 2025-05-08 cs.IR 50%

M2Rec: Multi-scale Mamba for Efficient Sequential Recommendation

Qianru Zhang, Liang Qu, Honggang Wen, Dong Huang, Siu-Ming Yiu, Nguyen Quoc Viet Hung, Hongzhi Yin

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04237 2025-05-06 cs.IR 50%

Short Video Segment-level User Dynamic Interests Modeling in Personalized Recommendation

Zhiyu He, Zhixin Ling, Jiayu Li, Zhiqiang Guo, Weizhi Ma, Xinchen Luo, Min Zhang, Guorui Zhou

专题命中 视频多模态 :multi-modal(abstract)

Comments This paper has been accepted by SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15512 2025-04-29 cs.CR cs.LG 50%

T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models

Siyuan Liang, Jiayang Liu, Jiecheng Zhai, Tianmeng Fang, Rongcheng Tu, Aishan Liu, Xiaochun Cao, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学) National University of Singapore(国立新加坡大学) Beihang University(北航) Sun Yat-sen University(中山大学)

专题命中 视频多模态 :multimodal(abstract)

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18189 2025-04-28 cs.HC 50%

ClassComet: Exploring and Designing AI-generated Danmaku in Educational Videos to Enhance Online Learning

Zipeng Ji, Pengcheng An, Jian Zhao

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15561 2025-04-23 cs.RO cs.LG 50%

SPECI: Skill Prompts based Hierarchical Continual Imitation Learning for Robot Manipulation

Jingkai Xu, Xiangli Nie

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15517 2025-04-23 cs.RO cs.LG 50%

Few-Shot Vision-Language Action-Incremental Policy Learning

Mingchen Song, Xiang Deng, Guoqiang Zhong, Qi Lv, Jia Wan, Yinchuan Li, Jianye Hao, Weili Guan

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳)) Department of Computer Science and Technology, Ocean University of China(计算机科学与技术系,中国海洋大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05103 2025-04-08 cs.RO 50%

TDFANet: Encoding Sequential 4D Radar Point Clouds Using Trajectory-Guided Deformable Feature Aggregation for Place Recognition

Shouyi Lu, Guirong Zhuo, Haitao Wang, Quan Zhou, Huanyu Zhou, Renbo Huang, Minqing Huang, Lianqing Zheng, Qiang Shu

专题命中 视频多模态 :multi-modal(abstract)

Comments 8 pages, 4 figures. Accepted to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15155 2025-04-08 stat.CO math.PR 50%

Sampling with time-changed Markov processes

Andrea Bertazzi, Giorgos Vasdekis

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20020 2025-03-27 cs.RO 50%

Gemini Robotics: Bringing AI into the Physical World

Gemini Robotics Team, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Travis Armstrong, Ashwin Balakrishna, Robert Baruch, Maria Bauza, Michiel Blokzijl, Steven Bohez, Konstantinos Bousmalis, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Oscar Chang, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, David D'Ambrosio, Sudeep Dasari, Todor Davchev, Coline Devin, Norman Di Palo, Tianli Ding, Adil Dostmohamed, Danny Driess, Yilun Du, Debidatta Dwibedi, Michael Elabd, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Leonard Hasenclever, Nicolas Heess, Brandon Hernaez, Alexander Herzog, R. Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Chase Kew, Jerad Kirkland, Sean Kirmani, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Jacky Liang, Yixin Lin, Sharath Maddineni, Anirudha Majumdar, Assaf Hurwitz Michaely, Robert Moreno, Michael Neunert, Francesco Nori, Carolina Parada, Emilio Parisotto, Peter Pastor, Acorn Pooley, Kanishka Rao, Krista Reymann, Dorsa Sadigh, Stefano Saliceti, Pannag Sanketi, Pierre Sermanet, Dhruv Shah, Mohit Sharma, Kathryn Shea, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Jost Tobias Springenberg, Rachel Sterneck, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Vincent Vanhoucke, Jake Varley, Grace Vesom, Giulia Vezzani, Oriol Vinyals, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Yuxiang Yang, Rui Yao, Sergey Yaroshenko, Wenhao Yu, Wentao Yuan, Jingwei Zhang, Tingnan Zhang, Allan Zhou, Yuxiang Zhou

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18307 2025-03-25 cs.RO cs.SY eess.SY 50%

NMPC-based Unified Posture Manipulation and Thrust Vectoring for Fault Recovery

Adarsh Salagame, Shashwat Pandya, Ioannis Mandralis, Eric Sihite, Alireza Ramezani, Morteza Gharib

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18190 2025-03-25 stat.ML cs.LG cs.NA math.NA 50%

Quantile-Based Randomized Kaczmarz for Corrupted Tensor Linear Systems

Alejandra Castillo, Jamie Haddock, Iryna Hartsock, Paulina Hoyos, Lara Kassab, Alona Kryshchenko, Kamila Larripa, Deanna Needell, Shambhavi Suryanarayanan, Karamatou Yacoubou Djima

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18707 2025-03-24 cs.RO 50%

Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation

Kun Wu, Yichen Zhu, Jinming Li, Junjie Wen, Ning Liu, Zhiyuan Xu, Jian Tang

专题命中 视频多模态 :multimodal(abstract)

Comments Accept to ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03258 2025-03-20 cs.LG 50%

Learning on One Mode: Addressing Multi-modality in Offline Reinforcement Learning

Mianchu Wang, Yue Jin, Giovanni Montana

专题命中 视频多模态 :multi-modal(abstract)

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08814 2025-03-13 cs.HC 50%

An Iterative, User-Centered Design of a Clinical Decision Support System for Critical Care Assessments: Co-Design Sessions with ICU Clinical Providers

Andrea E. Davidson, Jessica M. Ray, Ayush K. Patel, Yulia Strekalova Levites, Parisa Rashidi, Azra Bihorac

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07537 2025-02-27 stat.ML cs.LG stat.AP 50%

Estimating optical vegetation indices and biophysical variables for temperate forests with Sentinel-1 SAR data using machine learning techniques: A case study for Czechia

Daniel Paluba, Bertrand Le Saux, Přemysl Stych

专题命中 视频多模态 :multi-modal(abstract)

Comments Revised version of the preprint, based on comments from the reviewers. Full research article. 23 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12807 2025-02-19 cs.LG 50%

An improved wind power prediction via a novel wind ramp identification algorithm

Yifan Xu

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12526 2025-02-19 cs.HC 50%

AnimAlte:Designing AI-Infused Cartoon Videos to Improve Preschoolers' Language Learning with Family Engagement at Home

Shiya Tsang, Ruiyao Miao, Junren Xiao, Hui Xiong

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11747 2025-02-19 cs.IR 50%

Open-Ended and Knowledge-Intensive Video Question Answering

Md Zarif Ul Alam, Hamed Zamani

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04008 2025-02-19 cs.HC 50%

Human I/O: Towards a Unified Approach to Detecting Situational Impairments

Xingyu Bruce Liu, Jiahao Nick Li, David Kim, Xiang 'Anthony' Chen, Ruofei Du

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16936 2025-02-18 stat.ML cs.LG math.ST stat.CO stat.TH 50%

Provable Benefit of Annealed Langevin Monte Carlo for Non-log-concave Sampling

Wei Guo, Molei Tao, Yongxin Chen

专题命中 视频多模态 :multimodal(abstract)

Comments ICLR 2025 camera ready https://openreview.net/forum?id=P6IVIoGRRg

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07730 2025-02-12 cs.RO 50%

DOGlove: Dexterous Manipulation with a Low-Cost Open-Source Haptic Force Feedback Glove

Han Zhang, Songbo Hu, Zhecheng Yuan, Huazhe Xu

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06847 2025-02-12 cs.LG cs.CE 50%

A Deep Learning Framework Integrating CNN and BiLSTM for Financial Systemic Risk Analysis and Prediction

Yu Cheng, Zhen Xu, Yuan Chen, Yuhan Wang, Zhenghao Lin, Jinsong Liu

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04970 2025-02-10 stat.ML cs.LG 50%

Gradient-based Explanations for Deep Learning Survival Models

Sophie Hanna Langbein, Niklas Koenen, Marvin N. Wright

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08368 2025-02-04 cs.LG 50%

ElasticTok: Adaptive Tokenization for Image and Video

Wilson Yan, Volodymyr Mnih, Aleksandra Faust, Matei Zaharia, Pieter Abbeel, Hao Liu

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17892 2025-01-31 physics.ins-det nucl-ex physics.data-an 50%

Object Detection with Deep Learning for Rare Event Search in the GADGET II TPC

Tyler Wheeler, S. Ravishankar, C. Wrede, A. Andalib, A. Anthony, Y. Ayyad, B. Jain, A. Jaros, R. Mahajan, L. Schaedig, A. Adams, S. Ahn, J. M. Allmond, D. Bardayan, D. Bazin, K. Bosmpotinis, T. Budner, S. R. Carmichael, S. M. Cha, A. Chen, K. A. Chipps, J. M. Christie, I. Cox, J. Dopfer, M. Friedman, J. Garcia-Duarte, E. Good, T. J. Gray, A. Green, R. Grzywacz, K. Hahn, R. Jain, E. Jensen, T. King, S. Liddick, B. Longfellow, R. Lubna, C. Marshall, Y. Mishnayot, A. J. Mitchell, F. Montes, T. H. Ogunbeku, J. Owens-Fryar, S. D. Pain, J. Pereira, E. Pollacco, A. M. Rogers, M. Z. Serikow, K. Setoodehnia, L. J. Sun, J. Surbrook, A. Tsantiri, L. E. Weghorn

专题命中 视频多模态 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17401 2025-01-30 stat.ME stat.AP stat.CO 50%

Gradient-free Importance Sampling Scheme for Efficient Reliability Estimation

Elsayed Eshra, Konstantinos G. Papakonstantinou

专题命中 视频多模态 :multi-modal(abstract)

Comments arXiv admin note: text overlap with arXiv:2405.14149

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11911 2025-01-22 cs.IR 50%

Integrate Temporal Graph Learning into LLM-based Temporal Knowledge Graph Model

He Chang, Jie Wu, Zhulin Tao, Yunshan Ma, Xianglin Huang, Tat-Seng Chua

专题命中 视频多模态 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10871 2025-01-22 cs.IR 50%

Enhancing User Intent for Recommendation Systems via Large Language Models

Xiaochuan Xu, Zeqiu Xu, Peiyang Yu, Jiani Wang

专题命中 视频多模态 :cross-modal(abstract)

Comments CAIMLR 2024 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10383 2025-01-22 cs.CY cs.HC 50%

The Generative AI Ethics Playbook

Jessie J. Smith, Wesley Hanwen Deng, William H. Smith, Maarten Sap, Nicole DeCario, Jesse Dodge

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏