arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-29 至 2025-07-29 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2507.20740 2025-07-29 cs.CV 83%

Implicit Counterfactual Learning for Audio-Visual Segmentation

Mingfeng Zha, Tianyu Li, Guoqing Wang, Peng Wang, Yangyang Wu, Yang Yang, Heng Tao Shen

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19956 2025-07-29 cs.CV cs.AI q-bio.NC 81%

Predicting Brain Responses To Natural Movies With Multimodal LLMs

Cesar Kadir Torrico Villanueva, Jiaxin Cindy Tu, Mihir Tripathy, Connor Lane, Rishab Iyer, Paul S. Scotti

机构 * Medical AI Research Center (MedARC)(医学人工智能研究中心(MedARC)) Psychological and Brain Sciences, Dartmouth College(心理学与脑科学系,达特茅斯学院) Core for Advanced Magnetic Resonance Imaging (CAMRI), Baylor College of Medicine(先进磁共振成像核心(CAMRI),贝勒医学院) Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Code available at https://github.com/MedARC-AI/algonauts2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 81%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20579 2025-07-29 cs.CV 79%

AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations

Zhixi Cai, Kartik Kuckreja, Shreya Ghosh, Akanksha Chuchra, Muhammad Haris Khan, Usman Tariq, Tom Gedeon, Abhinav Dhall

机构 * Monash University(墨尔本大学) Curtin University(Curtin大学) American University of Sharjah(沙迦美国大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04258 2025-07-29 cs.SD cs.AI cs.CV eess.AS 67%

TAIL: Text-Audio Incremental Learning

Yingfei Sun, Xu Gu, Wei Ji, Hanbin Zhao, Yifang Yin, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏