arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-16 至 2025-12-16 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2511.22447 2025-12-16 cs.MM 83%

Angle-Optimized Partial Disentanglement for Multimodal Emotion Recognition in Conversation

对话中多模态情感识别的视角优化部分解耦

Xinyi Che, Wenbo Wang, Yuanbo Hou, Mingjie Xie, Qijun Zhao, Jian Guan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AO-FL框架,通过自适应角度优化实现对话中多模态情感识别的共享与特定特征部分解耦,提升情感识别性能。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12875 2025-12-16 cs.CV cs.MM cs.SD 81%

Schrodinger Audio-Visual Editor: Object-Level Audiovisual Removal

Schrodinger Audio-Visual Editor: 对象级音频视觉去除

Weihan Xu, Kan Jen Cheng, Koichi Saito, Muhammad Jehanzeb Mirza, Tingle Li, Yisi Liu, Alexander H. Liu, Liming Wang, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji, Gopala Anumanchipalli, Paul Pu Liang

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Berkeley AI Research(伯克利人工智能研究) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Schrodinger Audio-Visual Editor,通过联合编辑音频和视频实现对象级去除,提升时间同步性和语义对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13495 2025-12-16 cs.CV 79%

Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation

Soul:为高保真长期多模态动画注入生命

Jiangning Zhang, Junwei Zhu, Zhenye Gan, Donghao Luo, Chuming Lin, Feifan Xu, Xu Peng, Jianlong Hu, Yuansen Liu, Yijia Hong, Weijian Cao, Han Feng, Xu Chen, Chencan Fu, Keke He, Xiaobin Hu, Chengjie Wang

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Soul通过多模态驱动框架实现高保真长期数字人类动画,结合自动化标注和优化推理效率,显著提升视频质量和唇同步精度。

Comments Project page: https://zhangzjn.github.io/projects/Soul/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13131 2025-12-16 cs.AI cs.CV cs.GR cs.MM cs.SD 67%

Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning

基于层次隐周期学习的统一语音同步手势生成

Xin Guo, Yifan Zhao, Jia Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于层次隐周期学习的统一语音同步手势生成方法,通过周期自动编码器和级联指导技术提升手势生成的自然性和协调性。

Comments IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20336 2025-12-16 cs.CV cs.SD eess.AS 62%

RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text

RapVerse: 从文本歌词生成连贯的唱声与全身动作

Jiaben Chen, Xin Yan, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Wuhan University(武汉大学) UC San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 RapVerse通过统一生成框架,从文本歌词生成连贯唱声与全身动作,实现多模态统一建模,提升生成效果与基准性能。

Comments ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏