arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2603.22793 2026-06-09 cs.AI 版本更新 57%

Signals Are Not States: Neuro-Symbolic Safeguards for Culturally Aware Classroom AI

信号不是状态:面向文化意识课堂AI的神经符号安全机制

Sina Bagheri Nezhad

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出NSCR框架,通过神经符号方法处理课堂多模态信号,区分可观测证据与文化负载解读,减少文化偏见对课堂AI的负面影响。

Comments Accepted at the Workshop on Stereotypes Across Cultures in Language Technologies @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-06-08 eess.AS 新提交 57%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06047 2026-06-05 cs.CL 57%

Automatic Labelling of Speech Translation Errors

语音翻译错误的自动标注

Dominik Macháček, Maike Züfle, Ondrej Klejch

机构 * Charles University(查尔斯大学) University of Edinburgh(爱丁堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对语音翻译缺乏置信度评估方法的问题,提出STEL标注协议,通过文本和多模态系统分析,发现直接语音处理对任务必要且与文本系统互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04106 2026-06-04 cs.LG cs.AI 57%

Building The Ph(ysical)AI Layer Of Machine Intelligence

构建机器智能的物理AI层

Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。

Comments 102 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03874 2026-06-03 cs.CV cs.RO 57%

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction

DyaPlex: 用于二元交互的全双工语音-运动模型

Koki Nagano, Hongyu Liu, Seonwook Park, Tianye Li, Amrita Mazumdar, Christian Jacobsen, Shengze Wang, Michael Stengel, Rajarshi Roy, Ka Chun Cheung, Simon See, Shalini De Mello

机构 * NVIDIA HKUST(香港科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出DyaPlex,一种流式全双工语音-运动模型,通过双塔Transformer架构和统一二元令牌交织机制,实现同步多模态交互,在单体和二元交互基准上达到最优性能。

Comments Project page: https://research.nvidia.com/labs/amri/projects/DyaPlex

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03614 2026-06-03 cs.MM 57%

OmniHalluc-L: Counterfactual Benchmarking and Modality-Perturbation Reliability Calibration for Long-Form Omni Hallucination

OmniHalluc-L:长形式全模态幻觉的反事实基准测试与模态扰动可靠性校准

Zixuan Dong, Jiafu Tang, Zhide Lei, Zhe Cao, Zijie Zhang, Yanghai Wang, Shihao Li, Xiaodong Wang, Baoyun Peng, Jiaheng Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 针对长视频全模态助手将真实证据错误绑定到错误说话者、时刻或模态的“几乎正确”错误,提出反事实事件绑定协议构建配对支持/反事实声明,并基于此构建基准OmniHalluc-L,同时提出模态扰动可靠性校准方法(Modality-Perturbation Reliability Calibration)在不更新主干网络的情况下提升模型性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16808 2026-06-03 cs.CV 57%

BioLip: Language-Generalizable Lip-Sync Deepfake Detection via Biomechanical Constraint Violation Modeling

BioLip: 通过生物力学约束违反建模实现语言泛化的唇同步深度伪造检测

Hao Chen, Junnan Xu

机构 * Independent Researcher(独立研究者)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 针对现有检测方法在生成器或语言迁移下失效的问题,提出基于唇部运动生物力学约束的轻量级三分支网络,仅利用地标坐标检测唇同步伪造,在零样本设置下对未见生成器和多种语言表现鲁棒。

Comments 13 pages, 5 figures. Keywords: Deepfake detection, lip-sync forgery, biomechanical constraints, landmark kinematics, cross-lingual generalization, video forensics, privacy-preserving inference, compression robustness

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01704 2026-06-02 eess.AS 57%

Kinship Verification Using Voice

使用语音进行亲属关系验证

Jagabandhu Mishra, Tomi H. Kinnunen

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本研究通过提出新的评估协议和多种神经网络说话人嵌入提取器,建立了语音亲属关系验证的基础,并揭示了说话人验证与亲属关系验证之间的密切联系。

Comments Submited to IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01264 2026-06-02 q-bio.NC cs.HC cs.SD eess.AS eess.SP 57%

A 1000-hour EEG-EMG-audio dataset of Japanese speech production

1000小时日语语音产生的EEG-EMG-音频数据集

Motoshige Sato, Ilya Horiguchi, Masakazu Inoue, Kenichi Tomeoka, Eri Hatakeyama, Yuya Kita, Atsushi Yamamoto, Ippei Fujisawa, Shuntaro Sasai

机构 * National Institute of Information and Communications Technology, Japan(日本信息与通信技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究构建了一个包含1020小时同步头皮脑电图、面部肌电图和语音音频的多模态数据集,来自三名健康日语母语者在开放词汇有声语音过程中的记录,旨在支持语音解码、多模态信号处理及脑电图表示学习等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00712 2026-06-02 cs.CV 57%

CASTLE2026 Team WDL Technical Report

CASTLE2026 团队 WDL 技术报告

Zhengyang Li, Zhenglin Du, Yi Wen, Fang Liu, Shuo Li, Xu Liu

机构 * Key Laboratory of Intelligent Perception and Image Understanding(智能感知与图像理解重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于 Qwen 的证据感知多模态推理流程,通过提示路由和置信度加权投票解决长视频问答,在 CASTLE 挑战赛中排名第一。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00670 2026-06-02 cs.SD cs.AI 57%

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

超越口部:声学不确定性下视听句子识别中的上半脸情感线索

Zhou Yang, Yueyi Yang

机构 * Faculty of Education and Psychology, University of Oulu, Finland(奥卢大学教育与心理学学院,芬兰) Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究利用CREMA-D语料库,通过特征分类器探究在声学退化条件下,上半脸情感信息是否有助于视听句子识别,发现上半脸情感线索能提升模型校准和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00324 2026-06-02 cs.IR cs.AI 57%

LLMs Need Encoders for Semantic IDs Too

LLM 也需要语义 ID 的编码器

Xiangyi Chen, Zelun Wang, Xinyi Li, Yi-Ping Hsu, Jaewon Yang, Jiajing Xu

机构 * Pinterest United States(Pinterest美国公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出 PrefixMem,一种基于前缀 n-gram 记忆表的轻量级语义 ID 编码器,为 LLM 提供结构化、前缀条件的表示,显著提升生成推荐中的语义 ID 准确率和检索召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31294 2026-06-01 cs.CV 57%

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

TokTalk: 基于音频-大语言模型令牌的富有表现力的实时面部动画

Qingcheng Zhao, Yifang Pan, Karan Singh

机构 * University of Toronto(多伦多大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 提出TokTalk系统,利用音频-大语言模型产生的音频令牌直接实时生成富有表现力的3D面部动画,通过分块条件流匹配模型和轻量级适配策略实现低延迟和高品质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08979 2026-05-29 cs.SD cs.CL 57%

Beyond Transcripts: A Renewed Perspective on Audio Chaptering

超越文本:音频章节划分的新视角

Fabian Retkowski, Maike Züfle, Thai Binh Nguyen, Jan Niehues, Alexander Waibel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过提出音频专用架构AudioSeg、分析影响性能的因素以及形式化评估协议,系统研究了音频章节划分任务,发现AudioSeg显著优于基于文本的方法,停顿是最有效的声学特征,而多模态大模型在短音频上表现有潜力。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26176 2026-05-27 cs.SD cs.AI 57%

PitchBench: Measuring Pitch Hearing in Audio-Language Models

PitchBench: 测量音频-语言模型中的音高听觉能力

Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith, David M. Chan, Karina Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校) Thoughtful Lab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出PitchBench评估套件,通过28个实验系统测量音频-语言模型在绝对和相对音高感知上的表现,发现当前模型在不同声源、音长和格式下音高感知不可靠。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19858 2026-05-25 cs.CL 57%

Benchmarking Gaslighting Attacks Against Speech Large Language Models

针对语音大语言模型的气灯攻击基准测试

Jinyang Wu, Bin Zhu, Xiandong Zou, Qiquan Zhang, Xu Fang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) Tongyi Speech Lab(通义语音实验室) Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 提出五种气灯攻击策略(愤怒、认知干扰、讽刺、隐晦、专业否定),在5个语音和多模态大语言模型上测试,发现平均准确率下降24.3%,揭示语音模型的行为脆弱性。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23463 2026-05-25 eess.AS 57%

StepAudio 2.5 Technical Report

StepAudio 2.5 技术报告

Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15151 2026-05-22 cs.SD cs.AI 57%

Exploring How Audio Effects Alter Emotion with Foundation Models

探索音频效果如何通过基础模型改变情感

Stelios Katsis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究音频效果如何通过基础模型影响情感,探讨了基础模型在分析音频效果与情绪关系中的作用,揭示了声音设计技术对感知影响的模式。

Comments https://github.com/stelioskt/audioFX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15104 2026-05-21 cs.CL 57%

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

从文本到声音:一个可重复和可验证的评估工具调用LLM代理的框架

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN

机构 * Dialpad Inc.(Dialpad公司)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CL

AI总结 本文提出了一种可重复和可验证的框架,用于评估基于语音的工具调用LLM代理,通过文本到语音转换和环境噪声模拟,无需重新标注工具模式和黄金标签,从而在不重新标注的情况下评估工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18749 2026-05-19 cs.SD cs.CV 57%

WavFlow: Audio Generation in Waveform Space

WavFlow:在波形空间中进行音频生成

Feiyan Zhou, Luyuan Wang, Shoufa Chen, Zhe Wang, Zhiheng Liu, Yuren Cong, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出WavFlow框架,直接在原始波形空间生成高保真的音频,无需中间表示,通过波形分块和振幅提升实现稳定优化,通过自动化数据管道生成高质量视频-文本-音频三元组,实验结果显示在视频到音频和文本到音频基准测试中表现优异,证明了无需中间压缩即可实现高质量合成。

Comments Code: https://github.com/facebookresearch/WavFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 57%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16403 2026-05-19 cs.CV cs.SD 57%

When Vision Speaks for Sound

当视觉为声音说话

Xiaofei Wen, Wenjie Jacky Mo, Xingyu Fu, Rui Cai, Tinghui Zhu, Wendi Li, Yanan Xie, Muhao Chen, Peng Qi

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文发现视频中MLLMs的音频理解依赖视觉线索而非实际音频流,提出Thud框架通过三种音频编辑干预研究此问题,并提出两阶段对齐方法提升模型性能。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14731 2026-05-15 cs.GR cs.CV cs.SD 57%

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

UMo:统一稀疏运动建模用于实时协同语音化身

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Mogo AI Ltd.(Mogo AI有限公司) University of Southampton(南安普顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 UMo通过统一稀疏运动建模架构,结合文本、音频和运动令牌,实现高效实时密集重建,提升面部表情和手势的高保真动画生成,同时在低延迟条件下保持精细的语音-运动对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09846 2026-05-12 cs.SD cs.AI 57%

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

ChladniSonify:一种用于新媒介艺术创作中Chladni图案的视觉-听觉映射方法

Yakun Liu, Hai Luan, Dong Liu, Zhiyu Jin

机构 * Department of Composition(作曲系) Education Information Center(教育信息中心) Department of Musicology(音乐学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出ChladniSonify,通过基于Kirchhoff-Love板理论的数值编程构建数据集并利用ANSYS仿真校准,采用轻量级CNN与CBAM实现高精度低延迟的Chladni图案分类,最终构建端到端系统将识别图案映射到对应正弦波频率,实现实时交互。

Comments 9 pages, 5 figures, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22710 2026-05-08 cs.SD cs.AI cs.HC 57%

Same Words, Different Judgments: How Preferences Vary Across Modalities

相同词语,不同判断:偏好如何在不同模态间变化

Aaron Broukhim, Nadir Weibel, Eshin Jolly

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California San Diego(加州大学圣地亚哥分校) Department of Psychology(心理学系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 研究探讨了文本与语音模态在偏好标注中的差异,发现需9名评阅者才能达到较高一致性,且语音评阅者在决策阈值、长度偏差和用户导向标准上存在显著差异,合成评分可有效预测评阅者一致性,强调音频偏好数据评估需模态特定设计。

Comments Submitted to NeurIPS 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV 57%

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01197 2026-05-05 cs.SD cs.MM 57%

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

MG-Former:一种基于Transformer的音乐驱动3D指挥动作生成框架

Ke Qiu, Yawen Qin, Tianzhi Jia, Xiaole Yang, Kaimin Wang, Kaixing Yang

机构 * Malou Tech Inc(Malou科技公司) South-Central Minzu University(西南民族大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出TransConductor框架,通过SMPL参数数据构建流程生成专业指挥动作,结合Transformer编码器和解码器实现音乐驱动的3D指挥动作生成,并引入检索评估模型验证音乐与动作的对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20657 2026-05-05 cs.HC cs.AI 57%

Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects

具有情感智能的智能体:当前趋势、挑战与未来展望

Raziyeh Zall, Alireza Kheyrkhah, Erik Cambria, Zahra Naseri, M. Reza Kangavari

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了情感智能智能体的核心组件,涵盖多模态数据处理的情感理解、情感认知及表达合成,分析了发展中的关键挑战与未来方向,强调生成技术对情感计算的潜力。

Comments Enhanced the quality of figures, incorporated additional and recent references, and improved the manuscript for better clarity and writing quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20522 2026-05-01 cs.SD cs.CV 57%

From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR

从图像到音乐语言:一种针对复杂多声部乐谱的两阶段结构解码方法

Nan Xu, Shiheng Li, Shengchao Hou

机构 * FindLab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种实用的两阶段光学音乐识别管道新方法,聚焦第二阶段解码,通过结构解码问题解决复杂多声部乐谱中的声部分离和小节内时间同步问题。

Comments 52 pages, 18 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 57%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏