arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2602.14172 2026-02-19 cs.SD cs.CL cs.LG 57%

Investigation for Relative Voice Impression Estimation

相对语音印象估计研究

Kenichi Fujita, Yusuke Ijima

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究探讨了相对语音印象估计方法,发现自监督语音模型在捕捉复杂感知差异方面表现更优,而多模态大语言模型在此任务中效果不佳。

Comments 5 pages,3 figures, Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15381 2026-02-18 cs.IR cs.CV 57%

Automatic Funny Scene Extraction from Long-form Cinematic Videos

从长篇电影视频中自动提取搞笑场景

Sibendu Paul, Haotian Jiang, Caren Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端系统,用于从长篇电影视频中自动识别和排名幽默场景,通过多模态方法提升场景定位和幽默检测精度。

Journal ref Association for the Advancement of Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13790 2026-02-17 cs.CL 57%

How Do Lexical Senses Correspond Between Spoken German and German Sign Language?

德语口语中的词义如何与德国手语对应?

Melis Çelikkol, Wei Zhao

机构 * Institute for Computational Linguistics, University of Heidelberg(计算语言学研究所,海德堡大学) Department of Computing Science, University of Aberdeen(计算机科学系,阿伯丁大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本研究通过分析德语和德国手语的词义对应关系,构建了首个跨模态词义对应标注数据集,利用语义相似性方法提高了词义映射的识别效果。

Comments EACL'26 (Student Research Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13330 2026-02-17 cs.CV 57%

Zwitscherkasten -- DIY Audiovisual bird monitoring

Zwitscherkasten -- DIY音频视觉鸟类监测

Dominik Blum, Elias Häring, Fabian Jirges, Martin Schäffer, David Schick, Florian Schulenberg, Torsten Schön

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 Zwitscherkasten是一种利用边缘设备进行音频和视觉数据采集的DIY鸟类监测系统,通过深度学习实现实时无创的鸟类物种识别,支持生物多样性监测和公民科学应用。

Comments Project Report of the Applied Artificial Intelligence Degree Program at Technische Hochschule Ingolstadt

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11941 2026-02-13 cs.IR cs.AI 57%

IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval

IncompeBench: 一个宽松许可、细粒度的音乐信息检索基准

Benjamin Clavié, Atoof Shakir, Jonah Turner, Sean Lee, Aamir Shakir, Makoto P. Kato

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) ETHZ(苏黎世联邦理工学院) University of Tsukuba(茨口大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 IncompeBench提供了一个高质量、宽松许可的音乐信息检索基准,包含大量标注数据和多样化查询,用于评估和改进音乐检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04899 2026-02-13 cs.AI 57%

Human Behavior Atlas: Benchmarking Unified Psychological and Social Behavior Understanding

人类行为图谱:统一心理与社会行为理解的基准测试

Keane Ong, Wei Dai, Carol Li, Dewei Feng, Hengzhi Li, Jingyao Wu, Jiaee Cheong, Rui Mao, Gianmarco Mengaldo, Erik Cambria, Paul Pu Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07143 2026-02-10 cs.SD cs.CL 57%

Massive Sound Embedding Benchmark (MSEB)

大规模声音嵌入基准(MSEB)

Georg Heigold, Ehsan Variani, Tom Bagby, Cyril Allauzen, Ji Ma, Shankar Kumar, Michael Riley

机构 * Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MSEB是一个用于评估多模态系统听觉组件的可扩展框架,提供八个核心任务和大规模数据集,旨在推动稳健的机器听觉智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06270 2026-02-09 cs.CL 57%

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

VowelPrompt:通过元音层面的语调增强从文本中听出语音情感

Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Arizona State University(亚利桑那州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06047 2026-02-09 cs.HC cs.AI 57%

Git for Sketches: An Intelligent Tracking System for Capturing Design Evolution

Git for Sketches: 一种智能追踪系统用于捕捉设计演变

Sankar B, Amogh A S, Sandhya Baranwal, Dibakar Sen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 DIMES系统通过智能版本控制捕捉设计演变,利用sGIT和生成式AI提升概念探索和知识传递效率。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05107 2026-02-06 cs.CL 57%

Multilingual Extraction and Recognition of Implicit Discourse Relations in Speech and Text

多语言语音与文本中隐含语篇关系的提取与识别

Ahmed Ruby, Christian Hardmeier, Sara Stymne

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种多模态方法,通过整合文本和音频信息,实现多语言隐含语篇关系的跨语言迁移和识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04913 2026-02-06 cs.LG cs.AI cs.SD 57%

A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model

A$^2$-LLM:一种端到端的对话音频虚拟形象大语言模型

Xiaolin Hu, Hang Yuan, Xinzhu Sang, Binbin Yan, Zhou Yu, Cong Huang, Kai Chen

机构 * State Key Laboratory of Information Photonics(信息光子学国家重点实验室) Optical Communications, Beijing University of Posts(邮电大学光学通信学院) Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村人工智能研究院) School of Finance and Statistics, East China Normal University, Shanghai, China(东华大学金融与统计学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 A$^2$-LLM通过统一框架联合推理语言、音频语调和3D面部运动,实现端到端的情感表达对话虚拟形象,提升实时效率与情感表现力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04705 2026-02-05 cs.CL 57%

ERNIE 5.0 Technical Report

ERNIE 5.0技术报告

Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

机构 * ERNIE Team(ERNIE团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 ERNIE 5.0是首个实现万亿参数统一自回归模型的生产规模实现,支持多模态理解和生成,并采用弹性训练范式实现灵活的性能与资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 57%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25458 2026-02-05 cs.AI 57%

Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition

即插即用的情感图谱用于零样本语音情感识别的组合提示

Jiacheng Shi, Hongfei Du, Y. Alicia Hong, Ye Gao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出CCoT-Emo框架,通过引入结构化情感图谱提升零样本语音情感识别的性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02100 2026-02-03 cs.CY cs.AI cs.SI 57%

The Verification Crisis: Expert Perceptions of GenAI Disinformation and the Case for Reproducible Provenance

生成式人工智能的验证危机:专家对生成式人工智能虚假信息的看法及可重复性溯源的案例

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨生成式人工智能虚假信息的验证危机,指出大规模文本生成带来的系统性风险,并提出通过可重复性溯源和监管框架来应对挑战。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01547 2026-02-03 cs.SD eess.AS 57%

Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition

基于注意力加权中心核对齐的知识蒸馏:用于大音频-语言模型的语音情感识别

Qingran Yang, Botao Zhao, Zuheng Kang, Xue Li, Yayun He, Chuhang Liu, Xulong Zhang, Xiaoyang Qu, Junqing Peng, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 PL-Distill通过结合投影层和输出层蒸馏方法,有效压缩大音频-语言模型并提升语音情感识别性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07213 2026-02-03 cs.AI 57%

Brain-inspired Computing Based on Deep Learning for Human-computer Interaction: A Review

基于深度学习的脑启发计算用于人机交互:综述

Bihui Yu, Sibo Zhang, Lili Zhou, Jingxuan Wei, Linzhuang Sun, Liping Bu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Heilongjiang Academy of Sciences Intelligent Manufacturing Institute(黑龙江科学院智能制造研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了基于深度学习的脑启发计算在人机交互中的应用,探讨了其发展、挑战及未来研究方向。

Comments 26pages, 8 figures and 4 tables

Journal ref Neurocomputing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 57%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20402 2026-01-29 cs.HC cs.AI 57%

GuideAI: A Real-time Personalized Learning Solution with Adaptive Interventions

GuideAI: 一种具有自适应干预的实时个性化学习解决方案

Ananya Shukla, Chaitanya Modi, Satvik Bajpai, Siddharth Siddharth

机构 * HTI Lab, Plaksha University(普拉克斯大学HTI实验室)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 GuideAI通过整合实时生物反馈和多模态学习策略,提升LLM在个性化学习中的适应性和有效性,显著改善学习效果和认知负荷。

Comments Accepted for publication at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 57%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18456 2026-01-27 cs.SD eess.AS 57%

Geneses: Unified Generative Speech Enhancement and Separation

Geneses: 一体化的生成式语音增强与分离

Kohei Asai, Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本先进工业科学和技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Geneses通过多模态扩散Transformer和潜在流匹配实现统一的高质量语音增强与分离,优于传统方法并具备更强的复杂退化鲁棒性。

Comments Accepted to ICASSP 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14784 2026-01-27 eess.AS 57%

MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis

MELA-TTS:联合变压器-扩散模型与表征对齐用于语音合成

Keyu An, Zhiyu Zhang, Changfeng Gao, Yabin Li, Zhendong Peng, Haoxu Wang, Zhihao Du, Han Zhao, Zhifu Gao, Xiangang Li

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 MELA-TTS通过联合变压器-扩散模型与表征对齐,实现端到端文本到语音合成,提升连续特征建模效率和跨模态一致性。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18010 2026-01-27 eess.AS cs.SD 57%

AmbER$^2$: Dual Ambiguity-Aware Emotion Recognition Applied to Speech and Text

AmbER$^2$: 双重模糊感知情感识别应用于语音和文本

Jingyao Wu, Grace Lin, Yinuo Song, Rosalind Picard

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 AmbER$^2$通过双重模糊感知框架提升语音和文本情感识别的准确性与鲁棒性。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03310 2026-01-27 eess.AS 57%

TASU: Text-Only Alignment for Speech Understanding

TASU:用于语音理解的纯文本对齐

Jing Peng, Yi Yang, Xu Li, Yu Xi, Quanwei Tang, Yangui Fang, Junjie Li, Kai Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 TASU通过纯文本数据实现语音理解的跨模态对齐,提升了零样本语音识别性能,并在多个基准测试中优于现有模型。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13651 2026-01-21 cs.CV 57%

Face-Voice Association with Inductive Bias for Maximum Class Separation

人脸-语音关联与最大类别分离的归纳偏置

Marta Moscati, Oleksandr Kats, Mubashir Noman, Muhammad Zaigham Zaheer, Yufang Hou, Markus Schedl, Shah Nawaz

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) MBZUAI IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利) Linz Institute of Technology(林茨技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于最大类别分离作为归纳偏置的人脸-语音关联方法,通过实验验证其在多模态学习中的有效性。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12844 2026-01-21 cs.CL 57%

Rapport du Projet de Recherche TRAIMA

TRAIMA研究项目报告

Julie Rançon, Jean-François Cerisier, Emilie Remond, Aurélien Nguyen, Andrew Peterson, Ladjel Bellatreche

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 TRAIMA项目旨在建立多模态教学互动自动处理的方法论框架,通过分析课堂互动中的解释性序列,探索机器学习在多模态数据转录和分类中的应用。

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12700 2026-01-21 eess.AS cs.SD 57%

Improving Audio Question Answering with Variational Inference

通过变分推断改进音频问答

Haolin Chen

机构 * Idiap Research Institute, Martigny, Switzerland(日内瓦研究所) École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(洛桑联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过改进的变分推断优化器提升音频问答任务的预测准确性与校准性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12289 2026-01-21 cs.SD cs.LG eess.AS 57%

ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech

ParaMETA: 向学习解耦的语音语义说话风格表示迈进

Haowei Lou, Hye-young Paik, Wen Hu, Lina Yao

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 ParaMETA通过统一框架学习解耦的语音语义说话风格表示,实现多任务处理和生成任务中的细粒度风格控制。

Comments 9 pages, 7 figures, Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 57%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏