arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2603.06373 2026-03-09 eess.AS 57%

Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction

医生还是病人?协同语音识别与说话人识别用于代码混合希金斯医疗条件提取

Séverin Baroudi, Yanis Labrak, Shashi Kumar, Joonas Kalda, Sergio Burdisso, Pawel Cyrta, Juan Ignacio Alvarez-Trejos, Petr Motlicek, Hervé Bredin, Ricard Marxer

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种端到端神经说话人识别与向量聚类方法,用于代码混合希金斯医疗条件提取,通过领域特定微调和错误校正,实现了较高的转录准确率,并在DISPLACE-M挑战中取得优异成绩。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05272 2026-03-09 cs.CL cs.HC 57%

Oral to Web: Digitizing 'Zero Resource'Languages of Bangladesh

口到网:数字化孟加拉国的‘零资源’语言

Mohammad Mamun Or Rashid

机构 * Bangladesh Computer Council(孟加拉国计算机委员会) Jahangirnagar University(贾hangirnagar大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文介绍了多语言云语料库,旨在为孟加拉国的濒危语言提供数字化资源,涵盖42种语言,通过系统田野工作和多模态数据收集,支持低资源NLP和语言保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23649 2026-03-02 cs.SD cs.AI 57%

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音

Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang, Ming Zhu, Juntao Tan, Haolin Chen, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming, Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23266 2026-02-27 cs.CL 57%

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

面向 discourse 的双轨流式响应用于低延迟语音对话系统

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) School of Data Science, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 DDTSR 提出了一种低延迟语音对话系统框架,通过双轨流式响应机制实现听中思考和说中思考,显著降低响应延迟并保持 discourse 质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 57%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14172 2026-02-19 cs.SD cs.CL cs.LG 57%

Investigation for Relative Voice Impression Estimation

相对语音印象估计研究

Kenichi Fujita, Yusuke Ijima

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究探讨了相对语音印象估计方法,发现自监督语音模型在捕捉复杂感知差异方面表现更优,而多模态大语言模型在此任务中效果不佳。

Comments 5 pages,3 figures, Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15381 2026-02-18 cs.IR cs.CV 57%

Automatic Funny Scene Extraction from Long-form Cinematic Videos

从长篇电影视频中自动提取搞笑场景

Sibendu Paul, Haotian Jiang, Caren Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端系统,用于从长篇电影视频中自动识别和排名幽默场景,通过多模态方法提升场景定位和幽默检测精度。

Journal ref Association for the Advancement of Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13790 2026-02-17 cs.CL 57%

How Do Lexical Senses Correspond Between Spoken German and German Sign Language?

德语口语中的词义如何与德国手语对应?

Melis Çelikkol, Wei Zhao

机构 * Institute for Computational Linguistics, University of Heidelberg(计算语言学研究所,海德堡大学) Department of Computing Science, University of Aberdeen(计算机科学系,阿伯丁大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本研究通过分析德语和德国手语的词义对应关系,构建了首个跨模态词义对应标注数据集,利用语义相似性方法提高了词义映射的识别效果。

Comments EACL'26 (Student Research Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13330 2026-02-17 cs.CV 57%

Zwitscherkasten -- DIY Audiovisual bird monitoring

Zwitscherkasten -- DIY音频视觉鸟类监测

Dominik Blum, Elias Häring, Fabian Jirges, Martin Schäffer, David Schick, Florian Schulenberg, Torsten Schön

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 Zwitscherkasten是一种利用边缘设备进行音频和视觉数据采集的DIY鸟类监测系统,通过深度学习实现实时无创的鸟类物种识别,支持生物多样性监测和公民科学应用。

Comments Project Report of the Applied Artificial Intelligence Degree Program at Technische Hochschule Ingolstadt

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11941 2026-02-13 cs.IR cs.AI 57%

IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval

IncompeBench: 一个宽松许可、细粒度的音乐信息检索基准

Benjamin Clavié, Atoof Shakir, Jonah Turner, Sean Lee, Aamir Shakir, Makoto P. Kato

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) ETHZ(苏黎世联邦理工学院) University of Tsukuba(茨口大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 IncompeBench提供了一个高质量、宽松许可的音乐信息检索基准,包含大量标注数据和多样化查询,用于评估和改进音乐检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04899 2026-02-13 cs.AI 57%

Human Behavior Atlas: Benchmarking Unified Psychological and Social Behavior Understanding

人类行为图谱:统一心理与社会行为理解的基准测试

Keane Ong, Wei Dai, Carol Li, Dewei Feng, Hengzhi Li, Jingyao Wu, Jiaee Cheong, Rui Mao, Gianmarco Mengaldo, Erik Cambria, Paul Pu Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07143 2026-02-10 cs.SD cs.CL 57%

Massive Sound Embedding Benchmark (MSEB)

大规模声音嵌入基准(MSEB)

Georg Heigold, Ehsan Variani, Tom Bagby, Cyril Allauzen, Ji Ma, Shankar Kumar, Michael Riley

机构 * Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MSEB是一个用于评估多模态系统听觉组件的可扩展框架,提供八个核心任务和大规模数据集,旨在推动稳健的机器听觉智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06270 2026-02-09 cs.CL 57%

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

VowelPrompt:通过元音层面的语调增强从文本中听出语音情感

Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Arizona State University(亚利桑那州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06047 2026-02-09 cs.HC cs.AI 57%

Git for Sketches: An Intelligent Tracking System for Capturing Design Evolution

Git for Sketches: 一种智能追踪系统用于捕捉设计演变

Sankar B, Amogh A S, Sandhya Baranwal, Dibakar Sen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 DIMES系统通过智能版本控制捕捉设计演变,利用sGIT和生成式AI提升概念探索和知识传递效率。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05107 2026-02-06 cs.CL 57%

Multilingual Extraction and Recognition of Implicit Discourse Relations in Speech and Text

多语言语音与文本中隐含语篇关系的提取与识别

Ahmed Ruby, Christian Hardmeier, Sara Stymne

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出了一种多模态方法,通过整合文本和音频信息,实现多语言隐含语篇关系的跨语言迁移和识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04913 2026-02-06 cs.LG cs.AI cs.SD 57%

A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model

A$^2$-LLM:一种端到端的对话音频虚拟形象大语言模型

Xiaolin Hu, Hang Yuan, Xinzhu Sang, Binbin Yan, Zhou Yu, Cong Huang, Kai Chen

机构 * State Key Laboratory of Information Photonics(信息光子学国家重点实验室) Optical Communications, Beijing University of Posts(邮电大学光学通信学院) Zhongguancun Institute of Artificial Intelligence, Beijing, China(中关村人工智能研究院) School of Finance and Statistics, East China Normal University, Shanghai, China(东华大学金融与统计学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 A$^2$-LLM通过统一框架联合推理语言、音频语调和3D面部运动,实现端到端的情感表达对话虚拟形象,提升实时效率与情感表现力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04705 2026-02-05 cs.CL 57%

ERNIE 5.0 Technical Report

ERNIE 5.0技术报告

Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

机构 * ERNIE Team(ERNIE团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 ERNIE 5.0是首个实现万亿参数统一自回归模型的生产规模实现,支持多模态理解和生成,并采用弹性训练范式实现灵活的性能与资源权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04085 2026-02-05 cs.SD cs.CL 57%

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

BASS:用于音乐结构和语义推理的音频语言模型基准测试

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Allen Institute for AI(人工智能研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 BASS通过评估音频语言模型在音乐结构和语义推理方面的性能,揭示了现有模型在高层次推理任务上的局限性,并为音乐推荐和搜索提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25458 2026-02-05 cs.AI 57%

Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition

即插即用的情感图谱用于零样本语音情感识别的组合提示

Jiacheng Shi, Hongfei Du, Y. Alicia Hong, Ye Gao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出CCoT-Emo框架,通过引入结构化情感图谱提升零样本语音情感识别的性能。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02100 2026-02-03 cs.CY cs.AI cs.SI 57%

The Verification Crisis: Expert Perceptions of GenAI Disinformation and the Case for Reproducible Provenance

生成式人工智能的验证危机:专家对生成式人工智能虚假信息的看法及可重复性溯源的案例

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨生成式人工智能虚假信息的验证危机,指出大规模文本生成带来的系统性风险,并提出通过可重复性溯源和监管框架来应对挑战。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01547 2026-02-03 cs.SD eess.AS 57%

Attention-weighted Centered Kernel Alignment for Knowledge Distillation in Large Audio-Language Models Applied to Speech Emotion Recognition

基于注意力加权中心核对齐的知识蒸馏:用于大音频-语言模型的语音情感识别

Qingran Yang, Botao Zhao, Zuheng Kang, Xue Li, Yayun He, Chuhang Liu, Xulong Zhang, Xiaoyang Qu, Junqing Peng, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 PL-Distill通过结合投影层和输出层蒸馏方法,有效压缩大音频-语言模型并提升语音情感识别性能。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07213 2026-02-03 cs.AI 57%

Brain-inspired Computing Based on Deep Learning for Human-computer Interaction: A Review

基于深度学习的脑启发计算用于人机交互:综述

Bihui Yu, Sibo Zhang, Lili Zhou, Jingxuan Wei, Linzhuang Sun, Liping Bu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Heilongjiang Academy of Sciences Intelligent Manufacturing Institute(黑龙江科学院智能制造研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了基于深度学习的脑启发计算在人机交互中的应用,探讨了其发展、挑战及未来研究方向。

Comments 26pages, 8 figures and 4 tables

Journal ref Neurocomputing, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 57%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20402 2026-01-29 cs.HC cs.AI 57%

GuideAI: A Real-time Personalized Learning Solution with Adaptive Interventions

GuideAI: 一种具有自适应干预的实时个性化学习解决方案

Ananya Shukla, Chaitanya Modi, Satvik Bajpai, Siddharth Siddharth

机构 * HTI Lab, Plaksha University(普拉克斯大学HTI实验室)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 GuideAI通过整合实时生物反馈和多模态学习策略,提升LLM在个性化学习中的适应性和有效性,显著改善学习效果和认知负荷。

Comments Accepted for publication at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 57%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18456 2026-01-27 cs.SD eess.AS 57%

Geneses: Unified Generative Speech Enhancement and Separation

Geneses: 一体化的生成式语音增强与分离

Kohei Asai, Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学) National Institute of Advanced Industrial Science and Technology (AIST), Japan(日本先进工业科学和技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

AI总结 Geneses通过多模态扩散Transformer和潜在流匹配实现统一的高质量语音增强与分离,优于传统方法并具备更强的复杂退化鲁棒性。

Comments Accepted to ICASSP 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏