arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2605.14731 2026-05-15 cs.GR cs.CV cs.SD 57%

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

UMo:统一稀疏运动建模用于实时协同语音化身

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Mogo AI Ltd.(Mogo AI有限公司) University of Southampton(南安普顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 UMo通过统一稀疏运动建模架构,结合文本、音频和运动令牌,实现高效实时密集重建,提升面部表情和手势的高保真动画生成,同时在低延迟条件下保持精细的语音-运动对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09846 2026-05-12 cs.SD cs.AI 57%

ChladniSonify: A Visual-Acoustic Mapping Method for Chladni Patterns in New Media Art Creation

ChladniSonify:一种用于新媒介艺术创作中Chladni图案的视觉-听觉映射方法

Yakun Liu, Hai Luan, Dong Liu, Zhiyu Jin

机构 * Department of Composition(作曲系) Education Information Center(教育信息中心) Department of Musicology(音乐学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出ChladniSonify,通过基于Kirchhoff-Love板理论的数值编程构建数据集并利用ANSYS仿真校准,采用轻量级CNN与CBAM实现高精度低延迟的Chladni图案分类,最终构建端到端系统将识别图案映射到对应正弦波频率,实现实时交互。

Comments 9 pages, 5 figures, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22710 2026-05-08 cs.SD cs.AI cs.HC 57%

Same Words, Different Judgments: How Preferences Vary Across Modalities

相同词语,不同判断:偏好如何在不同模态间变化

Aaron Broukhim, Nadir Weibel, Eshin Jolly

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California San Diego(加州大学圣地亚哥分校) Department of Psychology(心理学系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 研究探讨了文本与语音模态在偏好标注中的差异,发现需9名评阅者才能达到较高一致性,且语音评阅者在决策阈值、长度偏差和用户导向标准上存在显著差异,合成评分可有效预测评阅者一致性,强调音频偏好数据评估需模态特定设计。

Comments Submitted to NeurIPS 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV 57%

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01197 2026-05-05 cs.SD cs.MM 57%

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

MG-Former:一种基于Transformer的音乐驱动3D指挥动作生成框架

Ke Qiu, Yawen Qin, Tianzhi Jia, Xiaole Yang, Kaimin Wang, Kaixing Yang

机构 * Malou Tech Inc(Malou科技公司) South-Central Minzu University(西南民族大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出TransConductor框架,通过SMPL参数数据构建流程生成专业指挥动作,结合Transformer编码器和解码器实现音乐驱动的3D指挥动作生成,并引入检索评估模型验证音乐与动作的对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20657 2026-05-05 cs.HC cs.AI 57%

Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects

具有情感智能的智能体:当前趋势、挑战与未来展望

Raziyeh Zall, Alireza Kheyrkhah, Erik Cambria, Zahra Naseri, M. Reza Kangavari

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了情感智能智能体的核心组件,涵盖多模态数据处理的情感理解、情感认知及表达合成,分析了发展中的关键挑战与未来方向,强调生成技术对情感计算的潜力。

Comments Enhanced the quality of figures, incorporated additional and recent references, and improved the manuscript for better clarity and writing quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20522 2026-05-01 cs.SD cs.CV 57%

From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR

从图像到音乐语言:一种针对复杂多声部乐谱的两阶段结构解码方法

Nan Xu, Shiheng Li, Shengchao Hou

机构 * FindLab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种实用的两阶段光学音乐识别管道新方法,聚焦第二阶段解码,通过结构解码问题解决复杂多声部乐谱中的声部分离和小节内时间同步问题。

Comments 52 pages, 18 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 57%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15995 2026-04-30 eess.AS 57%

AILive Mixer: A Deep Learning based Zero Latency Automatic Music Mixer for Live Music Performances

AILive Mixer: 基于深度学习的零延迟自动音乐混音系统用于现场音乐表演

Devansh Zurale, Iris Lorente, Michael Lester, Alex Mitchell

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出一种基于深度学习的自动多轨音乐混音系统,用于现场表演,解决现场表演中通道受相邻乐器声 bleed 影响及音频-视频同步问题,实现零延迟混音。

Comments 5 pages, 4 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26252 2026-04-30 cs.CV 57%

OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction

OmniTrend: 内容-上下文建模用于可扩展的社会流行度预测

Liliang Ye, Guiyi Zeng, Yunyao Zhang, Yi-Ping Phoebe Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出OmniTrend框架,通过分离内容吸引力与上下文曝光,提升跨平台流行度预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 57%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13421 2026-04-30 cs.SD eess.AS 57%

Explainable Detection of Machine Generated Music and Early Systematic Evaluation

可解释性地检测机器生成音乐及早期系统性评估

Yupei Li, Qiyang Sun, Hanqian Li, Lucia Specia, Björn W. Schuller

机构 * Imperial College London, Computing(帝国理工学院伦敦分校,计算机系) Shandong University(山东大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过多种模型评估机器生成音乐检测,揭示ResNet18在领域内和领域外测试中的最佳性能,提出未来研究方向以提升检测方法的鲁棒性和有效性。

Comments Accepted at Scientific report

Journal ref Sci Rep 16, 13757 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL 57%

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 57%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20847 2026-04-24 cs.IR cs.AI 57%

Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models

重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征

Yizhi Zhou, Jia-Qi Yang, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18423 2026-04-21 cs.CL 57%

BhashaSutra: A Task-Centric Unified Survey of Indian NLP Datasets, Corpora, and Resources

BhashaSutra:印度NLP数据集、语料库和资源的任务导向统一调查

Raghvendra Kumar, Devankar Raj, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳加邦计算机科学与工程系) Indian Institute of Technology Patna, India(印度理工学院帕纳加邦)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文首次系统梳理印度NLP资源,涵盖200+数据集、50+基准测试和100+模型工具,分析注释、评估及模型设计趋势,识别数据稀疏、语言覆盖不均等挑战,为公平、文化导向的NLP研究提供基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18159 2026-04-21 cs.CL 57%

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

FreezeEmpath: 基于冻结大语言模型的高效共情语音聊天机器人训练

Yun Hong, Yan Zhou, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出 FreezeEmpath,通过冻结大语言模型参数,利用现有语音指令和情感识别数据高效训练共情语音聊天机器人,实现情感表达和对话性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17023 2026-04-21 cs.HC cs.AI cs.CY 57%

The Instrumental Dissolution of Typing: Why AI Challenges the Keyboard Era in Knowledge Work

打字的消解:为何AI挑战键盘时代的知识工作

Wei Roy Hua

机构 * T5 Innovations(8T5创新)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AI使键盘在知识工作中不再必要,通过迁移功能至AI系统结束键盘时代,核心贡献是识别验证瓶颈,重新定义专业能力与劳动认可。

Comments 146 pages, 9 sections. Also available at https://zenodo.org/records/19605842

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15322 2026-04-20 cs.HC cs.CL cs.LG 57%

Acoustic and Facial Markers of Perceived Conversational Success in Spontaneous Speech

语音与面部特征在自发言语中感知对话成功的标志

Thanushi Withanage, Elizabeth Redcay, Carol Espy-Wilson

机构 * Department of Electrical and Computer Engineering, University of Maryland College Park, MD, USA(电气与计算机工程系,马里兰大学学院市分校) Department of Psychology, University of Maryland College Park, MD, USA(心理学系,马里兰大学学院市分校)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析自发Zoom对话,探讨对话动态与感知互动质量的关系,发现同步现象能可靠检测并预测更高的对话成功感知。

Comments Accepted for presentation at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15301 2026-04-20 cs.CV 57%

Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation

在潜在思想中思考:一种无手势词的签语翻译新范式

Yiyang Jiang, Li Zhang, Xiao-Yong Wei, Li Qing

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于推理的签语翻译框架,通过潜在思想序列作为中间层提升翻译的连贯性和准确性,并构建了一个新的大规模无手势词数据集。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14619 2026-04-17 cs.SD cs.LG eess.AS q-fin.CP q-fin.ST 57%

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

声音伪装现象:重新评估语音特征用于金融风险预测

Dhruvin Dungrani, Disha Dungrani

机构 * Department of Information Systems(信息系统系)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了在真实会议环境中,高训练度演讲者使用语音特征(音高、抖动和犹豫)进行金融风险预测的局限性,发现融合声音特征会降低性能,提出声音伪装现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07222 2026-04-17 cs.LG cs.CL 57%

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12221 2026-04-14 cs.CV 57%

A Two-Stage Dual-Modality Model for Facial Emotional Expression Recognition

一种两阶段双模态模型用于面部情绪表达识别

Jiajun Sun, Zhe Gao

机构 * Shanghai Normal University(上海师范大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出一种两阶段双模态模型,通过预训练DINOv2编码器提取鲁棒视觉特征,并结合Wav2Vec 2.0音频特征进行融合,提升面部情绪识别性能。

Comments Camera-ready version. 14 pages, 5 figures in total: 8 pages main text with 4 figures, 3 pages references, and 3 pages appendix with 1 figure. Accepted at the 10th ABAW Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 57%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01512 2026-04-14 cs.CL 57%

MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages

MCAT: 通过MLLMs扩展多对多语音到文本翻译至70种语言

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin, YaoWei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology, Harbin(哈尔滨工业大学(哈尔滨)) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 MCAT框架通过课程学习和数据平衡策略扩展MLLMs支持70种语言并实现互译,同时优化语音适配模块将语音序列长度缩减至30个token,提升翻译效率。

Comments Accepted in IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14493 2026-04-14 cs.CL cs.CR 57%

LingoLoop Attack: Trapping MLLMs via Linguistic Context and State Entrapment into Endless Loops

LingoLoop攻击:通过语言上下文和状态陷阱使大语言模型陷入无限循环

Jiyuan Fu, Kaixun Jiang, Lingyi Hong, Jinglun Li, Haijing Guo, Dingkang Yang, Zhaoyu Chen, Wenqiang Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Jiiov Technology(极奥科技)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LingoLoop攻击,通过调整词性标注和隐藏状态限制,使多模态大语言模型生成冗长重复内容,导致资源耗尽和服务降级。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/fuhaha824/LingoLoop-Attack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10542 2026-04-14 cs.SD cs.AI 57%

VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories

VidAudio-Bench:跨四个音频类别的V2A和VT2A生成基准测试

Qian Zhang, Yuqin Cao, Yixuan Gao, Xiongkuo Min

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VidAudio-Bench,通过四个音频类别评估V2A和VT2A生成,包含1634个视频文本对和11种先进模型,引入13种参考自由指标,揭示当前模型在语音和歌唱生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09881 2026-04-14 eess.AS cs.HC 57%

Toward using Speech to Sense Student Emotion in Remote Learning Environments

迈向利用语音感知远程学习环境中学生情绪的研究

Sargam Vyas, Bogdan Vlasenko, André Mayoraz, Egon Werlen, Per Bergamin, Mathew Magimai. -Doss

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过构建基于语音的自我控制任务数据集,研究语音在远程学习中感知学生情绪的可行性,探讨语音在情感维度上的变化及自动预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00793 2026-04-14 cs.HC cs.CL cs.ET cs.IR 57%

SpeechLess: Micro-utterance with Personalized Spatial Memory-aware Assistant in Everyday Augmented Reality

SpeechLess:日常增强现实中的个性化空间记忆-aware助理的微 utterance

Yoonsang Kim, Devshree Jadeja, Divyansh Pradhan, Yalong Yang, Arie Kaufman

机构 * Stony Brook University(石溪大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 SpeechLess通过个性化空间记忆实现语音意图粒度控制,减少公共场合说话的不适,提升日常信息获取效率。

Comments 11 pages, 9 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏