arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-08-31 至 2026-08-31 共收录 3
2604.26281 2026-08-31 eess.AS cs.LG cs.SD 版本更新

DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

DiffAnon: 基于扩散的语调控制语音匿名化

Ismail Rasim Ulgen, Zexin Cai, Nicholas Andrews, Philipp Koehn, Berrak Sisman

机构 * Center for Language and Speech Processing, Johns Hopkins University, USA(语言与语音处理中心,约翰霍普金斯大学,美国) Human Language Technology Center of Excellence (COE), Johns Hopkins University, USA(人类语言技术卓越中心(COE),约翰霍普金斯大学,美国)

AI总结 DiffAnon通过扩散模型与分类器自由引导机制实现语调控制,提供连续的推理时间控制,实现匿名化强度与语调保真度的平滑插值。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04291 2026-08-31 eess.AS cs.LG 版本更新

Rethinking Speaker Embeddings for Speech Generation: Sub-Center Modeling for Capturing Intra-Speaker Diversity

反思语音生成中的说话人嵌入:用于捕捉说话人内部多样性的子中心建模

Ismail Rasim Ulgen, John H. L. Hansen, Carlos Busso, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University, USA(语言与语音处理中心(CLSP),约翰霍普金斯大学,美国) Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, USA(稳健语音系统中心(CRSS),德克萨斯大学达拉斯分校,美国) Language Technologies Institute (LTI), Carnegie Mellon University, USA(语言技术研究所(LTI),卡内基梅隆大学,美国)

AI总结 该研究针对语音生成中说话人嵌入的设计缺陷,提出子中心建模框架,在零样本语音转换任务中提升了可懂度、音高变异性与自然度,同时保留了说话人验证性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏