arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-08-31 至 2026-08-31 共收录 5
2608.27848 2026-08-31 cs.SD cs.CL eess.AS 新提交

Is Prosody Lost in Translation? Fine-Grained Cross-Lingual Prosody Similarity Across Languages

韵律在翻译中会丢失吗?跨语言的细粒度韵律相似性研究

Haopeng Xie, Ismail Rasim Ulgen, Sofia Son, Berrak Sisman, Philipp Koehn

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰斯·霍普金斯大学语言与语音处理中心)

AI总结 本研究利用多语言配音数据开展跨语言韵律细粒度分析,发现特定语言间韵律结构存在内在相关性,为表达性语音到语音翻译系统提供了实证指导。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27668 2026-08-31 cs.CV 新提交

Report Supervision

报告监督

Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal, Jieneng Chen, Xinze Zhou, Zheren Zhu, Chuntung Zhuanga, Sergio Decherchi, Andrea Cavalli, Kang Wang, Yang Yang, Alan Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) University Hospital Basel(巴塞尔大学医院) Stanford University(斯坦福大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Italian Institute of Technology(意大利技术研究院) University of Bologna(博洛尼亚大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Johns Hopkins Medicine(约翰斯·霍普金斯医疗集团)

AI总结 本研究提出报告监督(R-Super)框架,利用大量放射学报告补充稀缺的肿瘤掩码训练数据,在肾脏和胰腺肿瘤分割任务上显著提升了AI的检测与分割性能。

Comments Published in Medical Image Analysis, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26281 2026-08-31 eess.AS cs.LG cs.SD 版本更新

DiffAnon: Diffusion-based Prosody Control for Voice Anonymization

DiffAnon: 基于扩散的语调控制语音匿名化

Ismail Rasim Ulgen, Zexin Cai, Nicholas Andrews, Philipp Koehn, Berrak Sisman

机构 * Center for Language and Speech Processing, Johns Hopkins University, USA(语言与语音处理中心,约翰霍普金斯大学,美国) Human Language Technology Center of Excellence (COE), Johns Hopkins University, USA(人类语言技术卓越中心(COE),约翰霍普金斯大学,美国)

AI总结 DiffAnon通过扩散模型与分类器自由引导机制实现语调控制,提供连续的推理时间控制,实现匿名化强度与语调保真度的平滑插值。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2026-08-31 cs.CL cs.AI 版本更新

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04291 2026-08-31 eess.AS cs.LG 版本更新

Rethinking Speaker Embeddings for Speech Generation: Sub-Center Modeling for Capturing Intra-Speaker Diversity

反思语音生成中的说话人嵌入:用于捕捉说话人内部多样性的子中心建模

Ismail Rasim Ulgen, John H. L. Hansen, Carlos Busso, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University, USA(语言与语音处理中心(CLSP),约翰霍普金斯大学,美国) Center for Robust Speech Systems (CRSS), The University of Texas at Dallas, USA(稳健语音系统中心(CRSS),德克萨斯大学达拉斯分校,美国) Language Technologies Institute (LTI), Carnegie Mellon University, USA(语言技术研究所(LTI),卡内基梅隆大学,美国)

AI总结 该研究针对语音生成中说话人嵌入的设计缺陷,提出子中心建模框架,在零样本语音转换任务中提升了可懂度、音高变异性与自然度,同时保留了说话人验证性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏