arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Nanyang Technological University(南洋理工大学)

2026-03-09 至 2026-03-09 共收录 8
2603.06444 2026-03-09 cs.SD cs.AI

Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input

面向流式文本输入的语调边界感知流式生成用于基于大语言模型的语音合成

Changsong Liu, Tianrui Wang, Ye Ni, Yizhou Peng, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, China(天津大学) Southeast University, China(东南大学)

AI总结 本文提出一种面向语调边界的后训练策略,通过调整预训练模型以处理流式文本输入,从而提升语音合成的语调质量和长文本生成的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06079 2026-03-09 eess.AS cs.AI eess.SP

StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation

StreamVoiceAnon+: 通过帧级声学蒸馏实现情感保留的流式语音匿名化

Nikita Kuzmin, Kong Aik Lee, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(信息与通信研究所) The Hong Kong Polytechnic University, Hong Kong(香港理工大学)

AI总结 StreamVoiceAnon+通过帧级声学蒸馏和监督微调,在保持情感信息的同时实现高效的流式语音匿名化,提升情感保留率并保持隐私性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05925 2026-03-09 cs.CV cs.AI

RAC: Rectified Flow Auto Coder

RAC:修正流自编码器

Sen Fang, Yalin Feng, Yanxin Zhang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Nanyang Technological University(南洋理工大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 RAC通过修正流改进VAE,实现多步解码和双向推断,提升生成质量并降低计算成本。

Comments 11 Figures, 4 Tables. Project Page at https://world-snapshot.github.io/RAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03704 2026-03-09 cs.RO cs.AI

Large-Language-Model-Guided State Estimation for Partially Observable Task and Motion Planning

基于大语言模型的态估计用于部分可观测任务和运动规划

Yoonwoo Kim, Raghav Arora, Roberto Martín-Martín, Peter Stone, Ben Abbatematteo, Yoonchang Sung

机构 * The University of Texas at Austin(德克萨斯大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出CoCo-TAMP框架,利用大语言模型的常识推理能力,通过分层态估计提升部分可观测任务和运动规划的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16538 2026-03-09 cs.CV

OnlineSI: Taming Large Language Model for Online 3D Understanding and Grounding

OnlineSI: 通过大规模语言模型实现在线3D理解和定位

Zixian Liu, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 OnlineSI通过整合3D点云与语义信息,提升大规模语言模型在动态环境中的空间理解和物体识别能力。

Comments Project Page: https://onlinesi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05283 2026-03-09 cs.SE cs.AI

Software Development Life Cycle Perspective: A Survey of Benchmarks for Code Large Language Models and Agents

软件开发生命周期视角:代码大语言模型和代理的基准测试调查

Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Chong Wang, Weisong Sun, Yang Liu, Aishan Liu, Xianglong Liu, Chao Shen, Bin Shi

机构 * Xi’an Jiaotong University(西安交通大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

AI总结 本文从软件开发生命周期视角调查代码大语言模型和代理的基准测试,揭示当前基准测试在覆盖方面的不平衡,并提出未来研究方向以缩小理论能力与实际应用之间的差距。

Comments Significantly enhanced the tiered analysis framework for a more comprehensive evaluation of CodeLLMs and Agents throughout the SDLC

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14273 2026-03-09 eess.AS cs.SD

Efficient Emotion and Speaker Adaptation in LLM-Based TTS via Characteristic-Specific Partial Fine-Tuning

基于特征特定部分微调的LLM语音合成中高效情感与说话人适应

Tianrui Wang, Meng Ge, Cheng Gong, Chunyu Qiang, Haoyu Wang, Zikang Huang, Yu Jiang, Ye Ni, Yuheng Lu, Xiaobao Wang, Engsiong Chng, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing and Application(天津认知计算与应用重点实验室) College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) TeleAI, China Telecom(TeleAI,中国电信) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Huiyan Technology Co., Ltd(慧言科技有限公司) Nanyang Technological University(南洋理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

AI总结 本文提出CSP-FT方法,通过特征特定部分微调提升LLM语音合成在情感和说话人适应中的性能,实现参数更新效率与模型表现的平衡。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏