AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation
AugCodec:通过数据增强的低比特率解耦神经语音编解码器
机构 * Amazon, USA(亚马逊(美国))
AI总结 提出AugCodec,利用数据增强将语音分解为语义、说话人和韵律三种令牌,在12.5Hz低比特率下实现优于现有方法的重建质量和解耦性能。
Comments Accepted by Interspeech 2026
大厂专区
AugCodec:通过数据增强的低比特率解耦神经语音编解码器
机构 * Amazon, USA(亚马逊(美国))
AI总结 提出AugCodec,利用数据增强将语音分解为语义、说话人和韵律三种令牌,在12.5Hz低比特率下实现优于现有方法的重建质量和解耦性能。
Comments Accepted by Interspeech 2026
超越下一步:用于长时程规划的变长潜世界模型
机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; Amazon AGI SF Lab(亚马逊AGI旧金山实验室) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 提出变长潜世界模型(VLWM),通过学习变长动作序列的条件潜状态预测,解决递归一步预测在长时程规划中的累积误差问题,结合课程训练策略,在长时程控制任务上平均提升13%。
通过观测-动作规范化实现姿态无关的机器人功能性抓取
机构 * Tsinghua University(清华大学) ; Amazon(亚马逊) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出AnyMug框架,通过观测-动作规范化将深度观测和末端执行器动作转换到物体中心坐标系,训练单一闭环策略实现零样本迁移的功能性抓取,在模拟和真实机器人上均取得高成功率。