arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-06-23 至 2026-06-23 共收录 3
2606.21893 2026-06-23 cs.SD eess.AS 新提交

AugCodec: A Low-Bitrate Disentangled Neural Speech Codec via Data Augmentation

AugCodec:通过数据增强的低比特率解耦神经语音编解码器

Dongmei Wang, Xiaohang Sun, Yang Liu, Fanjie Kong, Abhishek Yanamandra, Abhinav Jain, Daniel Tompkins, Woohyun Kang, Najmeh Sadoughi, Sunil Hadap, Xiang Hao, Zhu Liu, Caren Chen

机构 * Amazon, USA(亚马逊(美国))

AI总结 提出AugCodec,利用数据增强将语音分解为语义、说话人和韵律三种令牌,在12.5Hz低比特率下实现优于现有方法的重建质量和解耦性能。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21775 2026-06-23 cs.LG cs.AI 新提交

Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning

超越下一步:用于长时程规划的变长潜世界模型

Tianqi Du, Qi Zhang, Yifei Wang, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Amazon AGI SF Lab(亚马逊AGI旧金山实验室) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 提出变长潜世界模型(VLWM),通过学习变长动作序列的条件潜状态预测,解决递归一步预测在长时程规划中的累积误差问题,结合课程训练策略,在长时程控制任务上平均提升13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21148 2026-06-23 cs.RO 新提交

Pose-Agnostic Robotic Functional Grasping via Observation-Action Canonicalization

通过观测-动作规范化实现姿态无关的机器人功能性抓取

Le Qiu, Cole Harrison, Jiankai Sun, Yao Liu, Suning Huang, Qianzhong Chen, Yang You, Marco Pavone

机构 * Tsinghua University(清华大学) Amazon(亚马逊) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出AnyMug框架,通过观测-动作规范化将深度观测和末端执行器动作转换到物体中心坐标系,训练单一闭环策略实现零样本迁移的功能性抓取,在模拟和真实机器人上均取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏