arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Amazon(亚马逊)

2026-07-14 至 2026-07-14 共收录 4
2607.10421 2026-07-14 eess.AS cs.SD 新提交

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理

Kuan-Po Huang, Bo-Ru Lu, Ho-Lam Chung, Shih-Hsin Wang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Amazon(亚马逊)

AI总结 研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。

Comments Project website: https://fdoneaudio.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11874 2026-07-14 cs.RO cs.AI cs.LG 新提交

A Minimalist Retargeting-Guided Reinforcement Learning Recipe for Dexterous Manipulation

一种用于灵巧操作的极简重定向引导强化学习方法

Yunhai Feng, Natalie Leung, Jiaxuan Wang, Lujie Yang, Haozhi Qi, Preston Culbertson

机构 * Cornell University(康奈尔大学) Amazon FAR(亚马逊FAR)

AI总结 研究如何将重定向引导强化学习用于灵巧操作,提出REGRIND方法,从单人演示学习策略,经重定向、模拟训练、零样本转移到硬件,在丰富接触任务中产生类人行为,还分析了模拟到现实转移的关键因素。

Comments Website: https://yunhaifeng.com/REGRIND

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09985 2026-07-14 cs.CV 新提交

UniPose9D: Universal Category-Agnostic Object Pose Estimation

UniPose9D:通用的类别无关物体姿态估计

Yang You, Yi Du, Cole Harrison, Leonidas Guibas

机构 * Stanford University(斯坦福大学) Amazon(亚马逊)

AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11073 2026-07-14 cs.LG physics.ao-ph 新提交

AeroMELD: A Linear Embedding of Aerosol Populations for Diagnostics and Latent Dynamics

AeroMELD:用于诊断和潜在动力学的气溶胶群体线性嵌入

Ehsan Saleh, Saba Ghaffari, Wenhan Tang, Jeffrey H. Curtis, Lekha Patel, Peter A. Bosler, Nicole Riemer, Matthew West

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Sandia National Laboratories(桑迪亚国家实验室)

AI总结 研究旨在准确表示大气气溶胶群体,提出AeroMELD框架构建低维潜在变量以保留其数学结构,通过尺度-形状分解等实现,能准确重建多种分布及行为,为在潜在空间学习气溶胶过程演化奠定基础。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏