arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-08 至 2026-07-08 共收录 5
2607.06088 2026-07-08 cs.SD 新提交

Flow Matching-Based Speech Source Separation with Best-of-N Biometric Sampling

基于最佳N生物特征采样的流匹配语音源分离

Anastasia Zorkina, Alexandr Anikin, Nikita Khmelev, Anastasiya Korenevskaya, Sergey Novoselov, Vladimir Volokhov, Maxim Korenevsky, Yuriy Matveev

机构 * NVIDIA(英伟达)

AI总结 针对单通道语音分离难题,提出基于条件流匹配的方法,训练时用冻结说话人编码器定义源顺序,推理时用于生物特征最佳N候选选择等,在Libri2Mix基准上评估,该方法在分离指标及下游任务中表现出色。

Comments Accepted at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05667 2026-07-08 cs.CV cs.GR 新提交

Clustered Codebook Quantization for 2D Gaussian-based Image Compression

基于二维高斯的图像压缩的聚类码本量化

Runze Cheng, Yicheng Zhan, Josef Spjut, Kaan Akşit

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

AI总结 研究基于高斯的图像压缩中率失真问题,提出聚类引导向量量化(CGVQ)方法,通过在量化前划分高斯参数为同质组,提高压缩效率和参数重建准确性,实验显示该方法使bpp降低20%且视觉质量相当。

Comments 3 pages. Accepted to ACM SIGGRAPH 2026 Poster Track. Code available at https://github.com/complight/Cluster_Guided_Vector_Quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05391 2026-07-08 cs.AI cs.CL cs.LG cs.MA cs.RO 新提交

LLM-as-a-Verifier: A General-Purpose Verification Framework

LLM-as-a-Verifier:一种通用验证框架

Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(英伟达研究院)

AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。

Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28757 2026-07-08 cs.CV cs.RO 版本更新

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

基于物理的多智能体动力学世界模型基准

Nuo Chen, Lulin Liu, Zihao Li, Ziyao Zeng, Zihao Zhu, Wenyan Cong, Junyuan Hong, Yunhao Yang, Zhengzhong Tu, Yan Wang, Boris Ivanovic, Marco Pavone, Zhangyang Wang, Yang Zhou, Zhiwen Fan

机构 * Texas A&M University(德克萨斯大学) University of Minnesota(明尼苏达大学) Marquette University(马奎特大学) Yale University(耶鲁大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 提出CrashTwin框架,通过多智能体碰撞场景数据集和校准无关重建流程,从时空一致性、动量与动能守恒、世界动力学完整性三个维度评估世界模型的物理可信度。

Comments 34 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07162 2026-07-08 cs.RO 版本更新

First Plan Then Evaluate: Multi-Target Planning with Post-Planning Success Evaluation Improves Learning-Based Grasping Pipelines

先规划再评估:通过规划后成功评估的多目标规划改进基于学习的抓取管道

Martin Matak, Mohanraj Devendran Shanthi, Karl Van Wyk, Tucker Hermans

机构 * NVIDIA

AI总结 研究自主多指抓取问题,提出先规划到一组抓取目标,再由评估器估计成功可能性,机器人执行最可能成功轨迹的框架,该方法在多方面优于传统框架且能推广到新环境。

详情

展开后加载摘要…

URL PDF HTML 收藏