arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-06-23 至 2026-06-23 共收录 7
2606.23625 2026-06-23 cs.RO 新提交

Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation

学习行动的同时学习观察:机器人模仿中的主动感知扩散模型

Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Autodesk Research(欧特克研究院) NVIDIA(英伟达)

AI总结 提出See2Act模仿学习方法,通过耦合动作去噪与视角优化,在测试时基于主动推断的视角序列预测动作,解决遮挡下的部分可观测问题,在Ravens和RLBench任务上性能提升达34%。

Comments Project website: see2act.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23019 2026-06-23 cs.CV cs.AI 新提交

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

机构 * KlingAI Research(KlingAI研究院) Beijing Institute of Technology(北京理工大学) NVIDIA(英伟达) Tsinghua University(清华大学)

AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22811 2026-06-23 cs.CL cs.AI 新提交

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

Bagpiper-TTS: 自然语言引导的通用语音合成

Jinchuan Tian, Haoran Wang, Siddhant Arora, Takashi Maekaku, Keita Goto, Jin Sakuma, Yusuke Shinohara, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation NVIDIA Research(英伟达研究院)

AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21014 2026-06-23 cs.RO 新提交

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP: 基于Feynman-Kac采样的流策略后验估计

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心) College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) NVIDIA(英伟达)

AI总结 提出BayesFP框架,将预训练扩散/流匹配策略的约束轨迹生成视为贝叶斯后验采样,利用Feynman-Kac校正器实现无需重训练的推理时采样,在模拟和真实操作任务中提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20873 2026-06-23 cs.CL 新提交

SciLens: Multi-modal Scientific Claim Verification with Agentic Entailment and Grounding

SciLens: 多模态科学声明验证的智能蕴含与归因框架

Yueming Wang, Tianshi Zheng, Jiaxin Bai, Yangqiu Song, Ginny Wong, Simon See

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Baptist University(香港浸会大学) NVIDIA AI Technology Center(英伟达人工智能技术中心)

AI总结 提出SciLens框架,通过将声明分解为原子命题并归因到表格/图表证据,实现多模态科学声明验证,在SciClaimEval上达到79.2%宏F1和63.1%配对准确率。

Comments KDD 2026 SciSoc Agents & LLMs (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20574 2026-06-23 cs.NI cs.AI 新提交

LLM-assisted gNB Parameter Configuration for Radio Access Network

LLM辅助的无线接入网gNB参数配置

Yao-Cong Dong, Maria Amparo Canaveras Galdon, Ari Uskudar, Kuntal Chowdhury, Edwin K. P. Chong, Ray-Guang Cheng

机构 * Dept. of Electronic and Computer Engineering, National Taiwan University of Science and Technology, Taiwan(电子与计算机工程系,台湾科技大学) NVIDIA, USA(NVIDIA公司) Colorado State University, USA(科罗拉多州立大学)

AI总结 提出LLM辅助框架,通过合成数据生成和微调,自动从错误日志中生成正确的gNB参数配置,在OAI测试中准确率达92.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17055 2026-06-23 cs.RO 新提交

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex: 触觉反应灵巧操作

Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle, Ruijie Zheng, Jing Wang, Ryan Punamiya, Mengda Xu, Yuqi Xie, Yunfan Jiang, Letian Fu, Konstantinos Kallidromitis, Matteo Gioia, Junyi Zhang, Jiaxin Ge, Haiwen Feng, Fabio Galasso, Wei Zhan, David M. Chan, Yutong Bai, Roei Herzig, Jiahui Lei, Li Fei-Fei, Ken Goldberg, Jitendra Malik, Pieter Abbeel, Yuke Zhu, Danfei Xu, Linxi Fan, Trevor Darrell

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Stanford(斯坦福大学) Panasonic(松下) La Sapienza University(罗马大学) ItalAI

AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。

Comments Project page: https://tactile-rex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏