arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

NVIDIA(英伟达)

2026-03-17 至 2026-03-17 共收录 6
2603.15603 2026-03-17 cs.CV

Fast SAM 3D Body: Accelerating SAM 3D Body for Real-Time Full-Body Human Mesh Recovery

快速3D人体SAM:加速3D人体SAM用于实时完整人体网格恢复

Timing Yang, Sicheng He, Hongyi Jing, Jiawei Yang, Zhijian Liu, Chuhang Zou, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达) Meta Reality Labs(元宇宙现实实验室)

AI总结 本文提出Fast SAM 3D Body,通过解耦空间依赖性和架构感知剪枝,实现并行多作物特征提取和流式Transformer解码,提升3D人体网格恢复速度达10.9倍,同时保持重建精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15546 2026-03-17 cs.CV cs.GR cs.RO

Kimodo: Scaling Controllable Human Motion Generation

Kimodo:可控制的人体运动生成

Davis Rempe, Mathis Petrovich, Ye Yuan, Haotian Zhang, Xue Bin Peng, Yifeng Jiang, Tingwu Wang, Umar Iqbal, David Minor, Michael de Ruyter, Jiefeng Li, Chen Tessler, Edy Lim, Eugene Jeong, Sam Wu, Ehsan Hassani, Michael Huang, Jin-Bey Yu, Chaeyeon Chung, Lina Song, Olivier Dionne, Jan Kautz, Simon Yuen, Sanja Fidler

机构 * NVIDIA

AI总结 本文提出Kimodo模型,通过大规模动作捕捉数据训练,实现高质量可控的人体运动生成,结合文本输入和多种运动约束条件,提升生成质量和泛化能力。

Comments Project page: https://research.nvidia.com/labs/sil/projects/kimodo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15326 2026-03-17 cs.CL cs.AI

Tagarela - A Portuguese speech dataset from podcasts

Tagarela - 一个来自播客的葡萄牙语语音数据集

Frederico Santos de Oliveira, Lucas Rafael Stefanel Gris, Alef Iury Siqueira Ferreira, Augusto Seben da Rosa, Alexandre Costa Ferro Filho, Edresson Casanova, Christopher Dane Shulby, Rafael Teixeira Sousa, Diogo Fernandes Costa Silva, Anderson da Silva Soares, Arlindo Rodrigues Galvão Filho

机构 * Federal University of Mato Grosso(马拉尼昂州联邦大学) Federal University of Goias(戈亚斯联邦大学) Paulista State University(保罗州立大学) NVIDIA(NVIDIA公司) Elsa Speak

AI总结 为解决葡萄牙语资源匮乏问题,本文提出Tagarela数据集,包含8972小时播客音频,用于训练语音识别和文本到语音模型,展示其在推动葡萄牙语音技术发展中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13617 2026-03-17 cs.LG cs.CE

Privacy-Preserving Federated Fraud Detection in Payment Transactions with NVIDIA FLARE

支付交易中隐私保护的联邦欺诈检测与NVIDIA FLARE

Holger R. Roth, Sarthak Tickoo, Mayank Kumar, Isaac Yang, Andrew Liu, Amit Varshney, Sayani Kundu, Iustina Vintila, Peter Madsgaard, Juraj Milcak, Chester Chen, Yan Cheng, Andrew Feng, Jeff Savio, Vikram Singh, Craig Stancill, Gloria Wan, Evan Powell, Anwar Ul Haq, Sudhir Upadhyay, Jisoo Lee

机构 * NVIDIA J.P. Morgan Bank of New York Royal Bank of Canada(皇家银行) DeepTempo

AI总结 本文通过NVIDIA FLARE框架研究多机构联邦异常检测,展示联邦模型在欺诈检测中优于本地模型且保护数据主权,同时分析收敛行为和隐私-效用平衡。

Comments 16 pages, 6 figures, 5 tables, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13329 2026-03-17 cs.LG cs.AI

LUMINA: Laplacian-Unifying Mechanism for Interpretable Neurodevelopmental Analysis via Quad-Stream GCN

LUMINA:基于拉普拉斯统一机制的可解释神经发育分析四流图卷积网络

Minkyung Cha, Jooyoung Bae, Jaewon Jung, Ping Shu Ho, Ka Chun Cheung, Namjoon Kim

机构 * Seoul National University, Seoul, Republic of Korea(首尔国立大学,韩国首尔) NVIDIA AI Technology Center HK, Hong Kong(NVIDIA香港人工智能技术中心,香港)

AI总结 LUMINA通过四流图卷积网络和双频谱图拉普拉斯过滤机制,提升fMRI数据中神经连接动态的可解释性,在ADHD和ASD诊断中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13299 2026-03-17 cs.LG cs.AI

DreamReader: An Interpretability Toolkit for Text-to-Image Models

DreamReader: 一种用于文本到图像模型的可解释性工具包

Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks NVIDIA Harvard University(哈佛大学)

AI总结 DreamReader提出了一种统一框架,通过可组合的表示操作分析扩散模型的可解释性,引入三种新干预机制,通过实验展示其在文本到图像模型中的应用,推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏