arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-05-11 至 2026-05-11 共收录 7
2605.08084 2026-05-11 cs.RO cs.CV

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23198 2026-05-11 cs.LG cs.CL

Sparser, Faster, Lighter Transformer Language Models

更稀疏、更快、更轻量的Transformer语言模型

Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones

机构 * Sakana AI NVIDIA

AI总结 本文提出一种基于无结构稀疏性的方法,通过改进的稀疏打包格式和CUDA内核,提升Transformer模型的推理和训练效率,实现更高效的模型压缩与资源利用。

Comments Code and checkpoints available at: https://github.com/SakanaAI/sparser-faster-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07182 2026-05-11 cs.LG

Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control

Star Elastic:多模型一体的推理LLM及其高效预算控制

Ali Taghibakhshi, Ruisi Cai, Saurav Muralidharan, Sharath Turuvekere Sreenivas, Aditya Vavre, Ameya Sunil Mahabaleshwarkar, Bilal Kartal, Sheldon Liang, Marcin Chochowski, Zijia Chen, Akhiad Bercovich, Ran Zilberstein, Ran El-Yaniv, Yonatan Geifman, Daniel Korzekwa, Yoshi Suhara, Oluwatobi Olabiyi, Ashwath Aithal, Nima Tajbakhsh, Pavlo Molchanov

机构 * NVIDIA(英伟达)

AI总结 本文提出Star Elastic方法,通过单次训练任务添加多个嵌套子模型,降低训练成本并解决静态架构的刚性问题,实现动态预算控制,提升推理准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06914 2026-05-11 cs.DC cs.AI cs.CL

Regulating Branch Parallelism in LLM Serving

在LLM服务中调节分支并行度

Swapnil Gandhi, Siva Hari, William J. Dally, Christos Kozyrakis

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达)

AI总结 本文提出TAPER,一种按步骤的准入控制器,通过预测分支外部性来调节分支并行度,提升吞吐量并保持服务级别目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05806 2026-05-11 cs.LG

Retrieval from Within: An Intrinsic Capability of Attention-Based Models

内部检索:基于注意力模型的内在能力

Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg

机构 * NVIDIA Department of Electrical Engineering, Technion, Haifa, Israel(技术学院电子工程系,以色列海法)

AI总结 本文提出INTRA框架,通过注意力机制直接从内部表征检索证据,统一检索与生成流程,提升问答任务的召回与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13010 2026-05-11 cs.LG cs.AI

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Lightning OPD: 为大推理模型高效实现离线在线蒸馏

Yecheng Wu, Song Han, Hai Cai

机构 * NVIDIA

AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01290 2026-05-11 cs.LG

ThinKV: Thought-Adaptive KV Cache Compression for Efficient Reasoning Models

ThinKV: 基于思维适应的KV缓存压缩以提高推理模型效率

Akshat Ramachandran, Marina Neseem, Charbel Sakr, Rangharajan Venkatesan, Brucek Khailany, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA Research(NVIDIA研究)

AI总结 本文提出ThinKV,通过混合量化-驱逐策略,根据思维重要性动态调整token精度,减少KV缓存占用,提升推理效率和吞吐量。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏