arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

NVIDIA(英伟达)

2026-03-30 至 2026-03-30 共收录 3
2512.13607 2026-03-30 cs.CL cs.AI cs.LG

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19669 2026-03-30 cs.AI

HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization

HeaRT:一种基于分层电路推理树的代理框架用于AMS设计优化

Souradip Poddar, Chia-Tung Ho, Ziming Wei, Weidong Cao, Haoxing Ren, David Z. Pan

机构 * ECE Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) NVIDIA Corporation(英伟达公司) The George Washington University(乔治华盛顿大学)

AI总结 HeaRT提出了一种分层电路推理树的代理框架,通过提升F1(subcircuits)和F1(loops)指标,实现更高效的AMS设计优化,且在不同架构上表现出更好的适应性和收敛速度。

Comments Analog Design Automation, Hierarchical Circuit Reasoning, Context-Aware Design Adaptation, LLMs, Agentic Frameworks, Electronic Design Automation (EDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22886 2026-03-30 cs.LG cs.RO

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

任务标记:一种灵活的适应行为基础模型的方法

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler

机构 * Technion(以色列理工学院) NVIDIA Research(英伟达研究院)

AI总结 本文提出任务标记方法,通过强化学习学习任务特定编码器,使行为基础模型适应特定任务,同时保持灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏