arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-09 至 2026-07-09 共收录 3
2606.05894 2026-07-09 cs.CL 版本更新

EMBER: Efficient Memory via Budgeted Evidence Retention for Long-Horizon Agents

EMBER: 通过预算化证据保留实现高效记忆的长时程智能体

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(NVIDIA研究)

AI总结 针对长时程智能体在固定预算下保留证据的问题,提出EMBER学习型保留策略,通过存储证据胶囊(含原文摘录、检索键和更新元数据)并利用查询后反馈训练,在LongMemEval-RR上显著提升F1、保留召回和读取召回。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27000 2026-07-09 cs.CL cs.AI 版本更新

Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

撒更宽的网:面向代码推理的协调 Pass@K 策略优化

Yilong Li, Suman Banerjee, Tong Che

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA Research(英伟达研究)

AI总结 提出协调 Pass@K 策略优化 (CPPO),通过规划器生成多种策略并协调求解器尝试,以解决代码生成中重复采样导致冗余推理路径的问题,在多个基准上显著提升 pass@4。

Comments Code reasoning; pass@K optimization; coordinated planning; verifiable rewards; strategy diversity

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24108 2026-07-09 cs.RO cs.CV 版本更新

Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer

基于轨迹评分器的零人类示范端到端自动驾驶

Zhenxin Li, Nadine Chang, Wenhao Yao, Xinglong Sun, Zi Wang, Maying Shen, Jingde Chen, Jingyu Song, Kailin Li, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) NVIDIA University of Michigan(密歇根大学) East China Normal University(华东师范大学)

AI总结 研究提出ZTRS,一种基于强化学习的端到端自动驾驶规划范式,仅依靠真实世界图像和规则奖励训练,无需人类示范。通过详尽策略优化,能更好推广到长尾驾驶场景,在相关数据集上展现出优于模仿学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏