arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

NeurIPS

Conference on Neural Information Processing Systems · 会议 · Machine Learning

2026-08-28 至 2026-08-28 共收录 3
2510.16978 2026-08-28 cs.MA 版本更新

Lark: Biologically Inspired Neuroevolution for Multi-Stakeholder LLM Agents

Lark:生物启发的多利益相关者大语言模型代理神经进化

Rikhil Tanugula, Dheeraj Chintapalli, Sunkalp Chandra

AI总结 Lark通过结合大语言模型推理与进化型多智能体系统,解决冗余与利益相关者权衡问题,采用四机制提升策略生成效率与透明度,实验显示其在30轮评估中表现优异且成本可控。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20781 2026-08-28 cs.RO cs.LG 版本更新

STITCH-OPE: Trajectory Stitching with Guided Diffusion for Off-Policy Evaluation

STITCH-OPE:基于引导扩散的轨迹拼接用于离线策略评估

Hossein Goli, Michael Gimelfarb, Nathan Samuel de Lara, Haruki Nishimura, Masha Itkina, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) University of Toronto Robotics Institute(多伦多大学机器人研究所) Toyota Research Institute(丰田研究院) Vector Institute(向量研究所)

AI总结 STITCH-OPE通过引导扩散生成长周期轨迹,有效降低OPE中的方差,提升在高维空间中的评估性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09900 2026-08-28 cs.LG cs.AI 版本更新

Recurrent Reinforcement Learning with Memoroids

带有记忆体(memoroids)的循环强化学习

Steven Morad, Chris Lu, Ryan Kortvelesy, Stephan Liwicki, Jakob Foerster, Amanda Prorok

AI总结 该研究针对现有记忆模型处理长序列扩展性差的问题,提出基于幺半群的记忆体框架,改进了循环强化学习的批量处理方法,提升了样本效率与回报并简化了循环损失函数实现。

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏