arXivDaily arXiv每日学术速递 周一至周五更新

作者

Jiawei Han

Data Mining

2026-05-13 至 2026-05-13 共收录 1
2605.11169 2026-05-13 cs.AI

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

OLIVIA:通过推理时间动作适应实现LLM ReAct代理的在线学习

Sheldon Yu, Junda Wu, Xintong Li, Nikki Lijing Kuang, Sizhe Zhou, Tong Yu, Jiawei Han, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究)

AI总结 OLIVIA通过在推理时对动作进行适应,改进LLM ReAct代理在部署中的决策能力,提供可跟踪、细粒度和不确定性感知的适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏