Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations
将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释
机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) ; IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) ; EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) ; CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) ; SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) ; College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)
专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。
Comments Accepted by ICLR 2026