arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-06-09 至 2026-06-09 共收录 2
2508.06659 2026-06-09 cs.LG cs.AI 版本更新

In-Context Reinforcement Learning via Communicative World Models

通过通信世界模型进行上下文强化学习

Fernando Martinez-Lopez, Tao Li, Yingdong Lu, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) IBM Research(IBM研究院)

AI总结 提出CORAL框架,通过将潜在表示学习与控制分离,利用信息代理预训练世界模型并生成通信消息,使控制代理实现零样本适应和样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12612 2026-06-09 cs.LG cs.AI 版本更新

Learning Task Mixtures from Task Affinities: A Probabilistic Graphical Model for Supervised Fine-Tuning

学习什么是重要的:通过互信息的概率任务选择用于模型微调

Prateek Chanda, Saral Sureka, Parth Pratim Chatterjee, Krishnateja Killamsetty, Nikhil Shivakumar Nayak, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔分校) IBM Research(IBM研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森AI实验室)

AI总结 本文提出TaskPGM框架,通过基于能量的任务模型学习连续任务混合,利用互信息和行为分歧来捕捉任务间的关系,从而在任务覆盖和冗余之间取得平衡,提升大语言模型的监督微调性能。

Comments 9, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏