arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Salesforce

2026-05-19 至 2026-05-19 共收录 4
2605.17734 2026-05-19 cs.AI

Harnessing LLM Agents with Skill Programs

通过技能程序 harnessing LLM agents

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

机构 * New York University(纽约大学) Salesforce AI Research(Salesforce人工智能研究)

AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16743 2026-05-19 cs.RO

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE: 用于跨具身学习的潜在视觉表示

Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 本文提出LACE框架,通过利用跨具身共享身体部分的对应关系,在自监督学习backbone的潜在空间中对齐人类和机器人视觉表示,从而解决人类与机器人具身之间的视觉差距问题,提升机器人策略在稀疏示范下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16216 2026-05-19 cs.CL

Reinforcement Learning for LLM Post-Training: A Survey

为大型语言模型进行后训练的强化学习:综述

Zhichao Wang, Kiran Ramnath, Bin Bi, Shiva Kumar Pentyala, Sougata Chaudhuri, Shubham Mehrotra, Zixu, Zhu, Xiang-Bo Mao, Sitaram Asur, Na, Cheng

机构 * Salesforce AWS AI Labs Airbnb

AI总结 本文综述了通过强化学习进行大型语言模型后训练的方法,分析了RLHF和RLVR等技术,并提出统一的策略梯度框架,旨在为研究人员提供技术参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16575 2026-05-19 cs.AI

Counterparty Modeling is Not Strategy: The Limits of LLM Negotiators

对手建模不是策略:大语言模型谈判者的局限

Romain Cosentino, Sarath Shekkizhar, Adam Earle, Silvio Savarese

机构 * Salesforce AI Research(Salesforce人工智能研究)

AI总结 研究探讨了大语言模型在多属性谈判中的表现,发现其能建模对手偏好但无法有效转化为战略谈判,最终协议受初始锚定影响大。

详情

展开后加载摘要…

URL PDF HTML 收藏