arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-05-12 至 2026-05-12 共收录 9
2605.10784 2026-05-12 cs.LG

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

MASS-DPO:多负样本主动采样用于直接策略优化

Rohan Surana, Xintong Li, Sheldon Yu, Yiran Jenny Shen, Chuhan Wang, Tong Yu, Prithviraj Ammanabrolu, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

AI总结 MASS-DPO通过多负样本主动采样方法,在Plackett-Luce模型下扩展直接偏好优化,通过选择信息丰富的负样本子集提升策略更新效率,减少冗余梯度,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09359 2026-05-12 cs.LG cs.AI

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1:通过强化学习实现智能体技能进化

Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09146 2026-05-12 cs.CV

Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search

超越思考:为仿人视觉搜索的360度想象

Jingdong Zhang, Yizhou Wang, Zhengzhong Tu, Xin Li, Wenping Wang, Xiaohang Zhan

机构 * Texas A&M University(德克萨斯A&M大学) Adobe(Adobe公司)

AI总结 本文提出了一种将探索过程分解为专门Imaginator和Actor的框架,通过单步推理语义布局,降低数据工程成本,提升复杂真实环境中的搜索效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17693 2026-05-12 cs.LG cs.AI cs.MA

COSAC: Counterfactual Credit Assignment in Sequential Cooperative Teams

COSAC:在顺序合作团队中的反事实信用分配

Shripad Deshmukh, Jayakumar Subramanian, Raghavendra Addanki, Nikos Vlassis

机构 * Adobe Research(Adobe研究)

AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02012 2026-05-12 cs.CV cs.LG

Improved Mean Flows: On the Challenges of Fastforward Generative Models

改进的均值流:关于快速前向生成模型挑战的研究

Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) MIT(麻省理工学院) Adobe(Adobe公司) THU(清华大学)

AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。

Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16234 2026-05-12 cs.LG

Sequential Causal Discovery with Noisy Language Model Priors

具有噪声语言模型先验的顺序因果发现

Prakhar Verma, David Arbour, Sunav Choudhary, Harshita Chopra, Arno Solin, Atanu R. Sinha

机构 * ELLIS Institute Finland and Aalto University(芬兰ELLIS研究所和阿尔托大学) Adobe Research(Adobe研究) University of Washington, Seattle(华盛顿大学(西雅图))

AI总结 本文提出一种混合框架,通过适应性整合顺序批次数据与噪声专家知识,提升因果发现的准确性,并扩展到参数估计,展示了对语言模型噪声的鲁棒性。

Comments 32 pages, Transactions on Machine Learning Research - TMLR (04/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏