arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-06-30 至 2026-06-30 共收录 7
2606.30627 2026-06-30 cs.LG cs.AI stat.ML

Pessimism's Paradox: Conservative Offline Training Amplifies Reward Hacking During Online Adaptation in Reasoning Models

悲观的悖论:保守离线训练加剧推理模型在线适应中的奖励黑客行为

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Horizon Research Apple Meta

AI总结 研究发现,离线训练中越保守的DPO(高β)会压缩策略熵,降低响应多样性,反而加速在线优化中奖励模型的利用,导致更严重的奖励黑客行为。

Comments Accepted in ICML 2026 workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29823 2026-06-30 cs.DB cs.AI cs.MA

Experience Graphs: The Data Foundation for Self-Improving Agents

经验图:自我改进智能体的数据基础

Gang Liao, Yujia He, Abdullah Ozturk, Zhouyang Li, Ying Wang, Zhitong Guo, Hongsen Qin, Yaobin Qin, Tao Yang, Zewei Jiang, Dianshi Li, Jort Gemmeke, Jiangyuan Li, Liyuan Li, Nathan Yan, Masha Basmanova, Uladzimir Pashkevich, Matt Steiner, Pedro Pedreira, Rob Fergus, Anirudh Goyal, Carole-Jean Wu, Gaoxiang Liu, Andrew Witten, Daniel J. Abadi

机构 * Meta Platforms(Meta平台) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 提出Trellis系统,将智能体探索过程产生的经验图作为一等数据库状态,通过查询、重用和物化视图支持跨会话复用和训练数据提取,在Meta的KernelEvolve中实现10倍加速和52%更低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28480 2026-06-30 cs.SE cs.AI

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

TUA-Bench:通用终端使用代理的基准测试

Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Duke University(杜克大学) Stanford University(斯坦福大学)

AI总结 提出TUA-Bench,包含120个跨五类任务的终端代理基准,涵盖日常数字活动与科学工程工作流,通过执行评分评估,发现最强模型Claude Opus 4.8仅达65.8%,揭示通用终端代理的显著差距。

Comments Website: https://www.tuabench.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25889 2026-06-30 cs.CV physics.optics

Polarization-Based Eye Tracking with Personalized Siamese Architectures

基于极化的眼跟踪与个性化孪生架构

Beyza Kalkanli, Tom Bu, Mahsa Shakeri, Alexander Fix, Dave Stronks, Dmitri Model, Mantas Žurauskas

机构 * Meta, Reality Labs, Redmond, WA 98052, USA(Meta现实实验室(雷德蒙德)) Meta, Reality Labs, Burlingame, CA 94010, USA(Meta现实实验室(伯灵格姆))

AI总结 本文提出利用极化眼跟踪与个性化孪生架构,通过减少校准样本数量提升眼动追踪精度,相比传统方法误差降低12%,结合线性校准进一步提升13%。

Comments Accepted to ETRA 2026 as full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04961 2026-06-30 cs.CV

SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization

SSDD:单步扩散解码器用于高效图像标记化

Théophane Vallaeys, Jakob Verbeek, Matthieu Cord

机构 * Meta Fundamental AI Research(Meta 基础人工智能研究) Sorbonne University(索邦大学)

AI总结 本文提出SSDD,一种基于Transformer和GAN-free训练的单步扩散解码器,提升了图像标记化的效率和稳定性,实现比KL-VAE更高的重建质量和更快的采样速度。

详情

展开后加载摘要…

URL PDF HTML 收藏