arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-04-07 至 2026-04-07 共收录 9
2604.04373 2026-04-07 cs.AI cs.LG

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04323 2026-04-07 cs.CL

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

代理技能在真实环境中的表现如何:在现实场景中评估LLM技能使用的基准测试

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 本文研究了在更现实的环境下LLM技能的实用性,发现技能效果随环境复杂性增加而下降,通过查询特定的技能细化策略可恢复性能,实验在Terminal-Bench 2.0上提升了Claude Opus 4.6的通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04231 2026-04-07 cs.LG

Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization

子空间控制:将受约束的模型操控转化为可控的谱优化

Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu

机构 * OPTML, Michigan State University(OPTML,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院) University of Minnesota(明尼苏达大学) University of Michigan(密歇根大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 本文提出子空间控制框架,通过分析谱交叉任务干扰并利用一阶解正交化合并子空间,引入SIFT方法,实现可控更新以缓解目标与约束冲突,在四个应用中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04854 2026-04-07 cs.CL cs.AI cs.LG

Projected Autoregression: Autoregressive Language Generation in Continuous State Space

投影自回归:在连续状态空间中进行自回归语言生成

Oshri Naparstek

机构 * IBM Research(IBM研究院)

AI总结 本文提出投影自回归方法,通过连续预测和离散投影实现语言生成,展示连续状态空间在生成文本结构和动态方面的独特优势。

Comments In preperation to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16383 2026-04-07 cs.AI cs.SE

An Agent-Based Framework for the Automatic Validation of Mathematical Optimization Models

一个基于代理的数学优化模型自动验证框架

Alexander Zadorojniy, Segev Wasserkrug, Eitan Farchi

机构 * IBM Research(IBM研究院)

AI总结 本文提出基于代理的自动验证方法,通过生成测试API、测试用例和突变体,提升优化模型的验证质量,尤其在突变覆盖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19738 2026-04-07 quant-ph cs.AI cs.LG

Batch Entanglement Detection in Parameterized Qubit States using Classical Bandit Algorithms

使用经典多臂老虎机算法进行参数化量子比特状态的批量纠缠检测

K. Bharati, Vikesh Siddhu, Krishna Jagannathan

机构 * IIT Madras(印度马德拉斯理工学院) IBM Research India(IBM印度研究院)

AI总结 本文提出一种基于经典多臂老虎机算法的批量纠缠检测方法,通过测量单参数纠缠见证者并设置阈值,实现对两量子比特状态集的纠缠识别,展示了其在量子信息处理中的应用。

Comments 29 pages, 8 figures

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27771 2026-04-07 cs.MA cs.CL cs.CY

Emergent Social Intelligence Risks in Generative Multi-Agent Systems

生成多智能体系统中的涌现社会智能风险

Yue Huang, Yu Jiang, Wenjie Wang, Haomin Zhuang, Xiaonan Luo, Yuchen Ma, Zhangchen Xu, Zichen Chen, Nuno Moniz, Zinan Lin, Pin-Yu Chen, Nitesh V Chawla, Nouha Dziri, Huan Sun, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) LMU Munich(慕尼黑大学) University of Washington(华盛顿大学) Bake AI University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Stanford University(斯坦福大学) Microsoft Research(微软研究院) IBM Research(IBM研究院) Cohere The Ohio State University(俄亥俄州立大学)

AI总结 研究生成多智能体系统在共享资源竞争中的涌现风险,揭示集体行为自发复制人类社会故障模式的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02900 2026-04-07 cs.AI

Seemingly Simple Planning Problems are Computationally Challenging: The Countdown Game

看似简单的规划问题具有计算挑战性:倒计时游戏

Michael Katz, Harsha Kokel, Sarath Sreedharan

机构 * IBM T. J. Watson Research Center(IBM T. J. Watson 研究中心) IBM San Jose(IBM 圣何塞) Colorado State University(科罗拉多州立大学)

AI总结 本文提出基于倒计时游戏的规划基准,该问题具有NP完全复杂性,能有效评估规划能力,实验显示现有LLM方法在该基准上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01622 2026-04-07 cs.CL

DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluation

DOVE:一个大规模多维预测数据集,用于有意义的LLM评估

Eliya Habba, Ofir Arviv, Itay Itzhak, Yotam Perlitz, Elron Bandel, Leshem Choshen, Michal Shmueli-Scheuer, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) IBM Research AI(IBM研究院人工智能) MIT(麻省理工学院) Technion - Israel Institute of Technology(以色列理工学院) Allen Institute for AI(艾伦人工智能研究所)

AI总结 DOVE通过大规模多维提示扰动评估LLM对不同维度的敏感性,揭示了提示设计对模型性能的影响,提供高效选择高性能提示的方法及鲁棒评估框架。

Journal ref Findings of ACL 2025, pp. 11744-11763

详情

展开后加载摘要…

URL PDF HTML 收藏