arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-06-16 至 2026-06-16 共收录 5
2606.16093 2026-06-16 cs.CL cs.AI 新提交

Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing

基于可学习混合的GSS-Transformer混合架构的长上下文建模

Kuzey Torlak, Hüseyin Arda Arslan, Anıl Dervişoğlu, Beyza Nur Deniz, Onur Boyar

机构 * Kadıköy Anadolu High School(卡德柯伊安纳多卢高中) Politecnico di Torino(都灵理工大学) Istanbul Technical University(伊斯坦布尔理工大学) Boğaziçi University(博阿齐奇大学) IBM Research - Tokyo(IBM 东京研究院)

AI总结 提出并行混合架构PHA,通过可学习混合机制融合GSS、GQA和FFN,在长上下文建模中实现Transformer级困惑度与更高效率。

Comments 16 pages, 9 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15983 2026-06-16 quant-ph cond-mat.mtrl-sci cs.LG 新提交

Learning ground state observables from quantum computing experiments

从量子计算实验中学习基态可观测量

Ben Jaderberg, Freya Shah, Minjun Jeon, M. Emre Sahin, Christa Zoufal, Kunal Sharma

机构 * IBM Quantum, IBM Research Europe, Hursley, Winchester, SO21 2JN, United Kingdom(IBM量子、IBM欧洲研究院,赫尔斯利,温切斯特,SO21 2JN,英国) Department of Engineering Science, University of Oxford, Parks Road, Oxford OX1 3PJ, United Kingdom(工程科学系,牛津大学,帕克斯路,牛津 OX1 3PJ,英国) IBM Quantum, T. J. Watson Research Center, Yorktown Heights, NY 10598, USA(IBM量子、T.J. Watson研究中心,扬斯敦高地,纽约 10598,美国) Department of Materials, University of Oxford, Parks Road, Oxford OX1 3PH, United Kingdom(材料系,牛津大学,帕克斯路,牛津 OX1 3PH,英国) The Hartree Centre, STFC, Sci-Tech Daresbury, Warrington WA4 4AD, UK(哈特里中心,STFC,科技达尔斯伯里,沃林顿 WA4 4AD,英国) IBM Quantum, IBM Research Europe — Zurich, Ruschlikon 8803, Switzerland(IBM量子、IBM欧洲研究院——苏黎世,卢斯利康 8803,瑞士) IBM Research, Chicago, IL 60606, USA(IBM研究院,芝加哥,伊利诺伊 60606,美国)

AI总结 本文在115量子比特的二维海森堡XXZ模型中,利用近似基态的实验数据训练神经网络,成功预测了未见哈密顿量参数下的空间分辨可观测量,展示了从量子数据学习的实际可行性。

Comments 20 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07079 2026-06-16 cs.LG cs.CL 版本更新

Entropy-Aware On-Policy Distillation of Language Models

熵感知的在线策略蒸馏语言模型

Woogyeol Jin, Taywon Min, Yongjin Yang, Dennis Wei, Yi Zhou, Swanand Ravindra Kadhe, Nathalie Baracaldo, Kimin Lee

机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)

AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。

Comments 18 pages, 11 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12445 2026-06-16 cs.AI cs.LG stat.ML 版本更新

Computational Safety for Generative AI: A Hypothesis Testing Perspective

生成式AI的计算安全性:假设检验视角

Pin-Yu Chen

机构 * IBM Research(IBM研究院)

AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。

Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏