Near-Optimal Stochastic Linear Bandits with Delay
带延迟的近最优随机线性赌博机
机构 * Tel Aviv University(特拉维夫大学) ; University of Iowa(爱荷华大学) ; Tel Aviv University and Google Research(特拉维夫大学和谷歌研究)
AI总结 研究多种延迟模型下的随机线性赌博机,给出近最优遗憾界,揭示延迟与线性结构交互的维度影响。
大厂专区
带延迟的近最优随机线性赌博机
机构 * Tel Aviv University(特拉维夫大学) ; University of Iowa(爱荷华大学) ; Tel Aviv University and Google Research(特拉维夫大学和谷歌研究)
AI总结 研究多种延迟模型下的随机线性赌博机,给出近最优遗憾界,揭示延迟与线性结构交互的维度影响。
LLM智能体能否推断世界模型?来自智能体自动机学习的证据
机构 * The Hebrew University of Jerusalem(海法大学) ; New York University(纽约大学) ; Google Research(谷歌研究)
AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。
VisualClaw:面向物理世界的实时个性化智能体
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Google(谷歌) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出VisualClaw,一种自进化多模态智能体,通过混合编码和技能进化机制降低部署成本并提升准确性,在多个视频QA基准上实现平均-98%的API成本削减和最高+15.80%的准确率提升。
Comments H. T. and J. C. contribute to this project equally
基于低秩结构的数据选择主动学习
机构 * Google Research(谷歌研究院) ; University of California, Berkeley(加州大学伯克利分校) ; Institute of Science and Technology Austria (ISTA)(奥地利科学技术研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Texas A&M University(德克萨斯农工大学)
AI总结 提出基于低秩近似和残差采样的数据选择框架,在温和正则条件下选择加权子集,使平均损失近似全数据集平均损失,相对误差(1+ε)加性项εΦ_k,实验优于均匀采样和聚类敏感采样。
Comments ICML 2026
基于上下文学习的深度学习工作负载迁移智能体框架
机构 * Google(谷歌)
AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。
扩展项目反应理论以实现高效且有意义的多语言评估
机构 * Google Research(谷歌研究) ; The Hebrew University of Jerusalem(特拉维夫大学) ; PhaseV Trials
AI总结 提出Multilingual-IRT框架,通过引入每语言难度偏差、分离内容与语言效应的区分度及每语言能力残差,解决多语言基准测试中的线性扩展、翻译错误和文化特定知识混淆问题,在MMLU-Pro-X上实现更优的预测和错误检测。
解锁扩散层次:自适应时间步选择用于零样本分割
机构 * Google(谷歌)
AI总结 提出自适应时间步选择机制,利用扩散模型去噪过程中的层次语义进展,结合上下文相似度图融合高分辨率注意力与U-Net特征,实现零样本分割性能提升。
MVEB:大规模视频嵌入基准
机构 * Harvard University(哈佛大学) ; SaluteDevices ; MIRAI ; Zendesk ; Shanghai University of Finance and Economics(上海财经大学) ; Google LLC ; Salesforce ; Cornell University(康奈尔大学) ; Astera Institute(Astera研究院) ; Independent Contributor(独立贡献者) ; Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) ; Barclays(巴克莱银行) ; Aarhus University(奥胡斯大学) ; Stanford University(斯坦福大学)
AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。
混合专家Transformer中任务路由的理论模型
机构 * University of Sydney(悉尼大学) ; Zhejiang University(浙江大学) ; Google Research(谷歌研究院)
AI总结 通过离散语言模型证明单层MoE Transformer可利用专家实现任务专业化,支持经验发现。
EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化
机构 * DeepMind, London, UK(深度Mind, 英国伦敦) ; University of Cambridge, UK(英国剑桥大学) ; University of Washington, USA(美国华盛顿大学)
AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。
S-SPPO:语义校准的自对弈偏好优化
机构 * University of Arizona, USA(亚利桑那大学) ; Arizona State University, USA(亚利桑那州立大学) ; Now at Google LLC, work done at Rice University(现就职于谷歌公司,曾就职于里士大学) ; Clemson University, USA(克莱姆森大学) ; Washington University in St. Louis, USA(圣路易斯华盛顿大学) ; Halmstad University, Sweden(哈姆斯塔德大学) ; Guangdong Institute of Intelligence Science and Technology, China(广东智能科学与技术研究院)
AI总结 针对自对弈偏好优化(SPPO)中因偏好预测过度自信导致策略退化的问题,提出双空间语义校准框架S-SPPO,通过语义门控监督校准和潜在排斥表示校准,在保持博弈结构的同时提升对齐性能。
Comments Accepted by ICML2026
RSRCC:通过检索增强的最佳N排序构建的遥感区域变化理解基准
机构 * Google Research(谷歌研究)
AI总结 提出RSRCC基准,包含12.6万个细粒度遥感变化问答对,采用层次化半监督流程结合最佳N排序解决歧义,实现局部语义变化推理。
基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究
机构 * Polymathic AI(多学科人工智能实验室) ; Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) ; Google DeepMind(谷歌DeepMind) ; Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) ; New York University(纽约大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。
EffGen: 使小型语言模型成为能干的自主智能体
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) ; Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) ; Google DeepMind, USA(谷歌DeepMind)
AI总结 EffGen是一个针对小型语言模型优化的开源智能体框架,通过提示压缩、任务分解、复杂度路由和统一记忆系统,实现高效、安全的本地部署,在13个基准测试中优于LangChain等框架。
Comments Accepted to ICML 2026 Conference
用于可微优化的全一阶层
机构 * University of California, Berkeley(加州大学伯克利分校) ; DeepMind(深度思维)
AI总结 提出一种仅使用一阶信息计算梯度的算法,通过将可微优化重写为双层优化并引入活动集拉格朗日超梯度方法,避免Hessian计算,实现高效近似。
Comments ICML 2026
注意力,而非规模,驱动多模态语言预测中的人机对齐
机构 * Psychology and Language Science, Experimental Psychology, University College London, London, UK(心理学与语言科学、实验心理学,伦敦大学学院,伦敦,英国) ; Google Deepmind, Mountain View, US(谷歌DeepMind,山景城,美国) ; Princeton Neuroscience Institute, Princeton University, Princeton, NJ, USA(普林斯顿神经科学研究所,普林斯顿大学,普林斯顿,新泽西州,美国) ; Computer Science Department, Exeter University(计算机科学系,埃克塞特大学)
AI总结 本研究通过比较五种视觉-语言模型与600名人类在视觉世界范式中的表现,发现添加视觉上下文显著提升模型与人类在预测评分上的一致性,且注意力机制而非模型规模是主要驱动因素。
Comments 39 pages, 6 Figures, published in NPJ Artificial Intelligence