ResearchGym: Evaluating Language Model Agents on Real-World AI Research
ResearchGym: 在真实世界人工智能研究中评估语言模型代理
AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。
Comments ICLR 2026 Agents in the Wild Workshop
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
ResearchGym: 在真实世界人工智能研究中评估语言模型代理
AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。
Comments ICLR 2026 Agents in the Wild Workshop
GTR-Bench:评估视觉-语言模型中的地理时间推理
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Peking University(北京大学) ; Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。
Comments ICLR 2026, 31 pages, 20 figures
通过离散扩散发散指导实现超快语言生成
AI总结 DiDi-Instruct通过离散扩散发散指导实现高效语言生成,提供高达64倍的加速,同时保持高质量输出。
Comments [ICLR 2026] 38 pages, 7 figures, 13 tables
金字塔补丁化流用于视觉生成
AI总结 本研究提出金字塔补丁化流方法,通过动态调整补丁大小和线性投影提升视觉生成效率与性能。
Comments ICLR 2026
3DGEER:为通用相机实现精确且高效的3D高斯渲染
机构 * Bosch Research North America(博世北美研究部) ; Bosch Center for AI(博世人工智能中心)
AI总结 3DGEER提出了一种几何精确且高效的3D高斯渲染框架,通过闭合表达式实现精确渲染和优化,并在通用相机上实现了实时高效和高精度的光场渲染。
Comments Published at ICLR 2026. Code is available at: https://github.com/boschresearch/3dgeer
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
扩散混合:用于扩散模型的推理时间多偏好对齐
机构 * Texas A&M University(德克萨斯大学阿姆斯特朗分校) ; Qualcomm AI Research(高通人工智能研究)
AI总结 扩散混合通过混合反向扩散过程实现推理时间多偏好对齐,提升用户驱动的图像生成性能。
Comments Accepted at ICLR 2026
AudioTrust: 音频大语言模型多维可信度基准测试
AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。
Comments Accepted to ICLR 2026
GTM:一种通用时间序列模型,用于增强时间序列数据的表示学习
AI总结 GTM通过频域注意力机制和混合遮蔽策略提升时间序列表示学习,实现跨生成任务的泛化能力。
Comments 10 pages main text, 20 pages appendix. Accepted at ICLR 2026
LiTo: 表面光场令牌化
AI总结 LiTo通过联合建模几何和视点依赖外观,利用表面光场生成高质量3D物体,提升光照和材料一致性。
Comments ICLR 2026; Project page: https://apple.github.io/ml-lito/
学习强化学习无法做到的:用于最难问题的交错在线微调
机构 * Peking University(北京大学) ; Zhongguancun Academy(中关村学院) ; Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) ; Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)
AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。
Comments 12 pages, 5 figures
Journal ref ICLR 2026
深度语音去噪模型是否对对抗噪声具有鲁棒性?
机构 * University of Massachusetts(马萨诸塞大学) ; Dolby Laboratories(杜比实验室)
AI总结 研究发现深度语音去噪模型对特定类型的对抗噪声缺乏鲁棒性,需采取实际防护措施以确保安全应用。
Comments 22 pages, 14 figures. Related conference version accepted to ICLR 2026: see https://openreview.net/forum?id=WtH2JxKJKf
LookaheadKV: 通过不生成未来预览实现快速且准确的KV缓存淘汰
机构 * Samsung Research(三星研究院)
AI总结 LookaheadKV通过无需显式生成未来响应的轻量级框架,实现高效准确的KV缓存淘汰,减少淘汰成本并提升推理速度。
Comments ICLR 2026
动态预测采样用于主动强化学习微调大推理模型
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。
Comments Accepted to ICLR 2026
通过扩散引导的潜在优化进行蛋白质反事实
机构 * Machine Learning Group, Technische Universität Berlin(技术大学柏林机器学习组) ; Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所(BIFOLD)) ; BASF Digital Solutions GmbH(巴斯夫数字解决方案有限公司)
AI总结 MCCOP通过扩散引导的潜在优化生成蛋白质反事实,用于预测和改进蛋白质特性。
Comments 16 pages, 7 figures, accepted at the Gen2 Workshop at ICLR 2026
基于情境学习的领域感知金融波动预测
机构 * Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系) ; Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
AI总结 本文提出一种基于情境学习的领域感知金融波动预测方法,通过条件采样策略提升非平稳市场下的预测性能。
Comments 11 pages, 1 figure, Published as a conference paper at ICLR 2026 Workshop on Advances in Financial AI
基于几何的数据库比较的GSVD:一个对齐角度就足够
机构 * Institute of Computing, UFRJ(计算学院,UFRJ) ; Institute of Mathematics, UFRJ(数学学院,UFRJ)
AI总结 本文提出基于GSVD的几何对齐角度方法,用于比较数据集,通过角度分数量化样本解释来源,提供可解释的几何诊断工具。
Comments 20 pages, GRaM workshop ICLR 2026
ReMix:用于LoRAs混合的强化路由
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta AI ; Washington University St. Louis(华盛顿大学圣路易斯分校)
AI总结 ReMix通过引入不可学习的路由权重和强化学习技术,改进了混合LoRAs模型的路由机制,提升了模型的表达能力和微调效果。
Comments LLA @ ICLR 2026
ES-dLLM:通过早期跳过实现扩散大语言模型的高效推理
AI总结 ES-dLLM通过早期跳过技术提升扩散大语言模型的推理效率,实现高达16.8倍的加速效果。
Comments Accepted at ICLR 2026
深入挖掘:学习多级概念层次结构
AI总结 本文提出多级概念分割和深度HiCEMs,通过仅使用顶层监督发现多级概念层次结构,并在多个抽象层次上进行干预,提升模型的可解释性和任务性能。
Comments Accepted to the ICLR 2026 Workshop on Principled Design for Trustworthy AI
拆解Chronos:稀疏自编码器揭示时间序列基础模型中的因果特征层次
机构 * Rochester Institute of Technology(罗切斯特理工学院)
AI总结 本文通过稀疏自编码器揭示时间序列基础模型中的因果特征层次,发现中编码器的特征对预测质量影响最大,表明Chronos-T5依赖突变动态而非周期性模式识别。
Comments Accepted as a poster in ICLR 2026 Workshop on Time Series in the Age of Large Models (TSALM)
重新审视锐度感知最小化:一种更忠实且有效的实现
机构 * Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉研究重点实验室)
AI总结 本文提出XSAM,通过显式估计最大值方向和优化搜索空间,改进了锐度感知最小化方法,提升了模型泛化能力。
Comments Published as a conference paper at ICLR 2026
LCA:连续学习中的局部分类器对齐
AI总结 LCA通过局部分类器对齐方法,解决连续学习中分类器与骨干网络的不匹配问题,提升模型的泛化能力和鲁棒性。
Comments Accepted to the International Conference on Learning Representations (ICLR 2026)
通过对角蒸馏实现流式自回归视频生成
机构 * South China University of Technology(南方科技大学) ; Westlake University(西湖大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Merced(加州大学默塞德分校) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。
Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)
变换器中的自适应循环与记忆:更努力思考还是更了解更多?
机构 * Lamarr Institute(拉马尔研究所) ; Fraunhofer IAIS(弗劳恩霍夫 IAIS 研究所) ; University of Bonn(波恩大学)
AI总结 本研究提出结合自适应循环和门控记忆的变换器模型,提升数学推理和常识任务性能。
Comments Published at Latent & Implicit Thinking Workshop @ ICLR 2026
ConfHit: 无Oracle保证的符合生成设计
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) ; Department of Statistics and Data Science, Wharton School, University of Pennysylvania(宾夕法尼亚大学沃顿商学院统计与数据科学系)
AI总结 ConfHit通过无Oracle保证的符合生成设计框架,在多个置信水平下提供有效的覆盖保证,同时保持紧凑的认证集,为生成建模提供可靠的方法。
Comments Accepted at ICLR 2026
SEED-SET: 可扩展的演进实验设计用于系统层面的伦理测试
AI总结 SEED-SET通过结合客观评估和主观价值判断,提供了一种高效的伦理测试方法,生成更优的测试候选者并提高高维搜索空间的覆盖范围。
Comments 10 main pages along with Appendix containing additional results, manuscript accepted in ICLR 2026
CARE:迈向多模态医学推理中的临床问责的证据基础代理框架
机构 * Microsoft Research Asia(微软亚洲研究院) ; Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) ; Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)
AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。
Comments Accepted by ICLR 2026
AMLRIS: 基于对齐感知的掩码学习用于提及图像分割
AI总结 AMLRIS通过基于对齐感知的掩码学习策略,提升提及图像分割的性能与鲁棒性。
Comments ICLR 2026 conference paper
通过定向技能图和选择性适应在动作RPG中学习可转移的技能
机构 * Sharif University of Technology(沙斐大学)
AI总结 本文提出通过定向技能图和选择性适应方法,在动作RPG中实现技能的可转移学习,提高样本效率和适应性。
Comments 5 pages
Journal ref Lifelong Agent Workshop at ICLR 2026
AFTER: 通过自适应事实引导激活编辑缓解LVLM中的对象幻觉
AI总结 AFTER通过自适应事实引导激活编辑缓解LVLM中的对象幻觉,显著降低幻觉发生率。
Journal ref ICLR 2026