SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
多重性是多模态学习中不可避免且固有的挑战
机构 * Princeton University(普林斯顿大学)
AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。
Comments ICML 2026 Position Track
神经控制:通过平衡约束的伴随学习
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 提出Neural Control框架,利用伴随方法通过平衡条件微分传播梯度,避免求解器展开,结合滚动时域延续实现长时程隐式控制,在可变形线性物体操作中验证有效性。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
径向抑制加速算法泛化:延迟泛化的几何分析
机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校)
AI总结 通过几何分析揭示交叉熵优化下隐藏表示的径向膨胀导致记忆-泛化延迟,提出径向惩罚加速泛化,在模算术和加法任务上实现最高6倍加速。
Comments 16 pages, 5 figures, 10 tables. Presented at the Workshop on High-dimensional Learning Dynamics at the 43rd International Conference on Machine Learning (ICML 2026)
保持几何的正交初始化用于RLVR中的低秩适应
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。
Comments 30 pages, accepted to ICML 2026
FLARE-AI:AI缺陷报告
AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。
Comments Accepted to ICML 2026
RaBitQCache: 面向长上下文LLM推理中KVCache的旋转二值量化
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; Peking University(北京大学)
AI总结 针对长上下文大语言模型推理中KV缓存导致的瓶颈,提出RaBitQCache框架,利用随机旋转二值量化和高效二进制-INT4算术无偏估计注意力权重,实现自适应Top-p检索,加速推理并减少内存I/O。
Comments Accept by ICML 26
TabPATE: 无需公开数据的差分隐私表格上下文学习
机构 * CISPA(CISPA亥姆霍兹信息安全中心) ; Anthropic ; Layer 6 AI
AI总结 提出TabPATE,一种无需公开数据的差分隐私PATE风格防御方法,通过教师模型分区和私有聚合生成学生上下文,在表格基准上保持可用性并将成员推断降至随机水平。
Comments Presented at the 2nd ICML Workshop on Foundation Models for Structured Data (2026)
控制混合:基于Transformer模型的状态感知微调
机构 * Qualcomm AI Research(高通人工智能研究院)
AI总结 提出Mixture-of-Control(MoC)框架,通过稀疏混合专家机制自适应融合局部和全局控制信号,增强Transformer块间信息交换,实现高效微调。
Comments ICML 2026 Workshop on Connecting Low-rank Representations in AI, CoLoRAI, 26 pages, 12 figures, 5 tables
超越二元乐器问答:探究音乐音频-语言模型中的乐器接地
AI总结 本文通过多轴诊断基准测试发现,音乐音频-语言模型在二元乐器问答中的高准确率常掩盖选项位置偏差、易混淆乐器错误和时间响应偏差等问题,表明乐器接地评估需采用多维度基准而非单一准确率。
Comments Workshop on Machine Learning for Audio, ICML 2026
重新审视体积假说
AI总结 通过复制交换Wang-Landau算法估计二元网络中的联合态密度,研究梯度学习与随机采样在泛化性能上的差异如何随训练数据量变化,发现数据量增大时梯度学习的优势减弱,从而解释了关于体积假说的矛盾实验结果。
Comments Accepted to ICML 2026
探测表格上下文学习中的记忆化
机构 * SAP SE(SAP公司)
AI总结 提出ICLMEM框架探测表格基础模型在上下文学习中的参数记忆化,发现低基数任务中存在中等记忆信号,但实际训练条件下信号消失。
Comments Accepted at 2nd ICML Workshop on Foundation Models for Structured Data, 2026
探针选择改变金丝雀记忆判定:在文本主导的LoRA微调自回归测试平台上的三个事后分歧案例研究
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Northeastern University(东北大学)
AI总结 研究在Qwen2.5-VL-7B金丝雀测试平台上,固定窗口均值NLL记忆探针与全跨度秘密NLL或贪婪精确召回之间的分歧,发现窗口截断、非秘密漂移和窗口内下降三种案例,建议报告全跨度秘密NLL、跨度局部分解、行为精确召回和诱饵探针。
Comments ICML 2026 FoGen Workshop camera-ready. 17 pages, 4 figures, 12 tables
PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; Google(谷歌) ; Snowflake
AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
Fleet: 少量样本引导的有效AI生成图像检测
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 针对AI生成图像检测中静态特征空间泛化能力不足的问题,提出动态适应框架Fleet,通过约束路由校正实现少量样本快速适应新兴生成器,在64模型基准上将性能从20.4%提升至73.1%。
Comments 25 pages, accepted by ICML 2026
压缩表示空间中的运动规划
机构 * MIT LIDS(麻省理工学院信息与决策系统实验室)
AI总结 提出一种生成式框架,通过高压缩率自编码器学习离散层级化潜在空间,并在其中直接搜索进行运动规划,兼顾灵活性与效率,无需任务特定训练。
Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning
梯度平滑:耦合逐层更新以改进优化
机构 * Vector Institute(向量研究所)
AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。
Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
安全--保真度权衡:提示注入防御的隐藏成本
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
AI总结 本文发现防御间接提示注入会损害需要保留未信任文本的任务(如翻译),引入SecFid基准衡量保真度,揭示安全与保真度之间存在权衡,且无固定防御可同时最优。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 34 pages, 4 figures
什么驱动了来自反馈的交互式改进?
机构 * University of Warsaw(华沙大学) ; AKCES NCBR ; Princeton University(普林斯顿大学) ; Mistral AI ; Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)
AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。
Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026
基于加速度计的心血管代谢风险数字生物标志物:一个具有不确定性量化的群体代表性表格基准
机构 * SIIAM, Rome, Italy(意大利罗马SIIAM)
AI总结 基于NHANES 2003-2006数据构建加速度计心血管代谢基准,评估三种表格学习方法预测HbA1c、甘油三酯和CRP的性能,并应用分裂共形预测进行不确定性量化与公平性分析。
Comments Accepted at the SD4H Workshop at ICML 2026
深度神经网络的低维拓扑
机构 * University of Chicago(芝加哥大学)
AI总结 通过限制每层宽度为3,研究前馈网络、ResNet和Transformer如何改变低维拓扑不变量(如环绕数),揭示不同架构的表达能力差异。
Comments Accepted at ICML 2026
PerceptionRubrics:将多模态评估校准至人类感知
机构 * Johns Hopkins University(约翰霍普金斯大学) ; StepFun ; Tsinghua University(清华大学) ; Independent Researcher(独立研究者)
AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。
Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics
大小无关:余弦评分稀疏自编码器
AI总结 针对稀疏自编码器中内积评分受输入范数干扰的问题,提出余弦评分方法,使特征检测更关注方向对齐,实验表明该方法能更频繁地学习到人类可识别的概念。
Journal ref ICML 2026, Spotlight at the Mechanistic Interpretability Workshop
何时重新规划:分层潜在推理中的子目标持久性
机构 * Independent Researcher(独立研究者)
AI总结 研究分层潜在推理中稳定性与适应性的权衡,通过封建式管理-工人接口控制子目标持久周期,发现中等周期(3-6步)最优,内在对齐权重存在窄最优值(约0.05)。
Comments Accepted at the Workshop on Compositional Learning: Safety, Interpretability, and Agents (CompLearn), ICML 2026. 10 pages, 2 figures
Stable-GFlowNet: 通过对比轨迹平衡实现多样且鲁棒的LLM红队测试
机构 * Naver AI Lab(Naver AI实验室)
AI总结 针对大语言模型红队测试中有效性与多样性难以兼顾的问题,提出Stable-GFlowNet方法,通过消除配分函数估计和对比轨迹平衡实现稳定训练,在保持最优策略的同时提升攻击性能与多样性。
Comments ICML 2026 Spotlight
稳定且近可逆的图像编辑扩散ODE求解器
机构 * Department of Computing, Imperial College London, London, United Kingdom(帝国理工学院伦敦分校计算机系,伦敦,英国) ; Department of Mathematics, Imperial College London, London, United Kingdom(帝国理工学院伦敦分校数学系,伦敦,英国)
AI总结 本文提出近可逆Runge-Kutta方法以提升图像编辑的稳定性与精度,平衡可逆性与数值稳定性,保留背景保真优势。
Comments ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
共享的词汇任务表示解释了大语言模型中的行为变异
机构 * Brown University(布朗大学) ; MIT(麻省理工学院) ; Northeastern University(东北大学)
AI总结 研究通过比较指令式和示例式提示发现,大语言模型在不同提示下行为差异可由共享的词汇任务表示解释,揭示了任务特定注意力头在不同提示风格中的共同机制。
Comments Accepted to ICML 2026. Updated to the camera-ready version
如果我们在测试时动态分配计算资源呢?
机构 * Stanford University(斯坦福大学) ; University of Oklahoma(俄克拉荷马大学) ; University of California Riverside(加州大学河滨分校) ; National University of Sciences and Technology(国立科技大学)
AI总结 本文提出了一种基于验证器的自适应框架,通过迭代轨迹生成与选择提升推理效率,在多个数据集上优于传统测试时缩放方法。
Comments International Conference on Machine Learning
超越标量奖励:面向序列社会困境的LLM策略合成中的密集反馈
机构 * Komorebi AI Technologies(Komorebi AI技术公司)
AI总结 本研究通过反馈工程,比较稀疏奖励与密集社会指标反馈对LLM在多智能体环境中生成程序化策略的影响,发现密集反馈能打破奖励别名,提升策略性能。
Comments Accepted to NExT-Game 2026: New Frontiers in Game-Theoretic Learning, ICML 2026 Workshop. Camera-ready version
语言统计中的对称性塑造了模型表示的几何结构
机构 * UC Berkeley(加州大学伯克利分校) ; EPFL(瑞士联邦理工学院洛桑分校) ; Johns Hopkins(约翰斯·霍普金斯大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文证明语言统计中的平移对称性(如月份共现频率仅取决于时间间隔)决定了词嵌入模型的高维几何结构,并推导出表示流形的解析形式,该几何在统计扰动下仍保持鲁棒。
Comments ICML 2026