arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9455
2312.08531 2026-03-20 cs.LG math.OC stat.ML

Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods

重新审视随机梯度方法的最后迭代收敛性

Zijian Liu, Zhengyuan Zhou

机构 * Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 本文研究随机梯度方法的最后迭代收敛性,提出统一证明方法,适用于一般领域、复合目标、非欧几里得范数、Lipschitz条件、光滑性和强凸性,并扩展到重尾和亚Weibull噪声。

Comments The preliminary version has been accepted at ICLR 2024. For the update history, please refer to the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18571 2026-03-20 cs.AI cs.CE q-bio.QM

CAPSUL: A Comprehensive Human Protein Benchmark for Subcellular Localization

CAPSUL:一个全面的人类蛋白质基准用于亚细胞定位

Yicheng Hu, Xinyu Lin, Shulin Li, Wenjie Wang, Fengbin Zhu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 CAPSUL基准通过整合多样化3D结构表示和精细亚细胞定位注释,推动结构基模型在亚细胞定位任务中的应用,展示了结构特征的重要性,并通过高尔基体案例研究揭示了α-螺旋在定位中的关键作用。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18426 2026-03-20 cs.AI

Prune-then-Quantize or Quantize-then-Prune? Understanding the Impact of Compression Order in Joint Model Compression

先剪枝后量化还是先量化后剪枝?理解联合模型压缩中压缩顺序的影响

Minjun Kim, Jaehyeon Choi, Hyunwoo Yang, Jongjin Kim, Jinho Song, U Kang

机构 * Seoul National University(首尔国立大学)

AI总结 本文研究了联合模型压缩中压缩顺序对性能的影响,提出渐进强度假说并提供理论和实验验证,证明顺序优化能提升模型效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18423 2026-03-20 cs.CV

SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning

SynQ:通过合成感知微调实现准确的零样本量化

Minjun Kim, Jongjin Kim, U Kang

机构 * Seoul National University(首尔国立大学)

AI总结 SynQ通过合成感知微调解决零样本量化中合成数据噪声、目标模式预测和错误标签误导问题,提升模型精度。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18017 2026-03-20 cs.LG cs.CL

Frayed RoPE and Long Inputs: A Geometric Perspective

断裂的RoPE与长输入:一种几何视角

Davis Wertheimer, Aozhong Zhang, Derrick Liu, Penghang Yin, Naigang Wang

机构 * IBM Research(IBM研究院) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

AI总结 本文从几何角度分析RoPE在长输入下的问题,发现注意力机制导致键和查询向量紧密聚类,而RoPE在长输入时破坏这种聚类,产生病态行为。提出RoPE-ID方法通过高频率应用部分通道解决此问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00053 2026-03-20 cs.LG cs.AI stat.ML

Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models

二次直接预报用于训练多步时间序列预测模型

Hao Wang, Licheng Pan, Yuan Lu, Zhichao Chen, Tianqiao Liu, Shuting He, Zhixuan Chu, Qingsong Wen, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) College of Engineering, Purdue University(普渡大学工程学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Squirrel AI Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08882 2026-03-20 cs.LG

An Improved Model-Free Decision-Estimation Coefficient with Applications in Adversarial MDPs

一种改进的无模型决策-估计系数及其在对抗性MDPs中的应用

Haolin Liu, Chen-Yu Wei, Julian Zimmert

机构 * University of Virginia(弗吉尼亚大学) Google Research(谷歌研究)

AI总结 本文提出Dig-DEC,一种无模型的决策-估计系数,通过信息增益驱动探索,解决了对抗性MDP中的再生问题,并改进了函数估计过程的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02460 2026-03-20 cs.CV

GenCompositor: Generative Video Compositing with Diffusion Transformer

GenCompositor:基于扩散变换器的生成视频合成

Shuzhou Yang, Xiaoyu Li, Xiaodong Cun, Guangzhi Wang, Lingen Li, Ying Shan, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) GVC Lab, Great Bay University(Great Bay大学GVC实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17946 2026-03-19 cs.LG cs.AI

CARE: Covariance-Aware and Rank-Enhanced Decomposition for Enabling Multi-Head Latent Attention

CARE: 一种考虑协方差和增强秩的分解方法,以实现多头潜在注意力

Zhongzhu Zhou, Fengxiang Bie, Ziyan Chen, Zhenyu Zhang, Yibo Yang, Junxiong Wang, Ben Athiwaratkun, Xiaoxia Wu, Shuaiwen Leon Song

机构 * University of Sydney(悉尼大学) King Abdullah University of Science and Technology(卡布斯大学) Together AI University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 CARE通过考虑激活协方差和增强秩,改进了多头潜在注意力的转换,减少了KV缓存成本并提升了表达能力,实验表明其在多个模型上表现更优。

Comments Accepted at ICLR 2026. Conference paper. 10 pages main text; 34 pages total including references and appendix. 11 figures and 20 tables in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05089 2026-03-19 cs.CR cs.LG cs.RO

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

警惕不可信的模拟器 -- 强化学习中的无奖励后门攻击

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato

机构 * Khoury College of Computer Sciences(计算机科学学院)

AI总结 本文提出一种新型攻击'Daze',通过模拟器动态在强化学习代理中隐秘植入动作级后门,无需修改或观察奖励,证明其在通用RL任务中的有效性,并展示其在机器人硬件上的迁移。

Comments 10 pages main body, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22621 2026-03-19 cs.LG cs.AI cs.CL

IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning

IA2: 通过ICL激活实现对监督微调的改进

Aayush Mishra, Daniel Khashabi, Anqi Liu

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

AI总结 本文提出IA2方法,通过利用ICL的激活模式提升监督微调的准确性和校准性,在12个基准和两个模型家族中验证了其有效性。

Comments International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08460 2026-03-19 cs.LG cs.AI cs.RO

MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning

MOBODY:基于模型的非动态离线强化学习

Yihong Guo, Yu Yang, Pan Xu, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学)

AI总结 MOBODY通过学习目标动态过渡探索目标领域,优化策略以避免仅依赖低动态位移过渡,提升在显著动态位移或最优轨迹不在低位移区域的场景中的性能。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11611 2026-03-19 cs.AI cs.CL cs.CR

Signal in the Noise: Polysemantic Interference Transfers and Predicts Cross-Model Influence

噪声中的信号:多义干扰转移和跨模型影响预测

Bofan Gong, Shiyang Lai, James Evans, Dawn Song

机构 * Independent Scholar(独立学者) University of Chicago(芝加哥大学) UC Berkeley(伯克利大学)

AI总结 研究通过稀疏自编码器揭示语言模型中的多义性结构,并发现干预措施在不同模型间可转移,挑战了多义性仅为随机现象的观点。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17172 2026-03-19 cs.LG

Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges

噪声响应校准:一种用于LLM判官的因果干预协议

Maxim Khomiakov, Jes Frellsen

机构 * Technical University of Denmark(丹麦技术大学) Normal Computing Corporation(Normal Computing公司) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

AI总结 本文提出基于受控输入干预的校准协议,通过信号噪声比扰动和词法扰动评估LLM判官在不同模态下的表现,揭示了文本与表格数据在噪声下的差异行为。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17075 2026-03-19 cs.LG cs.AI cs.CC

CircuitBuilder: From Polynomials to Circuits via Reinforcement Learning

CircuitBuilder: 通过强化学习从多项式到电路

Weikun K. Zhang, Rohan Pandey, Bhaumik Mehta, Kaijie Jin, Naomi Morato, Archit Ganapule, Michael Ruofan Zeng, Jarod Alper

机构 * University of Washington(华盛顿大学)

AI总结 研究通过强化学习发现高效算术电路计算多项式的问题,比较PPO+MCTS和SAC方法,SAC在双变量目标上表现最佳,PPO+MCTS能扩展到三变量并提升更难实例性能。

Comments ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10489 2026-03-19 cs.LG cs.AI

Learning Adaptive Distribution Alignment with Neural Characteristic Function for Graph Domain Adaptation

基于神经特征函数的自适应分布对齐用于图域适应

Wei Chen, Xingyu Guo, Shuang Li, Zhao Zhang, Yan Zhong, Fuzhen Zhuang, Deqing wang

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Mathematical Sciences, Peking University(北大数学系) Zhongguancun Laboratory(中关村实验室)

AI总结 本文提出ADAlign框架,通过自适应分布对齐解决图域适应中的分布偏移问题,利用神经谱差异衡量跨图偏移,实现灵活且鲁棒的域适应。

Comments Accepted by ICLR 2026, 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05960 2026-03-19 cs.CL

Distilling Feedback into Memory-as-a-Tool

将反馈转化为记忆-as-a-工具

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

AI总结 本文提出通过文件式记忆系统和智能体控制的工具调用来将临时批评转化为可检索的指导方针,从而降低推理时间的推理成本。在Rubric Feedback Bench数据集上实验表明,增强型LLM在测试时能快速匹配精炼管道性能,同时大幅降低推理成本。

Comments Code: https://github.com/vicgalle/feedback-memory-as-a-tool Data: https://huggingface.co/datasets/vicgalle/rubric-feedback-bench

Journal ref ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13872 2026-03-19 cs.LG cs.AI

Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation

通过对抗训练实现可扩展的能量模型:统一判别与生成

Xuwang Yin, Claire Zhang, Julie Steele, Nir Shavit, Tony T. Wang

机构 * MIT(麻省理工学院)

AI总结 本文提出一种结合对抗训练的框架,解决传统能量模型在稳定性与生成质量上的不足,实现高分辨率数据集上的高效判别与生成性能。

Comments Published at ICLR 2026. Code: https://github.com/xuwangyin/DAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09259 2026-03-19 cs.CL cs.AI cs.LG

Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models

在大型语言模型后训练强化学习中检测数据污染

Yongding Tao, Tian Wang, Yihong Dong, Huanyu Liu, Kechi Zhang, Xiaolong Hu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) New H3C Technologies Co., Ltd(新华H3C技术有限公司)

AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。

Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04072 2026-03-19 cs.LG cs.AI cs.CL stat.ML

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

慢-快策略优化:在更新前重新定位用于大语言模型推理

Ziyan Wang, Zheng Wang, Xingwei Qu, Qi Cheng, Jie Fu, Shengpu Tang, Minjia Zhang, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Manchester(曼彻斯特大学) NVIDIA Independent(独立) Emory University(埃默里大学)

AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24067 2026-03-19 cs.LG cs.AI

In-Context Compositional Q-Learning for Offline Reinforcement Learning

上下文组合Q学习用于离线强化学习

Qiushui Xu, Yuhao Huang, Yushu Jiang, Lei Song, Jinyu Wang, Wenliang Zheng, Jiang Bian

机构 * Penn State University(宾夕法尼亚州立大学) Nanjing University(南京大学) University of Toronto(多伦多大学) Microsoft Research(微软研究院)

AI总结 本文提出ICQL框架,通过上下文推理问题建模Q学习,利用线性Transformer适应性推断局部Q函数,实现有界近似误差和近优策略提取,实验显示在厨房任务中性能提升达16.4%。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14576 2026-03-19 cs.LG cs.AI

SocialJax: An Evaluation Suite for Multi-agent Reinforcement Learning in Sequential Social Dilemmas

SocialJax: 多智能体强化学习中序列社会困境的评估套件

Zihao Guo, Shuqing Shi, Richard Willis, Tristan Tomilin, Joel Z. Leibo, Yali Du

机构 * King’s College London(伦敦国王学院) Eindhoven University of Technology(埃因霍温理工大学) The Alan Turing Institute(艾伦·图灵研究所) Google DeepMind(谷歌DeepMind)

AI总结 本文提出SocialJax,一个用于多智能体强化学习中序列社会困境的评估套件,通过JAX实现高效环境与算法,实验显示其在实时性能上比Melting Pot RLlib快50倍,并验证了基线算法的有效性及环境的社会困境特性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07147 2026-03-19 cs.CL cs.LG

QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources

量子化全参数微调:在低成本资源下对大语言模型的全参数微调

Zhikai Li, Xiaoxuan Liu, Banghua Zhu, Zhen Dong, Qingyi Gu, Kurt Keutzer

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出QFT框架,通过将训练状态量化为INT8格式,减少内存占用,实现低成本全参数微调。采用Lion优化器和混合特征量化器,确保训练性能,使LLaMA-7B模型在A6000 GPU上仅需<30GB内存。

Comments ICLR 2026 Workshop on Scaling Post-training for LLMs (SPOT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02786 2026-03-18 cs.LG

When Machine Learning Gets Personal: Evaluating Prediction and Explanation

当机器学习变得个性化:评估预测与解释

Louisa Cornelis, Guillermo Bernárdez, Haewon Jeong, Nina Miolane

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

AI总结 本文探讨了个性化模型对预测和解释的影响,提出统一框架量化个性化对两者的影响,并通过实证分析揭示了数据集统计对测试效果的限制。

Comments 48 pages, 13 figures, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16158 2026-03-18 cs.LG

Execution-Grounded Credit Assignment for GRPO in Code Generation

基于执行的信用分配用于代码生成中的GRPO

Abhijit Kumar, Natalya Kumar, Shikhar Gupta

机构 * ICLR 2026 Workshop on Scaling Post-Training for LLMs (SPOT)(ICLR 2026 工作组:扩大训练后大语言模型(SPOT))

AI总结 本文提出基于执行的信用分配方法EGCA,通过执行轨迹局部化GRPO更新,提升代码生成的单元测试通过率,实验表明在HumanEval和MBPP数据集上效果优于GRPO。

Comments Accepted at SPOT ICLR 2026 (https://openreview.net/forum?id=nqkVB5EVXJ)

详情

展开后加载摘要…

URL PDF HTML 收藏