arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-18 至 2026-03-18 共收录 21
2502.02786 2026-03-18 cs.LG

When Machine Learning Gets Personal: Evaluating Prediction and Explanation

当机器学习变得个性化:评估预测与解释

Louisa Cornelis, Guillermo Bernárdez, Haewon Jeong, Nina Miolane

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

AI总结 本文探讨了个性化模型对预测和解释的影响,提出统一框架量化个性化对两者的影响,并通过实证分析揭示了数据集统计对测试效果的限制。

Comments 48 pages, 13 figures, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16158 2026-03-18 cs.LG

Execution-Grounded Credit Assignment for GRPO in Code Generation

基于执行的信用分配用于代码生成中的GRPO

Abhijit Kumar, Natalya Kumar, Shikhar Gupta

机构 * ICLR 2026 Workshop on Scaling Post-Training for LLMs (SPOT)(ICLR 2026 工作组:扩大训练后大语言模型(SPOT))

AI总结 本文提出基于执行的信用分配方法EGCA,通过执行轨迹局部化GRPO更新,提升代码生成的单元测试通过率,实验表明在HumanEval和MBPP数据集上效果优于GRPO。

Comments Accepted at SPOT ICLR 2026 (https://openreview.net/forum?id=nqkVB5EVXJ)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16127 2026-03-18 cs.CL cs.LG

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

在不使用学习率衰减的情况下预训练LLM增强了监督微调

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

机构 * Tohoku University(东大大学)

AI总结 本文研究了学习率调度在大语言模型预训练中的作用,发现不使用衰减的学习率调度在监督微调后表现更优,且损失景观分析显示其保持更平坦的最小值以支持适应性。

Comments 25 pages, accepted by ICLR 2026 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15957 2026-03-18 cs.LG

GASP: Guided Asymmetric Self-Play For Coding LLMs

GASP:指导性的非对称自我对弈用于编码大语言模型

Swadesh Jana, Cansu Sancaktar, Tomáš Daniš, Georg Martius, Antonio Orvieto, Pavel Kolev

机构 * University of Tübingen(图宾根大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 GASP通过引入真实数据目标问题,改进了非对称自我对弈方法,提升了LiveCodeBench上的pass@20指标,并解决了其他方法无法达到的难题。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026) as Spotlight, and ICLR 2026 Workshop on Lifelong Agents (LLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15923 2026-03-18 stat.ML cs.LG

Learning to Recall with Transformers Beyond Orthogonal Embeddings

基于非正交嵌入的Transformer学习回忆

Nuri Mert Vural, Alberto Bietti, Mahdi Soltanolkotabi, Denny Wu

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所) Flatiron Institute(Flatiron研究所) University of Southern California(南加州大学) New York University and Flatiron Institute(纽约大学和Flatiron研究所)

AI总结 本文研究了在非正交嵌入条件下,单层Transformer在简单token检索任务中的存储容量,揭示了样本量、嵌入维度和序列长度之间的乘积关系。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15857 2026-03-18 cs.AI cs.LG cs.RO

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

正则化潜在动态预测是行为基础模型的强基线

Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

机构 * Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文探讨零样本强化学习中复杂表征学习目标的必要性,提出正则化潜在动态预测方法,通过正则化保持特征多样性,优于现有方法,并在低覆盖场景中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13972 2026-03-18 cs.LG cs.CV physics.med-ph

Distributional Consistency Loss: Beyond Pointwise Data Terms in Inverse Problems

分布一致性损失:逆问题中超越点wise数据项

George Webber, Andrew J. Reader

AI总结 本文提出分布一致性损失,通过评估观测数据与噪声分布的一致性,避免过拟合噪声,提升图像去噪和医学图像重建性能。

Comments Author's accepted version (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06122 2026-03-18 cs.LG stat.ML

PolyGraph Discrepancy: a classifier-based metric for graph generation

图生成的PolyGraph偏差:基于分类器的度量方法

Markus Krimmel, Philip Hartout, Karsten Borgwardt, Dexiong Chen

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

AI总结 本文提出PolyGraph Discrepancy,通过二分类器近似图分布的Jensen-Shannon距离,提供更稳健的图生成模型评估方法。

Comments Camera-ready version published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26307 2026-03-18 cs.LG

Attribution-Guided Decoding

基于归因的解码

Piotr Komorowski, Elena Golimblevskaia, Reduan Achtibat, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

AI总结 本文提出基于归因的解码方法AGD,通过引导生成过程以提升指令遵循、知识密集型任务的准确性和可靠性,同时减少计算开销。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25140 2026-03-18 cs.AI cs.CL

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19476 2026-03-18 cs.LG

LogicXGNN: Grounded Logical Rules for Explaining Graph Neural Networks

LogicXGNN: 基于逻辑规则的图神经网络解释方法

Chuqin Geng, Ziyu Zhao, Zhaoyue Wang, Haolin Ye, Yuhe Jiang, Xujie Si

机构 * University of Toronto(多伦多大学)

AI总结 LogicXGNN通过构建逻辑规则提升图神经网络解释的可信度和可解释性,提出数据驱动的 fidelity 指标并显著提升解释质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21271 2026-03-18 cs.CL cs.AI

EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation

EoRA: 无需微调的压缩LLM补偿方法

Shih-Yang Liu, Maksim Khadkevich, Nai Chit Fung, Charbel Sakr, Chao-Han Huck Yang, Chien-Yi Wang, Saurav Muralidharan, Hongxu Yin, Kwang-Ting Cheng, Jan Kautz, Yu-Chiang Frank Wang, Pavlo Molchanov, Min-Hung Chen

AI总结 EoRA提出一种无需微调的压缩LLM补偿方法,通过低秩矩阵增强模型性能,实现准确率与计算开销的灵活平衡,优于现有方法,显著提升压缩模型的准确率。

Comments ICLR 2026 workshops. Code: https://github.com/NVlabs/EoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15840 2026-03-18 cs.LG cs.AI cs.CL stat.ML

When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making

当稳定性失效:在数据受限的科学决策中LLM的隐藏故障模式

Nazia Riasat

机构 * North Dakota State University(北达科他州立大学)

AI总结 研究揭示LLM在数据受限科学决策中稳定性不足的问题,通过控制评估框架发现其在正确性、提示敏感性和输出有效性方面的缺陷。

Comments 13 pages, 5 figures. Accepted at ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB 2026). OpenReview: https://openreview.net/pdf?id=vf8vs2ibso

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15658 2026-03-18 cs.AI cs.CL cs.IR

Did You Check the Right Pocket? Cost-Sensitive Store Routing for Memory-Augmented Agents

你检查了正确的口袋吗?面向内存增强代理的成本敏感存储路由

Madhava Gaikwad

机构 * ICLR 2026 Workshop on Memory and State in LLM-Based Agents(ICLR 2026 记忆与状态在大语言模型代理中的工作坊)

AI总结 本文提出通过成本敏感存储路由优化内存增强代理的检索效率,通过覆盖、精确匹配和令牌效率指标评估,证明选择性检索能提升效率和性能,推动了可扩展多存储系统的 learned routing 机制发展。

Comments accepted in ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15642 2026-03-18 cs.AI

CraniMem: Cranial Inspired Gated and Bounded Memory for Agentic Systems

CraniMem:受大脑启发的门控和有界的记忆用于智能体系统

Pearl Mody, Mihir Panchal, Rishit Kar, Kiran Bhowmick, Ruhina Karani

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉萨·吉文拉尔·桑格维工程学院)

AI总结 CraniMem通过门控和有界多阶段记忆设计提升智能体在长期任务中的稳定性与鲁棒性,采用目标条件门控和效用标签结合短期缓冲和长期知识图谱,实现更持久的语义记忆与更小的干扰影响。

Comments International Conference on Learning Representations 2026 Workshop on Memory for LLM-Based Agentic Systems (MemAgents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14805 2026-03-18 cs.PL cs.AI

Sharing State Between Prompts and Programs

在提示和程序之间共享状态

Ellie Y. Cheng, Logan Weber, Tian Jin, Michael Carbin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出共享程序状态抽象,使提示可直接访问程序变量并实现控制流,通过Nightjar系统验证了其在任务准确性和代码效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏