arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9455
2603.16127 2026-03-18 cs.CL cs.LG

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

在不使用学习率衰减的情况下预训练LLM增强了监督微调

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

机构 * Tohoku University(东大大学)

AI总结 本文研究了学习率调度在大语言模型预训练中的作用,发现不使用衰减的学习率调度在监督微调后表现更优,且损失景观分析显示其保持更平坦的最小值以支持适应性。

Comments 25 pages, accepted by ICLR 2026 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15957 2026-03-18 cs.LG

GASP: Guided Asymmetric Self-Play For Coding LLMs

GASP:指导性的非对称自我对弈用于编码大语言模型

Swadesh Jana, Cansu Sancaktar, Tomáš Daniš, Georg Martius, Antonio Orvieto, Pavel Kolev

机构 * University of Tübingen(图宾根大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 GASP通过引入真实数据目标问题,改进了非对称自我对弈方法,提升了LiveCodeBench上的pass@20指标,并解决了其他方法无法达到的难题。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026) as Spotlight, and ICLR 2026 Workshop on Lifelong Agents (LLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15923 2026-03-18 stat.ML cs.LG

Learning to Recall with Transformers Beyond Orthogonal Embeddings

基于非正交嵌入的Transformer学习回忆

Nuri Mert Vural, Alberto Bietti, Mahdi Soltanolkotabi, Denny Wu

机构 * University of Toronto and Vector Institute(多伦多大学和向量研究所) Flatiron Institute(Flatiron研究所) University of Southern California(南加州大学) New York University and Flatiron Institute(纽约大学和Flatiron研究所)

AI总结 本文研究了在非正交嵌入条件下,单层Transformer在简单token检索任务中的存储容量,揭示了样本量、嵌入维度和序列长度之间的乘积关系。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15857 2026-03-18 cs.AI cs.LG cs.RO

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

正则化潜在动态预测是行为基础模型的强基线

Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

机构 * Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文探讨零样本强化学习中复杂表征学习目标的必要性,提出正则化潜在动态预测方法,通过正则化保持特征多样性,优于现有方法,并在低覆盖场景中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13972 2026-03-18 cs.LG cs.CV physics.med-ph

Distributional Consistency Loss: Beyond Pointwise Data Terms in Inverse Problems

分布一致性损失:逆问题中超越点wise数据项

George Webber, Andrew J. Reader

AI总结 本文提出分布一致性损失,通过评估观测数据与噪声分布的一致性,避免过拟合噪声,提升图像去噪和医学图像重建性能。

Comments Author's accepted version (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06122 2026-03-18 cs.LG stat.ML

PolyGraph Discrepancy: a classifier-based metric for graph generation

图生成的PolyGraph偏差:基于分类器的度量方法

Markus Krimmel, Philip Hartout, Karsten Borgwardt, Dexiong Chen

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

AI总结 本文提出PolyGraph Discrepancy,通过二分类器近似图分布的Jensen-Shannon距离,提供更稳健的图生成模型评估方法。

Comments Camera-ready version published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26307 2026-03-18 cs.LG

Attribution-Guided Decoding

基于归因的解码

Piotr Komorowski, Elena Golimblevskaia, Reduan Achtibat, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

AI总结 本文提出基于归因的解码方法AGD,通过引导生成过程以提升指令遵循、知识密集型任务的准确性和可靠性,同时减少计算开销。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25140 2026-03-18 cs.AI cs.CL

ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory

ReasoningBank: 通过推理记忆扩展智能体自我进化

Siru Ouyang, Jun Yan, I-Hung Hsu, Yanfei Chen, Ke Jiang, Zifeng Wang, Rujun Han, Long T. Le, Samira Daruki, Xiangru Tang, Vishy Tirumalashetty, George Lee, Mahsan Rofouei, Hangfei Lin, Jiawei Han, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究) Yale University(耶鲁大学) Google Cloud AI(谷歌云人工智能)

AI总结 本文提出ReasoningBank,通过整合智能体自我评估的成功与失败经验,提升其持续学习能力,并引入MaTTS加速学习过程,提升任务表现与效率。

Comments Accepted to ICLR 2026; Code: https://github.com/google-research/reasoning-bank

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19476 2026-03-18 cs.LG

LogicXGNN: Grounded Logical Rules for Explaining Graph Neural Networks

LogicXGNN: 基于逻辑规则的图神经网络解释方法

Chuqin Geng, Ziyu Zhao, Zhaoyue Wang, Haolin Ye, Yuhe Jiang, Xujie Si

机构 * University of Toronto(多伦多大学)

AI总结 LogicXGNN通过构建逻辑规则提升图神经网络解释的可信度和可解释性,提出数据驱动的 fidelity 指标并显著提升解释质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21271 2026-03-18 cs.CL cs.AI

EoRA: Fine-tuning-free Compensation for Compressed LLM with Eigenspace Low-Rank Approximation

EoRA: 无需微调的压缩LLM补偿方法

Shih-Yang Liu, Maksim Khadkevich, Nai Chit Fung, Charbel Sakr, Chao-Han Huck Yang, Chien-Yi Wang, Saurav Muralidharan, Hongxu Yin, Kwang-Ting Cheng, Jan Kautz, Yu-Chiang Frank Wang, Pavlo Molchanov, Min-Hung Chen

AI总结 EoRA提出一种无需微调的压缩LLM补偿方法,通过低秩矩阵增强模型性能,实现准确率与计算开销的灵活平衡,优于现有方法,显著提升压缩模型的准确率。

Comments ICLR 2026 workshops. Code: https://github.com/NVlabs/EoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15840 2026-03-18 cs.LG cs.AI cs.CL stat.ML

When Stability Fails: Hidden Failure Modes Of LLMS in Data-Constrained Scientific Decision-Making

当稳定性失效:在数据受限的科学决策中LLM的隐藏故障模式

Nazia Riasat

机构 * North Dakota State University(北达科他州立大学)

AI总结 研究揭示LLM在数据受限科学决策中稳定性不足的问题,通过控制评估框架发现其在正确性、提示敏感性和输出有效性方面的缺陷。

Comments 13 pages, 5 figures. Accepted at ICLR 2026 Workshop: I Can't Believe It's Not Better (ICBINB 2026). OpenReview: https://openreview.net/pdf?id=vf8vs2ibso

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15658 2026-03-18 cs.AI cs.CL cs.IR

Did You Check the Right Pocket? Cost-Sensitive Store Routing for Memory-Augmented Agents

你检查了正确的口袋吗?面向内存增强代理的成本敏感存储路由

Madhava Gaikwad

机构 * ICLR 2026 Workshop on Memory and State in LLM-Based Agents(ICLR 2026 记忆与状态在大语言模型代理中的工作坊)

AI总结 本文提出通过成本敏感存储路由优化内存增强代理的检索效率,通过覆盖、精确匹配和令牌效率指标评估,证明选择性检索能提升效率和性能,推动了可扩展多存储系统的 learned routing 机制发展。

Comments accepted in ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15642 2026-03-18 cs.AI

CraniMem: Cranial Inspired Gated and Bounded Memory for Agentic Systems

CraniMem:受大脑启发的门控和有界的记忆用于智能体系统

Pearl Mody, Mihir Panchal, Rishit Kar, Kiran Bhowmick, Ruhina Karani

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉萨·吉文拉尔·桑格维工程学院)

AI总结 CraniMem通过门控和有界多阶段记忆设计提升智能体在长期任务中的稳定性与鲁棒性,采用目标条件门控和效用标签结合短期缓冲和长期知识图谱,实现更持久的语义记忆与更小的干扰影响。

Comments International Conference on Learning Representations 2026 Workshop on Memory for LLM-Based Agentic Systems (MemAgents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14805 2026-03-18 cs.PL cs.AI

Sharing State Between Prompts and Programs

在提示和程序之间共享状态

Ellie Y. Cheng, Logan Weber, Tian Jin, Michael Carbin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出共享程序状态抽象,使提示可直接访问程序变量并实现控制流,通过Nightjar系统验证了其在任务准确性和代码效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15569 2026-03-17 cs.LG

Mamba-3: Improved Sequence Modeling using State Space Principles

Mamba-3:基于状态空间原理的序列建模改进

Aakash Lahoti, Kevin Y. Li, Berlin Chen, Caitlin Wang, Aviv Bick, J. Zico Kolter, Tri Dao, Albert Gu

AI总结 Mamba-3通过结合更丰富的递归、复值状态更新规则和多输入多输出框架,提升了序列建模的性能和效率,实现了在检索、状态跟踪和下游语言建模任务中的显著改进。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15483 2026-03-17 cs.AI

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15452 2026-03-17 cs.AI

Unlocking the Value of Text: Event-Driven Reasoning and Multi-Level Alignment for Time Series Forecasting

释放文本价值:基于事件驱动推理和多级对齐的时间序列预测

Siyuan Wang, Peng Chen, Yihang Wang, Wanghui Qiu, Chenjuan Guo, Bin Yang, Yang Shu

机构 * East China Normal University(华东师范大学)

AI总结 本文提出VoT方法,结合事件驱动推理和多级对齐,利用文本信息提升时间序列预测性能,通过历史上下文学习和自适应频率融合实现文本与数值预测的互补。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15431 2026-03-17 cs.LG cs.AI cs.NA math.AP math.NA

Physics-informed fine-tuning of foundation models for partial differential equations

基于物理约束的微调基础模型用于偏微分方程

Vlad Medvedev, Leon Armbruster, Christopher Straub, Georg Kruse, Andreas Rosskopf

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

AI总结 本文提出一种结合物理约束的微调方法,用于适应偏微分方程基础模型,提升数据稀缺情况下模型的物理一致性和泛化能力。

Comments 12 pages, 6 figures, 1 table

Journal ref ICLR 2026 Workshop on Artificial Intelligence and Partial Differential Equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15388 2026-03-17 cs.LG cs.AI cs.RO stat.ML

Efficient Morphology-Control Co-Design via Stackelberg Proximal Policy Optimization

通过Stackelberg近端策略优化实现高效的形态-控制协同设计

Yanning Dai, Yuhui Wang, Dylan R. Ashley, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, King Abdullah University of Science and Technology (KAUST)(生成人工智能卓越中心,卡奥斯特大学) Dalle Molle Institute for Artificial Intelligence Research (IDSIA)(人工智能研究达勒莫利研究所) Università della Svizzera italiana (USI)(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI)(瑞士意大利专业大学)

AI总结 本文提出Stackelberg PPO方法,通过将形态与控制的内在耦合建模为Stackelberg博弈变体,解决形态与控制策略的协同优化问题,提升机器人设计效率。

Comments presented at the Fourteenth International Conference on Learning Representations; 11 pages in main text + 3 pages of references + 23 pages of appendices, 5 figures in main text + 11 figures in appendices, 16 tables in appendices; accompanying website available at https://yanningdai.github.io/stackelberg-ppo-co-design/ ; source code available at https://github.com/YanningDai/StackelbergPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15051 2026-03-17 cs.CL cs.AI cs.LG

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

在潜空间中思考:用于大语言模型隐式推理的自适应锚点细化

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta

机构 * Manipal University Jaipur(马普尔大学斋普尔) TCS Research(塔塔咨询研究)

AI总结 本文提出AdaAnchor框架,通过自适应终止机制优化潜空间推理,提升准确率并减少计算步骤,实验表明在数学问题基准上准确率提升5%且减少48-60%的潜空间步骤。

Comments Accepted at ICLR 2026, LIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06922 2026-03-17 cs.LG

NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks

NerVE:大型语言模型中前馈网络的非线性特征谱动态

Nandan Kumar Jha, Brandon Reagen

AI总结 NerVE通过四个互补指标分析LLM中FFN的信息流动,揭示非线性特性对潜在空间利用的影响,验证了优化器几何对方差再注入的作用,适用于多种架构和优化器配置。

Comments Accepted to ICLR 2026. Project page: https://nerve-eigenspectrum.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03813 2026-03-17 cs.GR cs.AI cs.CV cs.LG

Diverse Text-to-Image Generation via Contrastive Noise Optimization

通过对比噪声优化实现文本到图像生成的多样性

Byungjun Kim, Soobin Um, Jong Chul Ye

AI总结 本文提出对比噪声优化方法,通过调整初始噪声提升文本到图像生成的多样性,同时保持图像质量,实验表明其在质量与多样性之间取得平衡。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25827 2026-03-17 cs.CL cs.AI

Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling

脱离奖励与课程数据调度的过度思考减少

Shuyang Jiang, Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang

AI总结 本文提出DECS框架,通过解耦的token级奖励机制和新的课程批量调度策略,有效减少推理token数量,同时保持或提升性能,解决过度思考问题。

Comments 30 pages; Accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏