arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-03 至 2026-03-03 共收录 251
2512.01822 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA

InnoGym: Benchmarking the Innovation Potential of AI Agents

InnoGym:评估AI智能体创新潜力的基准测试

Jintian Zhang, Kewei Xu, Jingsheng Zheng, Zhuoyun Yu, Yuqi Zhu, Yujie Luo, Lanning Wei, Shuofei Qiao, Lun Du, Da Zheng, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

AI总结 InnoGym通过引入性能提升和新颖性两个指标,首次系统评估AI智能体的创新潜力,揭示了创造力与有效性的平衡问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10985 2026-03-03 cs.CL cs.AI

When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets

当数据成为算法:对偏好优化数据集的系统研究与整理

Aladin Djuhera, Farhan Ahmed, Swanand Ravindra Kadhe, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

AI总结 本文系统研究并整理了多个开源DPO数据集,提出UltraMix混合数据集,通过Magpie框架进行精细标注,揭示偏好质量差异,并在关键基准上超越最佳单个数据集性能。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01107 2026-03-03 cs.RO cs.LG

SLAP: Shortcut Learning for Abstract Planning

SLAP:抽象规划的快捷学习

Y. Isabel Liu, Bowen Li, Benjamin Eysenbach, Tom Silver

AI总结 SLAP通过快捷学习方法自动发现抽象规划中的新选项,提升任务成功率和规划效率。

Comments Published at the International Conference on Learning Representations (ICLR) 2026. Code available at https://github.com/isabelliu0/SLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00177 2026-03-03 cs.LG cs.CL

Can SAEs reveal and mitigate racial biases of LLMs in healthcare?

稀疏自编码器能否揭示并缓解LLM在医疗中的种族偏见?

Hiba Ahsan, Byron C. Wallace

机构 * Northeastern University(东北大学)

AI总结 本文研究了稀疏自编码器在揭示和缓解LLM医疗应用中种族偏见方面的作用,发现其在简单任务中有效,但在复杂任务中效果有限。

Comments camera-ready ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24711 2026-03-03 cs.CV

Routing Matters in MoE: Scaling Diffusion Transformers with Explicit Routing Guidance

MoE中的路由问题:通过显式路由指导扩展扩散Transformer

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Yujin Han, Zhekai Chen, Jiayu Wang, Difan Zou, Xihui Liu, Yingya Zhang, Yu Liu, Hongming Shan

机构 * Fudan University(复旦大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) MMLab Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)

AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21314 2026-03-03 cs.LG cs.AI stat.ML

A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization

自适应优化器在浮点量化下的收敛性分析

Xuan Tang, Jichu Li, Difan Zou

AI总结 本文提出理论框架分析自适应优化器在浮点量化下的收敛性,揭示Adam和Muon在不同量化下的表现差异,通过实验验证理论结果。

Comments 68 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18866 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA

LightMem: Lightweight and Efficient Memory-Augmented Generation

LightMem: 轻量级和高效的内存增强生成

Jizhan Fang, Xinle Deng, Haoming Xu, Ziyan Jiang, Yuqi Tang, Ziwen Xu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) State Key Lab. for Novel Software Technology, Nanjing University, P.R. China(南京大学软件新技术国家重点实验室,中国)

AI总结 LightMem通过三阶段内存系统提升LLM在动态环境中的效率和性能,实现问答准确率提升和token使用减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10575 2026-03-03 cs.CV

UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation

UniFlow:一种统一的像素流标记器用于视觉理解和生成

Zhengrong Yue, Haiyu Zhang, Xiangyu Zeng, Boyu Chen, Chenting Wang, Shaobin Zhuang, Lu Dong, Yi Wang, Limin Wang, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 UniFlow是一种统一的像素流标记器,通过灵活适配视觉编码器和轻量级解码器,在视觉理解和生成任务中实现了性能的双赢。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09951 2026-03-03 q-bio.NC cs.LG

Emergence of Spatial Representation in an Actor-Critic Agent with Hippocampus-Inspired Sequence Generator

具有海马体启发序列生成器的Actor-Critic智能体中空间表示的出现

Xiao-Xiong Lin, Yuk-Hoi Yiu, Christian Leibold

机构 * Faculty of Biology & Bernstein Center Freiburg & BrainLinks-BrainTools Center University of Freiburg(生物学系及弗赖堡伯尔尼中心、BrainLinks-BrainTools中心、弗赖堡大学)

AI总结 该研究通过海马体启发的序列生成器和Actor-Critic学习者,揭示稀疏输入与序列生成动态的协同作用,为导航任务中的强化学习提供新的归纳偏置。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07959 2026-03-03 cs.LG cs.AI

DISCO: Diversifying Sample Condensation for Efficient Model Evaluation

DISCO: 通过高效样本压缩实现模型评估的多样化

Alexander Rubinstein, Benjamin Raible, Martin Gubri, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

AI总结 DISCO通过选择模型响应多样性最高的样本,提高模型评估效率,实现更准确的性能预测。

Comments ICLR'26; arXiv v2: add camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07940 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM:测试时优化与记忆化用于组合视频生成

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。

Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05064 2026-03-03 cs.LG

Boomerang Distillation Enables Zero-Shot Model Size Interpolation

回环蒸馏使零样本模型大小插值

Sara Kangaslahti, Nihal V. Nayak, Jonathan Geuter, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) Kempner Institute(凯普纳研究所) IST Austria(IST奥地利研究院)

AI总结 回环蒸馏通过蒸馏和重构实现零样本模型大小插值,生成细粒度模型家族,降低训练成本并提升适应性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04727 2026-03-03 cs.LG

Directional Sheaf Hypergraph Networks: Unifying Learning on Directed and Undirected Hypergraphs

方向性sheaf超图网络:统一学习于有向和无向超图

Emanuele Mule, Stefano Fiorini, Antonio Purificato, Federico Siciliano, Stefano Coniglio, Fabrizio Silvestri

机构 * Sapienza University of Rome(罗马大学)

AI总结 DSHN通过结合sheaf理论与非对称关系处理,统一并泛化了现有超图学习中的拉普拉斯矩阵,提升了超图学习的性能。

Comments Camera ready revision: accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03855 2026-03-03 cs.GT

On the $O(1/T)$ Convergence of Alternating Gradient Descent-Ascent in Bilinear Games

关于双人零和博弈中交替梯度下降-上升算法$O(1/T)$收敛性的研究

Tianlong Nan, Shuvomoy Das Gupta, Garud Iyengar, Christian Kroer

AI总结 本文研究了双人零和博弈中交替梯度下降-上升算法的收敛性,证明其在约束条件下具有$O(1/T)$的收敛速率,优于同时方法的$O(1/\sqrt{T})$速率。

Comments 40 pages, 74 figures, Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01387 2026-03-03 cs.GT cs.LG econ.TH

Learning to Play Multi-Follower Bayesian Stackelberg Games

学习多跟随者贝叶斯斯塔克尔伯格博弈

Gerson Personnat, Tao Lin, Safwan Hossain, David C. Parkes

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院) Harvard University(哈佛大学)

AI总结 研究多跟随者贝叶斯斯塔克尔伯格博弈的在线学习算法,通过类型反馈和动作反馈设计算法,实现最小化懊悔的策略。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26601 2026-03-03 cs.CL cs.AI cs.LG

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

MENLO:从偏好到熟练度——在47种语言上评估和建模原生质量

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Francisco Guzmán

机构 * Meta Superintelligence Labs(Meta超智能实验室) Handshake AI

AI总结 MENLO通过偏好评估和建模提升多语言LLM的原生质量,结合强化学习和多任务学习方法改进模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26544 2026-03-03 cs.LG

Bayesian Influence Functions for Hessian-Free Data Attribution

贝叶斯影响函数用于Hessian-Free数据归因

Philipp Alexander Kreer, Wilson Wu, Maxwell Adam, Zach Furman, Jesse Hoogland

机构 * Technical University of Munich(慕尼黑技术大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Melbourne(墨尔本大学) Timaeus

AI总结 本文提出一种基于贝叶斯影响函数的Hessian-Free方法,用于高效估计深度神经网络参数间的高阶相互作用,并在重训练实验中取得最佳性能。

Comments 37 pages, 20 figures, ICLR 2026 - camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26455 2026-03-03 cs.CV

Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting

Stylos:基于单次前向高斯点云的多视图3D风格迁移

Hanzhou Liu, Jia Huang, Mi Lu, Srikanth Saripalli, Peng Jiang

机构 * Texas A&M University(德克萨斯A&M大学)

AI总结 Stylos通过单次前向高斯点云框架实现多视图3D风格迁移,采用Transformer主干和全局交叉注意力机制,结合体素损失实现视图一致的风格化效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25678 2026-03-03 cs.LG

Massively Multimodal Foundation Models: A Framework for Capturing Interactions with Specialized Mixture-of-Experts

大规模多模态基础模型:一种捕捉交互的专用专家混合框架

Xing Han, Hsing-Huan Chung, Joydeep Ghosh, Paul Pu Liang, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出了一种大规模多模态基础模型框架,通过量化模态间的时间依赖性,改进混合专家路由机制,提升跨模态交互处理能力。

Comments Published at International Conference on Learning Representations (ICLR) 2026 as a conference paper. 28 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25390 2026-03-03 cs.CV cs.AI

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, Ding Zhao

AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24393 2026-03-03 cs.AI cs.CL

Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention

通过纠正干预实现大推理模型的安全推理

Yichi Zhang, Yue Ding, Jingwen Yang, Tianwei Luo, Dongbai Li, Ranjie Duan, Qiang Liu, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) RealAI

AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24332 2026-03-03 cs.LG cs.AI

Towards Generalizable PDE Dynamics Forecasting via Physics-Guided Invariant Learning

通过物理引导的不变学习实现通用的PDE动力学预测

Siyang Li, Yize Chen, Yan Guo, Ming Huang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云)

AI总结 本文提出iMOOE方法,通过物理引导的不变学习实现PDE动态预测的通用性和零样本泛化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24203 2026-03-03 cs.LG cs.AI cs.CL

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

组相对REINFORCE实际上是秘密的非策略算法:解开GRPO及其朋友的一些神话

Chaorui Yao, Yanxi Chen, Yuchang Sun, Yushuo Chen, Wenhao Zhang, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Alibaba Group(阿里巴巴集团)

AI总结 本文揭示组相对REINFORCE本质上是非策略算法,通过理论分析和实验验证,解开了GRPO及相关算法的一些神话,为LLMs的非策略强化学习提供了新的设计思路。

Comments Accepted to ICLR 2026. arXiv v2 update: add references and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23624 2026-03-03 cs.CV

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

DiffInk: 基于字形和风格的潜在扩散变换器用于文本到在线手写生成

Wei Pan, Huiguo He, Hiuyi Cheng, Yilin Shi, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

AI总结 DiffInk通过结合字形和风格的潜在扩散变换器,实现了高效且准确的完整文本行手写生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏