arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2510.03855 2026-03-03 cs.GT

On the $O(1/T)$ Convergence of Alternating Gradient Descent-Ascent in Bilinear Games

关于双人零和博弈中交替梯度下降-上升算法$O(1/T)$收敛性的研究

Tianlong Nan, Shuvomoy Das Gupta, Garud Iyengar, Christian Kroer

AI总结 本文研究了双人零和博弈中交替梯度下降-上升算法的收敛性,证明其在约束条件下具有$O(1/T)$的收敛速率,优于同时方法的$O(1/\sqrt{T})$速率。

Comments 40 pages, 74 figures, Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01387 2026-03-03 cs.GT cs.LG econ.TH

Learning to Play Multi-Follower Bayesian Stackelberg Games

学习多跟随者贝叶斯斯塔克尔伯格博弈

Gerson Personnat, Tao Lin, Safwan Hossain, David C. Parkes

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院) Harvard University(哈佛大学)

AI总结 研究多跟随者贝叶斯斯塔克尔伯格博弈的在线学习算法,通过类型反馈和动作反馈设计算法,实现最小化懊悔的策略。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00819 2026-03-03 cs.LG cs.AI

Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning

为LLM推理稳定化策略梯度以实现样本高效的强化学习

Luckeciano C. Melo, Alessandro Abate, Yarin Gal

机构 * OATML, University of Oxford(OATML,牛津大学) OXCAV, University of Oxford(OXCAV,牛津大学)

AI总结 CAPO通过曲率感知优化提升LLM推理的样本效率和稳定性

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26601 2026-03-03 cs.CL cs.AI cs.LG

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

MENLO:从偏好到熟练度——在47种语言上评估和建模原生质量

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Francisco Guzmán

机构 * Meta Superintelligence Labs(Meta超智能实验室) Handshake AI

AI总结 MENLO通过偏好评估和建模提升多语言LLM的原生质量,结合强化学习和多任务学习方法改进模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26544 2026-03-03 cs.LG

Bayesian Influence Functions for Hessian-Free Data Attribution

贝叶斯影响函数用于Hessian-Free数据归因

Philipp Alexander Kreer, Wilson Wu, Maxwell Adam, Zach Furman, Jesse Hoogland

机构 * Technical University of Munich(慕尼黑技术大学) University of Colorado Boulder(科罗拉多大学博尔德分校) University of Melbourne(墨尔本大学) Timaeus

AI总结 本文提出一种基于贝叶斯影响函数的Hessian-Free方法,用于高效估计深度神经网络参数间的高阶相互作用,并在重训练实验中取得最佳性能。

Comments 37 pages, 20 figures, ICLR 2026 - camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26455 2026-03-03 cs.CV

Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting

Stylos:基于单次前向高斯点云的多视图3D风格迁移

Hanzhou Liu, Jia Huang, Mi Lu, Srikanth Saripalli, Peng Jiang

机构 * Texas A&M University(德克萨斯A&M大学)

AI总结 Stylos通过单次前向高斯点云框架实现多视图3D风格迁移,采用Transformer主干和全局交叉注意力机制,结合体素损失实现视图一致的风格化效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25678 2026-03-03 cs.LG

Massively Multimodal Foundation Models: A Framework for Capturing Interactions with Specialized Mixture-of-Experts

大规模多模态基础模型:一种捕捉交互的专用专家混合框架

Xing Han, Hsing-Huan Chung, Joydeep Ghosh, Paul Pu Liang, Suchi Saria

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出了一种大规模多模态基础模型框架,通过量化模态间的时间依赖性,改进混合专家路由机制,提升跨模态交互处理能力。

Comments Published at International Conference on Learning Representations (ICLR) 2026 as a conference paper. 28 pages, 16 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25390 2026-03-03 cs.CV cs.AI

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, Ding Zhao

AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24393 2026-03-03 cs.AI cs.CL

Towards Safe Reasoning in Large Reasoning Models via Corrective Intervention

通过纠正干预实现大推理模型的安全推理

Yichi Zhang, Yue Ding, Jingwen Yang, Tianwei Luo, Dongbai Li, Ranjie Duan, Qiang Liu, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海启智机构) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) RealAI

AI总结 本文提出IPO方法,通过干预优化提升大推理模型的安全性,显著降低有害性并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24332 2026-03-03 cs.LG cs.AI

Towards Generalizable PDE Dynamics Forecasting via Physics-Guided Invariant Learning

通过物理引导的不变学习实现通用的PDE动力学预测

Siyang Li, Yize Chen, Yan Guo, Ming Huang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云)

AI总结 本文提出iMOOE方法,通过物理引导的不变学习实现PDE动态预测的通用性和零样本泛化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24203 2026-03-03 cs.LG cs.AI cs.CL

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

组相对REINFORCE实际上是秘密的非策略算法:解开GRPO及其朋友的一些神话

Chaorui Yao, Yanxi Chen, Yuchang Sun, Yushuo Chen, Wenhao Zhang, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Alibaba Group(阿里巴巴集团)

AI总结 本文揭示组相对REINFORCE本质上是非策略算法,通过理论分析和实验验证,解开了GRPO及相关算法的一些神话,为LLMs的非策略强化学习提供了新的设计思路。

Comments Accepted to ICLR 2026. arXiv v2 update: add references and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23624 2026-03-03 cs.CV

DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation

DiffInk: 基于字形和风格的潜在扩散变换器用于文本到在线手写生成

Wei Pan, Huiguo He, Hiuyi Cheng, Yilin Shi, Lianwen Jin

机构 * South China University of Technology(华南理工大学)

AI总结 DiffInk通过结合字形和风格的潜在扩散变换器,实现了高效且准确的完整文本行手写生成。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23566 2026-03-03 cs.CV

Towards Interpretable Visual Decoding with Attention to Brain Representations

向基于脑表示的可解释视觉解码迈进

Pinyuan Feng, Hossein Adeli, Wenxuan Guo, Fan Cheng, Ethan Hwang, Nikolaus Kriegeskorte

机构 * Zuckerman Mind Brain Behavior Institute, Columbia University, USA(祖克曼心智大脑行为研究所,哥伦比亚大学,美国)

AI总结 本文提出NeuroAdapter框架,通过直接条件化潜在扩散模型于脑表示,实现更透明的脑-图像解码与重建。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22240 2026-03-03 eess.IV cs.CV cs.LG stat.AP stat.ML

COMPASS: Robust Feature Conformal Prediction for Medical Segmentation Metrics

COMPASS:用于医学分割度量的鲁棒特征符合预测

Matt Y. Cheung, Ashok Veeraraghavan, Guha Balakrishnan

AI总结 COMPASS通过利用深度神经网络的归纳偏差,为医学图像分割提供高效的基于度量的不确定性量化方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21950 2026-03-03 cs.CV

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

为MLLMs定制视觉情绪评估:一种开放词汇、多维且可扩展的方法

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种开放词汇、多维且可扩展的方法,用于定制MLLMs的视觉情绪评估,通过情绪陈述判断任务和自动化流程,评估现有模型在情绪识别和上下文判断中的表现,并揭示其局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21420 2026-03-03 cs.CV

QuadGPT: Native Quadrilateral Mesh Generation with Autoregressive Models

QuadGPT:基于自回归模型的原生四边形网格生成

Jian Liu, Chunshi Wang, Song Guo, Haohan Weng, Zhen Zhou, Zhiqi Li, Jiaao Yu, Yiling Zhu, Jing Xu, Biwen Lei, Zhuo Chen, Chunchao Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文元)

AI总结 QuadGPT通过自回归模型和强化学习优化,实现了端到端的四边形网格生成,提升了几何精度和拓扑质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21278 2026-03-03 cs.CV cs.AI cs.LG

Does FLUX Already Know How to Perform Physically Plausible Image Composition?

FLUX 是否已经能够进行物理上合理的图像合成?

Shilin Lu, Zhuming Lian, Zihan Zhou, Shaocong Zhang, Chen Zhao, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 FLUX能否通过SHINE框架实现物理合理的图像合成,通过引入无训练框架和降质抑制指导,提升高保真度和背景完整性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21097 2026-03-03 cs.LG cs.AI

GraphUniverse: Synthetic Graph Generation for Evaluating Inductive Generalization

GraphUniverse: 用于评估归纳泛化能力的合成图生成

Louis Van Langendonck, Guillermo Bernárdez, Nina Miolane, Pere Barlet-Ros

机构 * Universitat Politècnica de Catalunya(巴塞罗那理工大学) University of California Santa Barbara(加州大学圣巴巴拉分校)

AI总结 GraphUniverse通过生成具有持久语义社区的合成图,系统评估了归纳泛化能力,揭示了强传递性表现与归纳泛化能力的关联性不足,以及分布偏移鲁棒性对模型架构和初始图阶段的敏感性。

Comments Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20989 2026-03-03 cs.IR cs.AI

Rejuvenating Cross-Entropy Loss in Knowledge Distillation for Recommender Systems

在推荐系统知识蒸馏中 rejuvenating 交叉熵损失

Zhangchi Zhu, Wei Zhang

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出RCE-KD方法,通过将教师的顶部物品分为两部分并采用采样策略,改进推荐系统知识蒸馏中的交叉熵损失,提升NDCG性能。

Comments ICLR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20323 2026-03-03 cs.LG math.OC stat.ML

A Recovery Guarantee for Sparse Neural Networks

稀疏神经网络的恢复保证

Sara Fridovich-Keil, Mert Pilanci

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Stanford University(斯坦福大学)

AI总结 该研究为稀疏神经网络提供了恢复保证,通过迭代硬阈值算法以线性内存复杂度精确恢复稀疏权重,并在多个任务中表现出优于传统方法的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09212 2026-03-03 eess.AS cs.SD

MAPSS: Manifold-based Assessment of Perceptual Source Separation

基于流形的感知源分离评估

Amir Ivry, Samuele Cornell, Shinji Watanabe

机构 * Electrical and Computer Engineering, Technion - Israel Institute of Technology(技术学院-以色列理工学院电子与计算机工程系) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

AI总结 本文提出基于流形学习的感知分离和匹配度量方法,用于更准确评估音频源分离系统的感知性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03516 2026-03-03 cs.CV

Easier Painting Than Thinking: Can Text-to-Image Models Set the Stage, but Not Direct the Play?

绘画比思考更容易:文本到图像模型能否铺垫,却无法主导?

Ouxiang Li, Yuan Wang, Xinting Hu, Huijuan Huang, Rui Chen, Jiarong Ou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学)

AI总结 本文提出T2I-CoReBench基准测试,用于评估文本到图像模型的组合与推理能力,揭示现有模型在高组合场景和推理任务中的局限性。

Comments Accepted to ICLR 2026. Project Page: https://t2i-corebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18672 2026-03-03 cs.LG cs.AI cs.CL

Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks

混合专家语言模型在推理任务中的最优稀疏性

Taishi Nakamura, Satoki Ishikawa, Masaki Kawamura, Takumi Okamoto, Daisuke Nohara, Jun Suzuki, Rio Yokota

机构 * Institute of Science Tokyo(东京科学研究院) NII LLMC(国家信息研究所语言模型中心) Tohoku University(东北大学) RIKEN(日本研究机构)

AI总结 研究通过分析MoE模型的稀疏性对记忆和推理任务的影响,发现推理任务需在活跃FLOPs和TPP之间找到最优平衡。

Comments Accepted as an oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12811 2026-03-03 cs.CV cs.AI cs.LG

Next Visual Granularity Generation

下一步视觉粒度生成

Yikai Wang, Zhouxia Wang, Zhonghua Wu, Qingyi Tao, Kang Liao, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23390 2026-03-03 math.OC cs.AI

FMIP: Joint Continuous-Integer Flow For Mixed-Integer Linear Programming

FMIP: 混合整数线性规划的联合连续-整数流

Hongpei Li, Hui Yuan, Han Zhang, Jianghao Lin, Dongdong Ge, Mengdi Wang, Yinyu Ye

机构 * Shanghai University of Finance and Economics(上海财经大学) Princeton University(普林斯顿大学) National University of Singapore(国立新加坡大学) Antai College of Economics and Management(经济管理学院) Shanghai Institute for Mathematics and Interdisciplinary Sciences(上海数学与交叉科学研究院) Stanford University(斯坦福大学)

AI总结 FMIP提出了一种新的生成框架,通过联合建模整数和连续变量分布,提升混合整数线性规划求解效率。

Comments Accepted at the International Conference on Learning Representations (ICLR), 2025. A generative framework for MILP that jointly models integer and continuous variables, achieving 41% primal gap reduction with broad solver compatibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16937 2026-03-03 cs.NE

Fractional-order Spiking Neural Network

分数阶脉冲神经网络

Chengjie Ge, Yufeng Peng, Zihao Li, Qiyu Kang, Xueyang Fu, Xuhao Li, Qixin Zhang, Junhao Ren, Zheng-Jun Zha

AI总结 本文提出分数阶脉冲神经网络框架,通过分数阶动力学捕捉长期依赖性,提升时序模式表达能力,并发布开源工具支持多种架构和任务。

Comments Accepted to the International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏