arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-02-13 至 2026-02-13 共收录 27
2602.12172 2026-02-13 cs.AI cs.CL

Pedagogically-Inspired Data Synthesis for Language Model Knowledge Distillation

教学启发式数据合成用于语言模型知识蒸馏

Bowei He, Yankai Chen, Xiaokun Zhang, Linghe Kong, Philip S. Yu, Xue Liu, Chen Ma

机构 * MBZUAI McGill(麦吉尔大学) CityUHK(城市大学香港分校) SJTU(上海交通大学) UIC(美国国际大学)

AI总结 本文提出基于教学原理的知识蒸馏框架,通过三阶段流程提升学生模型性能,在复杂推理任务中取得显著改进。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12116 2026-02-13 cs.CL

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

P-GenRM:具有测试时用户基于缩放的个性化生成奖励模型

Pinyi Zhang, Ting-En Lin, Yuchuan Wu, Jingyang Chen, Zongqi Wang, Hua Yang, Ze Xu, Fei Huang, Kai Zhang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

AI总结 P-GenRM通过测试时用户基于缩放机制,实现个性化生成奖励模型,提升用户偏好适应性和泛化能力。

Comments Accepted as ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12100 2026-02-13 cs.CV

AssetFormer: Modular 3D Assets Generation with Autoregressive Transformer

AssetFormer:基于自回归变换器的模块化3D资产生成

Lingting Zhu, Shengju Qian, Haidi Fan, Jiayu Dong, Zhenchao Jin, Siwei Zhou, Gen Dong, Xin Wang, Lequan Yu

机构 * The University of Hong Kong(香港大学)

AI总结 AssetFormer通过自回归变换器生成模块化3D资产,提升高质量资产创建效率,适用于专业开发和用户生成内容场景。

Comments Accepted by ICLR 2026. 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12032 2026-02-13 cs.RO

When would Vision-Proprioception Policies Fail in Robotic Manipulation?

视觉-本体感觉策略在机器人操作中何时会失败?

Jingxian Lu, Wenke Xia, Yuxuan Wu, Zhiwu Lu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光明学院人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型与智能治理研究重点实验室) School of Artificial Intelligence, Beihang University(北航人工智能学院)

AI总结 研究提出GAP算法,通过动态调节本体感觉优化,解决视觉-本体感觉策略在运动转换阶段的泛化问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11964 2026-02-13 cs.AI

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

Gaia2:在动态和异步环境中评估大语言模型代理的基准测试

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

AI总结 Gaia2通过动态和异步环境评估大语言模型代理,揭示了推理、效率和鲁棒性之间的权衡,为代理系统的发展提供灵活的基础设施。

Comments Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11956 2026-02-13 q-bio.NC cs.AI cs.LG

TAVAE: A VAE with Adaptable Priors Explains Contextual Modulation in the Visual Cortex

TAVAE:具有可调节先验的VAE解释视觉皮层中的情境调节

Balázs Meszéna, Keith T. Murray, Julien Corbo, O. Batuhan Erkat, Márton A. Hajnal, Pierre-Olivier Polack, Gergő Orbán

机构 * Department of Computational Sciences(计算科学系) HUN-REN Wigner Research Centre for Physics(霍恩-伦维格物理研究中心) Princeton Neuroscience Institute(普林斯顿神经科学研究所) Princeton University(普林斯顿大学) Center for Molecular and Behavioral Neuroscience(分子与行为神经科学中心) Rutgers University(罗格斯大学)

AI总结 TAVAE通过任务优化的生成模型解释视觉皮层中情境调节的机制,展示了任务特定先验的学习与应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11902 2026-02-13 cs.LG cs.AI

Mitigating Mismatch within Reference-based Preference Optimization

缓解基于参考的偏好优化中的不匹配

Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) CFAR, A*STAR(CFAR,A*STAR) CSIRO, Data61(CSIRO,Data61) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

AI总结 HyPO通过有条件地去偏参考信号缓解基于参考的偏好优化中的不匹配问题,提升推理对齐性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11829 2026-02-13 cs.LG cs.GT

Towards Sustainable Investment Policies Informed by Opponent Shaping

面向可持续投资政策的对手塑造驱动的投资策略

Juan Agustin Duque, Razvan Ciuca, Ayoub Echchahed, Hugo Larochelle, Aaron Courville

机构 * University of Montreal and MILA(蒙特利尔大学和MILA)

AI总结 本文提出通过对手塑造算法优化投资策略,以解决可持续发展中的社会困境问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11779 2026-02-13 cs.LG

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

温度作为元策略:LLM强化学习中的自适应温度

Haoran Dang, Cuiling Lan, Hai Wan, Xibin Zhao, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。

Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03828 2026-02-13 cs.AI cs.CL cs.CV cs.DL

AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations

AutoFigure: 生成和细化可用于出版的科学插图

Minjun Zhu, Zhen Lin, Yixuan Weng, Panzhong Lu, Qiujie Xie, Yifan Wei, Sifan Liu, Qiyao Sun, Yue Zhang

AI总结 AutoFigure通过代理框架自动生成高质量科学插图,基于长篇科学文本并优于基线方法,实现结构和视觉的双重完善。

Comments Accepted at the ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05849 2026-02-13 cs.SC cs.AI cs.LG

EGG-SR: Embedding Symbolic Equivalence into Symbolic Regression via Equality Graph

EGG-SR: 通过等式图将符号等价性嵌入符号回归

Nan Jiang, Ziyi Wang, Yexiang Xue

机构 * University of Texas at El Paso(德克萨斯理工大学) Purdue University(普渡大学)

AI总结 EGG-SR通过引入等式图模块,将符号等价性整合到符号回归方法中,以减少搜索空间并提升学习效率。

Comments Camera-ready version accepted for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20108 2026-02-13 cs.LG cs.CV

Why Prototypes Collapse: Diagnosing and Preventing Partial Collapse in Prototypical Self-Supervised Learning

为何原型崩溃:诊断并防止原型自监督学习中的部分崩溃

Gabriel Y. Arteaga, Marius Aasan, Rwiddhi Chakraborty, Martine Hjelkrem-Tan, Thalles Silva, Michael Kampffmeyer, Adín Ramírez Rivera

机构 * University of Oslo(奥斯陆大学) UiT The Arctic University of Norway(挪威北极大学) University of Campinas(坎皮纳斯大学)

AI总结 本文提出了一种解耦训练策略,通过独立优化编码器和原型,防止原型自监督学习中的部分崩溃问题,从而提升表示多样性和下游任务性能。

Comments Published in ICLR 2026. Code: https://dsb-ifi.github.com/proto-decoupling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04899 2026-02-13 cs.AI

Human Behavior Atlas: Benchmarking Unified Psychological and Social Behavior Understanding

人类行为图谱:统一心理与社会行为理解的基准测试

Keane Ong, Wei Dai, Carol Li, Dewei Feng, Hengzhi Li, Jingyao Wu, Jiaee Cheong, Rui Mao, Gianmarco Mengaldo, Erik Cambria, Paul Pu Liang

AI总结 人类行为图谱通过统一基准和三种模型提升心理与社会行为理解的多模态性能

Comments Accepted to ICLR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18382 2026-02-13 cs.RO

One Demo Is All It Takes: Planning Domain Derivation with LLMs from A Single Demonstration

一个演示就足够:从单个演示中利用LLM进行规划域推导

Jinbang Huang, Yixin Xiao, Zhanguang Zhang, Mark Coates, Jianye Hao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) McGill University(麦吉尔大学)

AI总结 PDDLLM通过结合LLM推理与物理模拟,从单个演示中自动推导规划域,提升长时间跨度任务规划的自动化与可靠性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12594 2026-02-13 cs.CL

PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery

PASER:基于后训练数据选择的高效剪枝大语言模型恢复

Bowei He, Lihao Yin, Hui-Ling Zhen, Xiaokun Zhang, Mingxuan Yuan, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 PASER通过后训练数据选择方法高效恢复剪枝大语言模型的能力,显著优于传统基线方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11743 2026-02-13 cs.CV

Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation

自适应去偏Tsallis熵用于测试时适应

Xiangyu Wu, Dongming Jiang, Feng Yu, Yueying Tian, Jiaqi Tang, Qing-Guo Chen, Yang Yang, Jianfeng Lu

机构 * Nanjing University of Science and Technology(南京理工大学) Alibaba Cloud(阿里云) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Sussex(Sussex 大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出自适应去偏Tsallis熵用于测试时适应,通过引入非广延参数q来缓解预训练数据偏差,提升模型适应性能。

Comments Accepted for publication at ICLR 2026; 24 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11523 2026-02-13 cs.LG

Unifying Stable Optimization and Reference Regularization in RLHF

统一稳定优化与参考正则化在RLHF中

Li He, Qiang Qu, He Zhao, Stephen Wan, Dadong Wang, Lina Yao, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心、悉尼大学) CSIRO, Data61(澳大利亚联邦科学与工业研究组织、Data61) University of New South Wales(新南威尔士大学)

AI总结 本文提出了一种统一正则化方法,通过平衡防止奖励黑客和稳定策略更新,提升RLHF的对齐性能和稳定性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11440 2026-02-13 cs.CV

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

Ctrl&Shift: 视觉生成中高质量的几何感知物体操控

Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司) University of Electronic Science and Technology of China(电子科技大学) NVIDIA

AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11437 2026-02-13 cs.AI cs.MA

Distributionally Robust Cooperative Multi-Agent Reinforcement Learning via Robust Value Factorization

基于鲁棒价值因子化的分布鲁棒合作多智能体强化学习

Chengrui Qu, Christopher Yeh, Kishan Panaganti, Eric Mazumdar, Adam Wierman

AI总结 本文提出分布鲁棒IGM原则,改进价值因子化架构以提升鲁棒性和现实适应性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05832 2026-02-13 cs.CV cs.AI

Hilbert-Guided Sparse Local Attention

基于希尔伯特曲线的稀疏局部注意机制

Yunge Li, Lanyu Xu

AI总结 本文提出基于希尔伯特曲线的局部注意力机制,通过重新排列图像token以提高块稀疏性,从而提升2D局部注意力的效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06419 2026-02-13 cs.LG

Test-Time Efficient Pretrained Model Portfolios for Time Series Forecasting

时间序列预测中的测试时高效预训练模型组合

Mert Kayaalp, Caner Turkmen, Oleksandr Shchur, Pedro Mercado, Abdul Fatir Ansari, Michael Bohlke-Schneider, Bernie Wang

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA) - USI/SUPSI, Switzerland(达摩信息技术研究所(IDSIA)- USI/SUPSI,瑞士) Amazon Web Services(亚马逊网络服务)

AI总结 本文提出了一种测试时高效的预训练模型组合方法,通过集成或模型选择在时间序列预测中实现高性能,且计算成本更低。

Comments Accepted as an ICLR 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02818 2026-02-13 cs.LG

Mitigating Spurious Correlation via Distributionally Robust Learning with Hierarchical Ambiguity Sets

通过分布鲁棒学习与分层模糊集缓解虚假相关性

Sung Ho Jo, Seonghwi Kim, Minwoo Chae

机构 * Pohang University of Science and Technology(釜山科学技术大学)

AI总结 本文提出一种分层扩展的Group DRO方法,通过扩大模糊集以提高对组间和组内分布偏移的鲁棒性,并在少数群体分布偏移模拟中取得优异表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09660 2026-02-13 cs.CL cs.LG

Steering MoE LLMs via Expert (De)Activation

通过专家(去)激活引导MoE LLMs

Mohsen Fayyaz, Ali Modarressi, Hanieh Deilamsalehy, Franck Dernoncourt, Ryan Rossi, Trung Bui, Hinrich Schütze, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Adobe Research(Adobe研究) CIS, LMU Munich(慕尼黑大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13430 2026-02-13 cs.LG cs.CL cs.CV

Fine-tuning Quantized Neural Networks with Zeroth-order Optimization

使用零阶优化进行量化神经网络微调

Sifeng Shang, Jiayi Zhou, Chenyu Lin, Minxian Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出量化零阶优化方法,通过消除梯度和优化器状态来减少内存使用,实现4位LLM在24GB GPU上高效微调。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04667 2026-02-13 cs.LG cs.AI cs.CL

Compositional Generalization from Learned Skills via CoT Training: A Theoretical and Structural Analysis for Reasoning

通过Co-T训练从已学技能中实现组合泛化:一种理论和结构分析用于推理

Xinhao Yao, Ruifeng Ren, Yun Liao, Lizhong Ding, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) Tianjin University of Science and Technology(天津科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文通过理论和结构分析揭示CoT训练通过组合学习技能提升模型推理泛化能力的核心机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏