arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2510.01265 2026-03-03 cs.LG cs.AI cs.CL

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00504 2026-03-03 stat.ML cond-mat.dis-nn cs.IT cs.LG math.IT

A universal compression theory for lottery ticket hypothesis and neural scaling laws

彩票彩票假说和神经扩展定律的通用压缩理论

Hong-Yi Wang, Di Luo, Tomaso Poggio, Isaac L. Chuang, Liu Ziyin

AI总结 本研究提出了一种通用压缩理论,证明了大规模模型可以被压缩到 polylog 宽度并保持学习动态,同时数据集可压缩到 polylog 大小而保持损失景观不变。

Comments 26 pages. Accepted by ICLR 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26432 2026-03-03 cs.LG cs.AI

AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size

AdaBlock-dLLM: 通过自适应块大小实现语义感知的扩散语言模型推理

Guanxi Lu, Hao Mark Chen, Yuto Karashima, Zhican Wang, Daichi Fujiki, Hongxiang Fan

AI总结 AdaBlock-dLLM通过自适应块大小实现语义感知的扩散语言模型推理,提升解码准确性与效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25087 2026-03-03 cs.LG cs.AI cs.CL

Scaling with Collapse: Efficient and Predictable Training of LLM Families

按比例崩溃:高效且可预测的LLM家族训练

Shane Bergsma, Bin Claire Zhang, Nolan Dey, Shaheer Muhammad, Gurpreet Gosal, Joel Hestness

机构 * Cerebras Systems(Cerebras系统)

AI总结 该研究发现LLM训练中的崩溃现象,表明通过优化超参数可实现高效且可预测的训练,提出了Celerity模型并展示了其在训练诊断和超参数调优中的应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24245 2026-03-03 cs.CL cs.AI

Prompt and Parameter Co-Optimization for Large Language Models

用于大型语言模型的提示与参数联合优化

Xiaohe Bo, Rui Li, Zexu Sun, Quanyu Dai, Zeyu Zhang, Zihang Tian, Xu Chen, Zhenhua Dong

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

AI总结 本文提出MetaTuner框架,通过联合优化提示和参数提升大型语言模型性能,通过共享编码层和监督正则化损失实现协同优化。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24156 2026-03-03 cs.AI cs.CL

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

推理还是检索?对大推理模型答案归因的研究

Yuhui Wang, Changjiang Li, Guangke Chen, Jiacheng Liang, Ting Wang

机构 * Stony Brook University(石溪大学) Palo Alto Networks(帕洛阿尔托网络) Wuhan University(武汉大学)

AI总结 本研究探讨了大型推理模型在推理与检索机制之间的冲突,提出FARL框架通过抑制检索捷径提升推理能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23365 2026-03-03 cs.LG

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

连续思维的涌现:揭示连续思维链的训练动态

Hanlin Zhu, Shibo Hao, Zhiting Hu, Jiantao Jiao, Stuart Russell, Yuandong Tian

机构 * UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Nvidia(英伟达) Meta AI

AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。

Comments 32 pages, 9 figures, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21993 2026-03-03 cs.AI cs.LG

Bilinear representation mitigates reversal curse and enables consistent model editing

双线性表示缓解反转诅咒并实现一致的模型编辑

Dong-Kyum Kim, Minsung Kim, Jea Kwon, Nakyeong Yang, Meeyoung Cha

机构 * MPI-SP(马克斯·普朗克研究所(德国)) SNU(首尔国立大学(韩国)) KAIST(韩国科学技术院(韩国))

AI总结 双线性表示缓解语言模型的反转诅咒,通过构建内在几何结构实现一致的模型编辑。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21513 2026-03-03 cs.LG cs.AI cs.CV math.PR stat.ML

DistillKac: Few-Step Image Generation via Damped Wave Equations

DistillKac:通过阻尼波动方程实现少步图像生成

Weiqiao Han, Chenlin Meng, Christopher D. Manning, Stefano Ermon

机构 * MIT(麻省理工学院) Stanford(斯坦福大学)

AI总结 DistillKac通过阻尼波动方程和随机Kac表示实现少步高质量图像生成,结合无分类指导和终点蒸馏方法,在保持数值稳定性的同时提升生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21057 2026-03-03 cs.CR cs.CL

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

PMark: 向鲁棒且无失真语义级水印技术迈进:在通道约束下

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 PMark通过代理函数框架实现鲁棒且无失真的语义级水印技术,提升对改写攻击的鲁棒性并优化采样效率。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20719 2026-03-03 cs.LG q-bio.QM

A Genetic Algorithm for Navigating Synthesizable Molecular Spaces

一种用于可合成分子空间导航的遗传算法

Alston Lo, Connor W. Coley, Wojciech Matusik

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 SynGA是一种用于可合成分子空间导航的遗传算法,通过自定义交叉和变异算子确保合成可行性,并结合机器学习过滤器提升性能,适用于属性优化等任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04784 2026-03-03 cs.CL cs.AI

Post-training Large Language Models for Diverse High-Quality Responses

在训练后为大型语言模型生成多样化高质量响应

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

机构 * Boston University(波士顿大学) University of Maryland, College Park(马里兰大学学院公园分校) University College London(伦敦大学学院) Boston University Broad Institute of MIT and Harvard(MIT和哈佛大学波士顿大学Broad研究所)

AI总结 本文提出DQO方法,通过确定性点过程优化大型语言模型的质量和语义多样性,提升输出多样性而不影响性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05606 2026-03-03 cs.CV cs.CL

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-cot: 向跨文本和视觉的统一链式推理迈进

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。

Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02948 2026-03-03 cs.LG cs.MA

Sample-Efficient Distributionally Robust Multi-Agent Reinforcement Learning via Online Interaction

通过在线交互实现样本高效的分布鲁棒多智能体强化学习

Zain Ulabedeen Farhat, Debamita Ghosh, George K. Atia, Yue Wang

AI总结 本文提出MORNAVI算法,通过在线交互实现样本高效的分布鲁棒多智能体强化学习,提供首个可证明的保证,有效解决环境不确定性问题。

Comments Accepted by ICLR 2026.The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02045 2026-03-03 cs.CL

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) William & Mary(威廉与玛丽学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。

Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21914 2026-03-03 cs.CL

Rote Learning Considered Useful: Generalizing over Memorized Data in LLMs

机械记忆被视为有用的:在大语言模型中超越记忆数据

Qinyuan Wu, Soumi Das, Mahsa Amani, Bishwamittra Ghosh, Mohammad Aflah Khan, Krishna P. Gummadi, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德伦大学) UAR RC Trust(UAR RC信托)

AI总结 本研究提出了一种两阶段框架,证明大语言模型可通过语义有意义的提示超越机械记忆数据,实现了有效的知识注入和潜在的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21533 2026-03-03 cs.RO cs.AI

Model Predictive Adversarial Imitation Learning for Planning from Observation

基于模型预测的对抗模仿学习用于从观察中规划

Tyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo, Anubhav Vishwakarma, Emily Kang, Sanghun Jung, Rosario Scalise, Jason Zhou, Bryan Xu, Byron Boots

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02477 2026-03-03 cs.CV cs.GR

Topology-Preserved Auto-regressive Mesh Generation in the Manner of Weaving Silk

保持拓扑结构的自回归网格生成:如编织丝绸般的方法

Gaochao Song, Zibo Zhao, Haohan Weng, Jingbo Zeng, Rongfei Jia, Shenghua Gao

机构 * University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Hunyuan 3D(腾讯 Hunyuan 3D) Math Magic

AI总结 本文提出了一种保持拓扑结构的自回归网格生成方法,通过顶点分层和排序实现规范拓扑框架,提升网格生成的几何完整性和压缩效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19733 2026-03-03 cs.CL

Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?

打破壁垒:强化学习后训练的增益是否能转移到未见领域?

Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究探讨了强化学习后训练在不同领域中的泛化能力,发现其增益在不同推理模式的领域中不一致。

Comments ICLR 2026; 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18184 2026-03-03 cs.LG

Memba: Membrane-driven Parameter-Efficient Fine-Tuning for Mamba

Memba: 用于Mamba的膜驱动参数高效微调

Donghyun Lee, Yuhang Li, Ruokai Yin, Shiting Xiao, Priyadarshini Panda

机构 * Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Electrical Engineering, Yale University(耶鲁大学电气工程系)

AI总结 Memba提出了一种针对Mamba的膜驱动PEFT方法,通过引入LIM神经元和LoRA结合跨层膜传输,提升时间建模能力,实现高效微调。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16640 2026-03-03 cs.CL cs.AI

Long-Context Generalization with Sparse Attention

长上下文泛化与稀疏注意力

Pavlo Vasylenko, Hugo Pitorro, André F. T. Martins, Marcos Treviso

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司) ELLIS Unit Lisbon(里斯本ELLIS单位)

AI总结 本文提出ASEntmax,通过动态稀疏注意力机制提升长上下文泛化能力,在合成任务和语言建模中表现优于传统softmax和α-entmax方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14205 2026-03-03 cs.CL

AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents

AgentSynth: 通用计算机使用代理的可扩展任务生成

Jingxu Xie, Dylan Xu, Xuandong Zhao, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 AgentSynth通过生成多样化任务和轨迹数据集,提升通用计算机使用代理的训练效率和性能评估的准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06905 2026-03-03 cs.AI cs.CL cs.CV cs.LG

Meta-Adaptive Prompt Distillation for Few-Shot Visual Question Answering

元适应性提示蒸馏用于少样本视觉问答

Akash Gupta, Amos Storkey, Mirella Lapata

AI总结 本文提出元适应性提示蒸馏方法,通过固定软提示提升少样本视觉问答性能,实验表明在低数据情况下优于ICL和参数高效微调方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05639 2026-03-03 cs.CL cs.LG

FictionalQA: A Dataset for Studying Memorization and Knowledge Acquisition

FictionalQA: 一个用于研究记忆与知识获取的数据集

John Kirchenbauer, Janny Mongkolsupawan, Yuxin Wen, Tom Goldstein, Daphne Ippolito

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 FictionalQA数据集旨在研究语言模型在记忆事实和序列时的双重过程,通过合成的虚构事件文档和问题-答案对,探索不同形式的记忆机制及构建挑战。

Comments 10 pages and 8 figures in the main body. Published at ICLR 2026. Dataset is available at https://huggingface.co/datasets/jwkirchenbauer/fictionalqa, and code at https://github.com/jwkirchenbauer/fictionalqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05619 2026-03-03 cs.AI cs.LG

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

超越RLHF和NLHF:在公理框架下的人口比例对齐

Kihyun Kim, Jiawei Zhang, Asuman Ozdaglar, Pablo A. Parrilo

机构 * MIT LIDS(麻省理工学院LIDS) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏