Less is More: Clustered Cross-Covariance Control for Offline RL
少即是多:用于离线强化学习的聚类交叉协方差控制
AI总结 本文提出了一种用于离线强化学习的聚类交叉协方差控制方法,通过分区缓冲区采样和梯度修正惩罚,减少分布偏移带来的影响,提升策略学习的稳定性和性能。
Comments accepted by ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
少即是多:用于离线强化学习的聚类交叉协方差控制
AI总结 本文提出了一种用于离线强化学习的聚类交叉协方差控制方法,通过分区缓冲区采样和梯度修正惩罚,减少分布偏移带来的影响,提升策略学习的稳定性和性能。
Comments accepted by ICLR 2026
IterResearch: 重新思考长视界智能体与交互扩展
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室)
AI总结 IterResearch通过交互扩展范式提升长视界推理能力,实现高效探索与稳定训练,显著提升性能并缩小与前沿系统的差距。
Comments Camera Ready version for ICLR 2026. https://github.com/Chen-GX/IterResearch
使用多模态语义扰动检测VLMs中的污染
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; Kookmin University(韩国庆北大学)
AI总结 本文提出了一种基于多模态语义扰动的检测方法,用于识别和验证受污染的视觉语言模型。
Comments Accepted at ICLR 2026
NeMo-map:基于神经隐式流场的时空运动映射
机构 * Örebro University(奥雷布罗大学) ; Technical University of Munich(慕尼黑技术大学) ; Aalto University(阿alto大学)
AI总结 NeMo-map通过隐式神经函数实现连续时空动态地图,提升复杂人类运动模式建模与轨迹预测性能。
Comments Published as a conference paper at ICLR 2026
近最优的二阶保证用于基于模型的对抗模仿学习
AI总结 本文提出基于模型的对抗模仿学习算法,通过二阶样本复杂性保证,实现近最优的样本效率和理论性能。
Comments 39 pages, 4 figures, 6 tables, accepted by ICLR 2026
Point2RBox-v3: 通过集成伪标签细化和利用实现点标注的自举学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Nankai University(南开大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; East China Normal University(华东师范大学) ; Ohio State University(俄亥俄州立大学)
AI总结 Point2RBox-v3通过集成伪标签细化和利用,实现了点标注的自举学习,有效提升稀疏和密集场景下的检测性能。
Comments 19pages, 5figures, 6tables
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
EditScore: 通过高保真奖励建模解锁图像编辑的在线强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Zhejiang University(浙江大学)
AI总结 EditScore通过高保真奖励建模解锁图像编辑的在线强化学习,提供从基准到奖励建模到RL训练的系统路径。
Comments Accepted to ICLR 2026. Code, models, and benchmark: https://github.com/VectorSpaceLab/EditScore
纠正解耦数据集蒸馏:对公平和全面评估的深入探讨
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
AI总结 本文提出RD$^3$,通过系统研究后评估设置对测试准确率的影响,揭示性能差异主要源于评估不一致,而非合成数据质量,同时提出改进蒸馏数据集效果的通用策略。
Comments Accepted to ICLR 2026
谱贝尔曼方法:在强化学习中统一表示与探索
AI总结 谱贝尔曼方法通过统一表示学习与探索,在强化学习中提出了一种基于贝尔曼误差的新框架,提升长周期任务性能。
Comments Accepted to ICLR 2026
SynCoGen: 通过联合反应和坐标建模实现可合成的3D分子生成
机构 * University of Toronto(多伦多大学) ; The Hospital for Sick Children(多伦多儿童医院) ; University of Cambridge(剑桥大学) ; ETH Zürich(苏黎世联邦理工学院) ; Vector Institute(向量研究所) ; Mila – Quebec AI Institute(魁北克AI研究所) ; McGill University(麦吉尔大学) ; Caltech(加州理工学院)
AI总结 SynCoGen通过联合反应和坐标建模实现可合成的3D分子生成,实现了分子构建块、化学反应和原子坐标的联合分布采样,在无条件小分子生成和药物发现中表现出色。
Comments ICLR 2026
通过分步分解实现离散扩散轨迹对齐
机构 * Stanford University(斯坦福大学) ; Caltech(加州理工学院) ; Tsinghua University(清华大学)
AI总结 本研究提出一种离线偏好优化方法,通过分步分解实现离散扩散模型的轨迹对齐,提升DNA序列设计和语言建模的性能。
Comments ICLR 2026
DistMLIP:一种用于机器学习互原子势的分布式推断平台
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; LBNL(劳伦斯伯克利国家实验室)
AI总结 DistMLIP是一种基于图级并行化的分布式推断平台,可提升机器学习互原子势的模拟效率和规模。
Comments ICLR 2026
多智能体设计:通过更优提示和拓扑结构优化智能体
机构 * Google(谷歌) ; University of Cambridge(剑桥大学)
AI总结 本文提出MASS框架,通过优化提示和拓扑结构提升多智能体系统性能,并揭示了有效构建多智能体系统的原理。
Comments ICLR 2026
MiniLLM: 大语言模型的在线策略蒸馏
机构 * The CoAI Group, Tsinghua University(清华大学CoAI小组) ; Microsoft Research(微软研究院)
AI总结 MiniLLM通过反向KLD和在线策略优化,实现了对大语言模型的有效蒸馏,提升小型模型的生成质量和校准性能。
Comments Published as a conference paper in ICLR 2024
分段属性用于长推理轨迹的选择性学习
机构 * University of Southern California(南加州大学)
AI总结 本文提出一种基于分段属性的选择性学习框架,通过量化标记对最终答案的影响,提升长推理轨迹学习的效率和准确性。
Comments Accepted to ICLR 2026. 16 pages, 5 figures. Code available at https://github.com/SiyuanWangw/SegmentSelectiveSFT
通过边缘正则化减少类别间的性能差异
机构 * Nanyang Technological University(南洋理工大学) ; Hefei University of Technology(合肥工业大学) ; Singapore Management University(新加坡管理学院) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出MR$^2$方法,通过动态调整边缘来减少分类中类别间的性能差异,提升困难类别性能的同时不损害易类别表现。
Comments To appear in ICLR 2026
LLaVA-FA: 通过傅里叶近似压缩大型多模态模型
AI总结 LLaVA-FA通过频域联合低秩和量化近似,实现高效压缩大型多模态模型,采用极坐标量化和对角校准方案,提升压缩效果与效率。
Comments Accepted by ICLR 2026
学习统一的3D高斯散射表示
机构 * UC Irvine(伊利诺伊大学厄巴纳-香槟分校) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出了一种基于连续子流形场的3D高斯散射嵌入表示,以提升基于神经网络的3D高斯散射学习效果。
Comments ICLR 2026
协同sheaf神经网络
机构 * Getulio Vargas Foundation(戈利亚沃斯基金会) ; Federal Institute of Ceará(塞阿拉联邦理工学院)
AI总结 本文提出协同sheaf神经网络,通过引入cellular sheaves概念,解决sheaf扩散中缺乏信息方向性导致无法实现协同行为的问题,并在实验中展示了更好的性能。
Comments Accepted to ICLR 2026