How Far Can Unsupervised RLVR Scale LLM Training?
无监督强化学习如何扩展大语言模型训练?
AI总结 本文研究了无监督强化学习如何扩展大语言模型训练,分析了内在和外部奖励方法的理论和实验结果,揭示了模型先验对训练效果的影响,并提出了模型崩溃步骤作为评估指标。
Comments Accepted to the ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
无监督强化学习如何扩展大语言模型训练?
AI总结 本文研究了无监督强化学习如何扩展大语言模型训练,分析了内在和外部奖励方法的理论和实验结果,揭示了模型先验对训练效果的影响,并提出了模型崩溃步骤作为评估指标。
Comments Accepted to the ICLR 2026
欧几里得聚类的分布式算法
AI总结 本文提出分布式环境下欧几里得聚类的高效算法,通过改进通信复杂度实现(1+ε)-近似保证。
Comments ICLR 2026
漂移到行动控制器:具有在线风险证书的预算干预
机构 * Multidisciplinary Faculty of Nador(多学科纳多 faculty) ; Mohammed First University(穆罕默德第一大学) ; Laboratory LaSTI(LaSTI 实验室) ; Sultan Moulay Slimane University(苏丹·穆莱·斯利曼大学)
AI总结 Drift2Act通过在线风险证书实现预算干预,有效应对分布漂移,减少安全违规并提高恢复速度。
Comments Published as a conference paper at CAO Workshop at ICLR 2026
HDR-NSFF:高动态范围神经场景流场
机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) ; Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) ; Grad. School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; School of Computing, KAIST(韩国科学技术院计算机科学学院)
AI总结 HDR-NSFF通过4D时空建模实现动态HDR场景的高精度辐射场重建与时空视图合成。
Comments ICLR 2026. Project page: https://shin-dong-yeon.github.io/HDR-NSFF/
迈向更高效的金融语言模型偏见检测
机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) ; RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI学院)
AI总结 本研究通过大规模分析五个金融语言模型的偏见,提出跨模型引导的偏见检测方法,显著降低偏见检测成本。
Journal ref ICLR 2026 Workshop on Advances in Financial AI (AFA)
SiMO: 单模态可操作的多模态协作感知
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统上海研究院) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; School of Mechatronic Engineering and Automation, Shanghai University(上海大学机械电子工程与自动化学院)
AI总结 SiMO通过单模态可操作的多模态协作感知方法,解决多模态特征融合中的语义不匹配问题,提升协作感知性能。
Comments Accepted to ICLR 2026. This arXiv version includes an additional appendix (Appendix 15) containing further philosophical discussion not included in the official ICLR peer-reviewed version
TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里集团达摩院) ; Hupan Lab(虎扑实验室) ; Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) ; Shengjing Hospital of China Medical University(中国医科大学盛京医院) ; Sun Yat-sen University Cancer Center(中山大学肿瘤中心)
AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。
Comments Accepted at ICLR 2026. 10 pages + appendix
从EEG信号进行自回归视觉解码
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启智技术国家重点实验室) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 AVDE通过自回归生成框架和对比学习提升EEG信号的视觉解码效率,实现高效且可解释的脑机接口应用。
Journal ref ICLR 2026
大型语言模型新闻情感分析对股价变动预测的影响
机构 * SnT, University of Luxembourg(卢森堡大学SnT学院) ; RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI学院)
AI总结 本文研究了基于大型语言模型的新闻情感分析对股价预测的影响,发现DeBERTa模型在预测准确度上表现最佳,集成模型进一步提升了预测性能。
Journal ref ICLR 2026 Workshop on Advances in Financial AI (AFA)
RedSage:一种网络安全通用型大语言模型
AI总结 RedSage通过领域感知的代理增强和预训练,提升网络安全专长和通用推理能力,实现开源本地部署。
Comments Published at ICLR 2026; Project page: https://risys-lab.github.io/RedSage/
基于树结构的对话强化策略优化用于红队攻击
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Oracle AI ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出DialTree框架,通过树搜索和强化学习发现多轮攻击策略,提升对抗攻击的成功率
Comments Accepted at ICLR 2026
在马尔可夫决策过程中的个性化结果的正交学习者
机构 * LMU Munich(慕尼黑莱茵豪森大学)
AI总结 本文提出DRQ-学习器,通过因果推理方法在马尔可夫决策过程中实现个性化结果预测,具备双重稳健、奈曼正交和近似Oracle效率等理论优势。
Comments Published as a conference paper at ICLR 2026
Co-LoRA:在异构多模态客户端上的协同模型个性化
机构 * KU Leuven(库勒芬大学) ; Seoul National University(首尔国立大学) ; Sungkyunkwan University(成均馆大学)
AI总结 Co-LoRA通过任务相关性感知的模型聚合和维度不变模块,实现了在异构多模态客户端上的协同模型个性化,提升了在异构场景下的性能。
Comments ICLR 2026
Climplicit:用于全球生态任务的气候隐式嵌入
机构 * EcoVision Lab, DM3L, University of Zurich(生态视觉实验室、DM3L、苏黎世大学) ; Swiss Federal Research Institute WSL(瑞士联邦研究 institute WSL)
AI总结 Climplicit通过预训练生成隐式气候表示,减少存储和计算需求,提升全球生态任务的效率和效果。
Comments Published as a workshop paper at "Tackling Climate Change with Machine Learning", ICLR 2025
揭示大语言模型下游性能扩展:基于聚类的视角
机构 * Bytedance Seed(字节跳动种子)
AI总结 本文提出基于难度聚类的框架,用于预测大语言模型下游任务性能,通过构建稳定子集和理论支持的扩展定律,实现更准确的性能预测。
Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR2026)
LaVCa: 基于大语言模型的视觉皮层描述生成
机构 * University of Osaka(大阪大学) ; National Institute of Information and Communications Technology(信息与通信技术国家研究所) ; Nagoya Institute of Technology(名古屋技术大学)
AI总结 LaVCa利用大语言模型生成视觉皮层体素选择性的详细描述,提升对大脑表示的理解。
Comments Accepted to ICLR 2026. Website: https://sites.google.com/view/lavca-llm/
可控制的序列编辑用于生物和临床轨迹
AI总结 CLEF通过学习时间概念实现对生物和临床轨迹的可控编辑,提升序列生成精度和反事实推理能力。
Comments ICLR 2026
GRADIEND: 通过偏见在神经网络中学习特征
AI总结 GRADIEND通过利用模型梯度学习特征神经元,旨在消除模型中的社会偏见并保持其他能力。
Comments Accepted at ICLR 2026
连续的推理是否更适合多语言推理?
机构 * Lamarr Institute(拉马尔研究所) ; Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) ; University of Bonn(波恩大学)
AI总结 本文提出连续链式推理方法,证明其在多语言推理任务中优于传统方法,尤其在低资源语言和零样本设置中表现更优,同时显著提升推理效率。
Comments Accepted at the ICLR latent reasoning workshop
基于鲁棒价值感知模型学习的模型驱动离线RL
机构 * CityUHK(城大) ; Tencent(腾讯) ; UChicago(芝加哥大学) ; HKUST(GZ)(香港科技大学(广州))
AI总结 ROMI通过鲁棒价值感知模型学习和隐式可微适应加权方法,改进离线RL中的模型更新稳定性与泛化能力。
Comments Accepted at ICLR 2026
微型自回归递归模型
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出自回归TRM,评估其在小型自回归任务上的表现,发现两步细化基线表现强劲,但完整架构未见显著性能提升。
Journal ref ICLR 2026 Workshop RSI Spotlight
ELLMob: 基于自对齐LLM框架的事件驱动人类移动生成
机构 * Institute of Science Tokyo(东京科学研究所) ; The University of Tokyo(东京大学) ; The University of Osaka(大阪大学)
AI总结 ELLMob 基于自对齐LLM框架,通过提取习惯模式与事件约束的竞争性理由并迭代对齐,生成既符合习惯又响应事件的轨迹,有效解决大规模社会事件中的移动模式生成问题。
Comments Accepted by ICLR 2026
从享乐博弈到图像分割:联盟形成的可视化
机构 * UFRJ(里约热内卢联邦大学)
AI总结 本文通过图像分割技术研究享乐博弈中联盟形成的过程,揭示细粒度参数对均衡结构的影响,并将多代理系统与图像分割联系起来。
Comments The First Workshop on AI for Mechanism Design and Strategic Decision Making -- Workshop AIMS at ICLR 2026
VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?
机构 * KRAFTON ; KAIST(韩国科学技术院)
AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。
Comments ICLR 2026
魁北克保险领域大型语言模型基准测试:从闭卷到检索增强生成
机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组)
AI总结 本文提出AEPC-QA基准测试,评估51个LLM在魁北克保险领域的闭卷和检索增强生成性能,揭示推理、RAG效果及专业化悖论等关键发现。
Comments Publish at the Advances in Financial AI: Towards Agentic and Responsible Systems Workshop @ ICLR 2026
不确定性门控生成建模
机构 * Electrical Engineering and Computer Science University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) ; School of Electrical and Computer Engineering Cornell University(康奈尔大学电气与计算机工程学院)
AI总结 本文提出UGGM方法,通过不确定性门控机制提升金融时间序列预测的鲁棒性和准确性,实验显示在NYISO数据集上MSE显著降低。
Comments Accepeted by ICLR 2026 Workshop Advances in Financial AI
Journal ref ICLR 2026
隐藏与寻找:联邦图学习中的分布式对抗攻击
机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络 security 重点实验室) ; Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) ; School of Distance Education, Xi’an Jiaotong University(西安交通大学继续教育学院)
AI总结 FedShift是一种新的两阶段分布式对抗攻击方法,通过在训练前注入隐藏的位移器和训练后聚合扰动,有效提升联邦图学习的攻击效果和隐蔽性。
Comments Accepted at ICLR 2026 Workshop: Principled Design for Trustworthy AI
反蒸馏:一致地扩展蛋白质语言模型表示
机构 * Department of Computer Science(计算机科学系) ; Duke University(杜克大学) ; Center for Computational Biology(计算生物学中心) ; Flatiron Institute(Flatiron研究所) ; Depts of Biostats. and Bioinformatics(生物统计学与生物信息学系;细胞生物学系) ; and Cell Biology
AI总结 反蒸馏通过分解大型蛋白质语言模型表示为正交子空间,使较大模型在相同维度下始终优于较小模型,提升了蛋白质特征编码效果。
Comments Proceedings of ICLR 2026
Helix:基于进化强化学习的开放性科学问题求解
机构 * Bosch (China) Investment Co., Ltd.(博世(中国)投资有限公司) ; Tsinghua-Bosch Joint Center for ML, Tsinghua University(清华大学-博世联合人工智能中心,清华大学) ; Dept. of EE, Tsinghua University(清华大学电子工程系) ; Dept. of Comp. Sci. & Techn., Tsinghua University(清华大学计算机科学与技术系)
AI总结 HELIX通过分层进化强化学习框架,在开放性科学问题求解中实现了先进解决方案的发现,其在圆圈装箱任务中取得state-of-the-art结果,并在机器学习基准测试中超越GPT-4o。
Comments Accepted at ICLR 2026
通过扩散变换器生成大肠杆菌3D基因组结构的接触引导方法
机构 * The University of Tokyo(东京大学) ; University of Michigan(密歇根大学) ; Waseda University(早稻田大学)
AI总结 本文提出基于扩散变换器的框架,通过Hi-C接触图引导生成大肠杆菌3D基因组结构的集合,展现生成建模在集合层面3D基因组重建中的有效性。
Comments Accepted at the Gen2 Workshop at ICLR 2026