Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
长周期代理任务的分层组策略优化
机构 * Nanyang Technological University(南洋理工大学) ; Southeast University(东南大学)
AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。
Comments Accepted at ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
长周期代理任务的分层组策略优化
机构 * Nanyang Technological University(南洋理工大学) ; Southeast University(东南大学)
AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。
Comments Accepted at ICLR 2026
SceneTransporter: 基于最优传输的组合潜在扩散模型用于单图像结构化3D场景生成
机构 * Xi’an Research Institute of Hi-Tech(西安高新技术研究院) ; Tsinghua University(清华大学) ; SkyWork AI ; Tongji University(同济大学) ; Fudan University(复旦大学) ; Beijing Normal University(北京师范大学)
AI总结 SceneTransporter通过最优传输引导的组合潜在扩散模型,提升单图像结构化3D场景生成的实例连贯性和几何保真度。
Comments published at iclr 2026
无标题,无问题:通过模型拟合嵌入进行无标题成员推断
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
AI总结 本文提出MoFit框架,通过模型拟合嵌入实现无标题成员推断,克服了传统方法对真实标题的依赖,提升了在无标注场景下的成员推断性能。
Comments Accepted to ICLR 2026
潜在自我反思:模型可以检测先前概念注入
机构 * ACS Research, CTS, Charles University(ACS研究机构、CTs、查尔斯大学)
AI总结 Qwen 32B模型能检测并识别先前注入的概念,通过提供准确的AI自我反思机制信息可显著提升检测效果,同时提高注入概念间的互信息。
Comments 28 pages, 17 figures. Submitted to ICML 2026. Workshop version submitted to ICLR 2026 Workshop on Latent and Implicit Thinking
通过证据不确定性量化检测大视觉-语言模型的误行
机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) ; School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) ; Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)
AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。
Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ
工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试
AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。
Comments ICLR 2026, Website: https://toolathlon.xyz/
PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述
机构 * Columbia University(哥伦比亚大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; The National Gallery of Art(国家艺术馆) ; UCLA(加州大学洛杉矶分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 PoSh通过利用场景图引导LLM-as-a-Judge,提供了一种更准确的详细图像描述评估方法,并展示了其在新数据集DOCENT中的优越表现。
Comments Accepted at ICLR 2026. 26 pages, 9 figures. Metric/benchmark available at https://github.com/amith-ananthram/posh
G4Splat:基于生成先验的几何引导高斯点云法
机构 * Tsinghua University(清华大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI ; Peking University(北京大学)
AI总结 G4Splat通过几何引导的生成先验提升3D场景重建,有效解决多视角不一致性问题,实现高质量场景补全。
Comments ICLR'26. Project page: https://dali-jack.github.io/g4splat-web/
超越显式参考策略的改进离散扩散解掩政策
机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院) ; School of Computing, KAIST(计算学院,韩国科学技术院)
AI总结 本文提出了一种基于学习调度器的改进离散扩散解掩策略,通过KL正则化马尔可夫决策过程优化,显著提升了在多个基准测试中的性能。
Comments Accepted to ICLR 2026
异步去噪扩散模型用于文本到图像生成对齐
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出异步扩散模型,通过为不同像素分配不同时间步以改进文本到图像生成的对齐效果。
Comments Accepted to ICLR 2026, 25 pages, 13 figures, 6 tables
在对抗模仿学习中发现算法
机构 * University of Oxford(牛津大学) ; Singapore Management University(新加坡管理大学) ; IIIT Hyderabad(海得拉巴印度理工学院)
AI总结 本文提出DAIL算法,通过数据驱动方法发现奖励分配函数,实现更稳定的对抗模仿学习性能。
Comments Accepted at ICLR 2026 (Poster)
在模型编辑中正确进行微调
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室、计算技术研究所、中国科学院大学)
AI总结 本文提出LocFT-BF方法,通过恢复微调的广度优先管道并改进调参策略,在模型编辑中显著提升了效果,实现了大规模编辑任务的高效处理。
Comments Accepted as a conference paper at ICLR 2026
PartSAM: 一种可提示的部件分割模型,基于原生3D数据训练
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Hong Kong University of Science and Technology(香港科技大学) ; The University of Hong Kong(香港大学) ; National University of Singapore(新加坡国立大学) ; Lingnan University(岭南大学) ; Macau University of Science and Technology(澳门科学理工学院)
AI总结 PartSAM是一种基于大规模3D数据训练的可提示部件分割模型,通过三平面双分支编码器实现可扩展的部件感知表示学习,能够通过单个提示实现高精度部件识别,并自动分解为表面和内部结构。
Comments ICLR 2026. Project Page: https://czvvd.github.io/PartSAMPage/
Softmax 注意力的统计优势:来自单位置回归的见解
机构 * Institute of Mathematics, EPFL(EPFL数学研究所) ; Statistical Physics of Computation Laboratory, École Polytechnique Fédérale de Lausanne(计算统计物理实验室,瑞士联邦理工学院) ; Inria, École Normale Supérieure, PSL Research University(Inria,巴黎高等师范学院,PSL研究大学) ; Laboratoire de Mathématiques d’Orsay, Université Paris Saclay and Institut Universitaire de France(奥赛数学实验室,巴黎萨克雷大学及法国国家科学院) ; Departement d’Informatique, École Normale Supérieure, PSL & CNRS(信息科学系,巴黎高等师范学院,PSL与CNRS)
AI总结 本文研究了softmax注意力在单位置回归任务中的统计优势,证明其在高维极限下能实现贝叶斯风险,优于线性注意力,并探讨了其他激活函数的性能特性。
Comments Accepted at the ICLR 2026
Journal ref ICLR 2026
稀疏想象用于高效的视觉世界模型规划
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
AI总结 本文提出稀疏想象方法,通过减少标记处理数量提升视觉世界模型规划效率,同时保持高控制保真度。
Comments Accepted to ICLR 2026; Project Page: https://nikriz1.github.io/sparse_imagination/
扩散模型的空间时间:信息几何视角
机构 * Aalto University(阿alto大学) ; Technical University of Denmark(技术大学) ; YaiYai Ltd(YaiYai公司)
AI总结 本文从信息几何视角提出扩散模型的空间时间结构,通过引入潜在空间时间z=(x_t,t)构建非平凡几何结构,实现高效的测地线计算和扩散编辑距离,应用于分子系统过渡路径采样。
Comments ICLR 2026 (Oral)
Compositional-ARC: 评估抽象空间推理中的系统泛化能力
AI总结 本研究通过元学习方法在抽象空间推理领域实现系统泛化,展示了一个小型模型在组合变换任务上的优越表现。
Comments ICLR 2026, 37 pages, 15 figures
Dual-IPO: 双迭代偏好优化用于文本到视频生成
机构 * Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。
Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO
CGSA: 基于类引导的槽感知适应用于无源对象检测
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Department of Electrical & Computer Engineering, National University of Singapore(电气与计算机工程系,新加坡国立大学) ; School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学)
AI总结 CGSA通过引入对象中心学习,结合槽感知适应和类引导的槽对比模块,提升无源领域自适应对象检测的性能。
Comments The paper has been accepted by the conference ICLR 2026
Relatron: 在关系数据库上自动化关系机器学习
机构 * Michigan State University(密歇根州立大学) ; Amazon(亚马逊)
AI总结 Relatron通过任务嵌入的元选择器在关系数据库任务中选择RDL或DFS,并通过轻量级度量优化架构搜索,提升性能并减少计算成本。
Comments ICLR 2026
RAIN-Merging: 一种无梯度方法,用于在保持推理格式的前提下提升大推理模型的指令遵循能力
机构 * Institute of Image Processing and Pattern Recoginition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理国家重点实验室(上海))
AI总结 RAIN-Merging通过无梯度方法提升大推理模型的指令遵循能力,同时保持推理格式和性能。
Comments 41 pages, ICLR 2026 Oral
因果 ≠ 不变:大型语言模型中的函数向量与概念向量
AI总结 本文研究了LLMs中函数向量与概念向量的差异,发现FVs在不同输入格式下不不变,而CVs能提供更稳定的概念表示,且在跨语言和问题类型时表现更优。
Journal ref Opielka, G., Rosenbusch, H., & Stevenson, C. E. (2026). Causality != Invariance: Function and Concept Vectors in LLMs. In Proceedings of the International Conference on Learning Representations (ICLR 2026)
时间稀疏自编码器:利用语言的序列性质实现可解释性
机构 * Harvard School of Engineering and Applied Science(哈佛工程与应用科学学院) ; Kempner Institute for the Study of Natural & Artificial Intelligence(自然与人工智能研究学院) ; Harvard Business School(哈佛商学院)
AI总结 时间稀疏自编码器通过引入对比损失,有效解耦语义与语法特征,提升语言模型的可解释性。
Comments 29 Pages, 12 figures. Accepted as an Oral Presentation at ICLR 2026
通过几何旋转映射语义与语法关系
机构 * TELUS Digital(TELUS数字公司)
AI总结 RISE通过几何旋转方法在多语言嵌入空间中实现话语层面语义-语法转换的一致映射,支持线性表示假设。
Comments 10 pages, 4 figures, 3 tables, 8 appendices, Published at ICLR 2026
Journal ref The International Conference on Learning Representations (2026)
生成价值冲突揭示大语言模型优先级
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
AI总结 生成价值冲突揭示大语言模型优先级,通过ConflictScope评估模型在价值冲突中的优先级,发现模型在开放式设置中更支持个人价值,系统提示能提高对齐效果14%。
Comments Accepted to ICLR 2026 (the 14th International Conference on Learning Representations)
在线时间序列预测使用特征调整
AI总结 本文提出ADAPT-Z方法,通过调整特征表示来提升在线时间序列预测的性能,有效应对分布偏移和延迟反馈问题。
Comments Camera ready version for ICLR 2026
当大多模态模型面对不断演变的知识:挑战与探索
AI总结 本文提出MMEVOKE基准,探讨了多模态模型在动态演变知识注入中的挑战,并提出知识增强和保留方法以提升注入性能和缓解能力退化。
Comments ICLR 2026, Project Page: https://evoke-lmm.github.io/
通过模块化技能包实现大语言模型的知识融合
AI总结 GraftLLM通过模块化技能包实现大语言模型的知识融合,提升跨能力迁移的效率和效果。
Comments Accepted at ICLR 2026
GeoDiv:文本到图像模型中地理多样性测量的框架
机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) ; Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) ; Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)
AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。
Comments ICLR 2026
在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索
机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) ; Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) ; Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) ; Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)
AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。
Comments Published as a conference paper at ICLR 2026