Causal Interpretation of Neural Network Computations with Contribution Decomposition
神经网络计算的因果解释与贡献分解
AI总结 CODEC通过稀疏自编码器分解神经网络的贡献模式,揭示因果过程并提升对中间层的控制与解释。
Comments 32 pages, 19 figures. ICLR 2026 poster
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
神经网络计算的因果解释与贡献分解
AI总结 CODEC通过稀疏自编码器分解神经网络的贡献模式,揭示因果过程并提升对中间层的控制与解释。
Comments 32 pages, 19 figures. ICLR 2026 poster
当一种模态统治一切:多模态扩散模型中的后门模态崩溃
机构 * University of Delaware(德克萨斯大学) ; Illinois Institute of Technology(伊利诺伊理工学院) ; Columbia University(哥伦比亚大学)
AI总结 本文研究了多模态扩散模型中后门攻击的模态崩溃现象,发现攻击常依赖单一模态,跨模态交互反而降低攻击效果,揭示了现有评估的盲点。
Comments Accepted to the ICLR 2026 Workshop on Principled Design for Trustworthy AI. The first two authors contributed equally
COLD-Steer: 通过上下文一步学习动态引导大型语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 COLD-Steer通过近似学习动态实现无需训练的LLM引导,有效提升引导效果并减少样本需求。
Comments ICLR 2026. Code available at https://github.com/Ksartik/cold-steer
ROSER:用于可扩展机器人学习的少样本机器人序列检索
机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) ; University of Toronto(多伦多大学) ; LatentWorlds AI
AI总结 ROSER通过少样本检索框架有效解决机器人序列数据稀缺问题,提升机器人学习的数据可用性。
Comments 2026 ICLR DATA-FM Workshop
长上下文推理在自动化Bug修复中的局限性
机构 * SambaNova Systems(SambaNova系统)
AI总结 本研究发现长上下文推理在自动化Bug修复中存在显著局限,现有模型在长上下文下的表现远低于预期。
Comments Accepted to ICLR 2026 ICBINB workshop
验证siRNA效用预测中的可解释性:一种基于扰动、数据集感知的协议
机构 * University of Central Florida(中央佛罗里达大学)
AI总结 本文提出了一种验证siRNA效用预测中重要性图忠实性的协议,发现模型在不同数据集上表现不稳定,并引入了基于生物学的正则化器来提升重要性忠实性。
Comments Accepted at the Machine Learning for Genomics Explorations (MLGenX) Workshop at ICLR 2026
Journal ref ICLR 2026 Workshop on Machine Learning for Genomics Explorations (MLGenX)
先行动,后提问?构建能探索和行动像人的理性代理
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学) ; Harvard SEAS(哈佛大学工程学院)
AI总结 本文提出了一种基于贝叶斯实验设计的蒙特卡洛推理策略,用于构建能像人类一样探索和行动的理性代理,在战舰和Guess Who?任务中提升了代理性能。
Comments ICLR 2026
语言模型微基准测试的可靠性如何?
AI总结 研究探讨了微基准测试在不同规模下的可靠性,发现需至少250个示例才能一致排序模型,随机抽样在某些情况下与现有方法相当。
Comments Published at ICLR 2026
CMRAG:基于共模的视觉文档检索与问答
机构 * Baidu Inc(百度公司) ; The University of Hong Kong(香港大学) ; Beihang University(北京航空航天大学) ; Peking University(北京大学)
AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。
Comments Published at ICLR 2026 Workshop on Multimodal Intelligence
Sysformer: 通过自适应系统提示保护冻结的大语言模型
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Visa Research(Visa研究)
AI总结 Sysformer通过自适应系统提示提高大语言模型的安全性,显著提升对有害提示的拒绝率和对安全提示的合规性。
Comments ICLR 2026. Code available at https://github.com/Ksartik/sysformer
ContextBench: 为定向激活潜在特征修改上下文
机构 * Imperial College London(帝国理工学院伦敦校区) ; University College London(伦敦大学学院) ; University of Oxford(牛津大学) ; UK AI Security Institute(英国人工智能安全研究所)
AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。
Comments Published at ICLR 2026
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法
AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。
Comments This paper is accepted by ICLR 2026(Oral)
基于动力学的正则化:学习空间导数和PDE应用
机构 * Engineering Mechanics Unit(工程力学单元) ; Jawaharlal Nehru Centre for Advanced Scientific Research(贾瓦哈拉尔·奈尔中心先进科学研究所) ; Fondazione Istituto Italiano di Tecnologia(意大利技术研究院)
AI总结 本文提出基于动力学的正则化方法,用于高精度学习空间导数并应用于偏微分方程的求解,通过两种方案实现二次收敛性,提升在不规则点云上求解PDE的稳定性与准确性。
Comments Published as a conference paper at ICLR 2026 Workshop AI and PDE
SAHOO:递归自我改进中高阶优化目标的安全保障
机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) ; AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) ; Google, USA(谷歌) ; Stanford University(斯坦福大学) ; Northeastern University, Seattle, WA, USA(东北大学)
AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。
Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures
学习物理所在的位置:用于刚性PDEs的概率自适应采样
机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯学院)
AI总结 本文提出GMM-PIELM方法,通过概率模型自适应采样,有效解决刚性PDEs中的刚性问题,实现高精度与高速度的平衡。
Comments Accepted at AI&PDE Workshop at the Fourteenth International Conference on Learning Representations
学习解决带有时间窗口和可变利润的指派问题
AI总结 本文提出DeCoST方法,通过解耦离散和连续变量并结合学习机制,有效解决带有时间窗口和可变利润的指派问题,提升解质量和计算效率。
Comments Accepted at ICLR 2026
MOSIV:从视频中多物体系统识别
机构 * CMU(卡内基梅隆大学) ; Georgia Tech(佐治亚理工学院) ; Harvard(哈佛大学) ; ETH Zurich(苏黎世联邦理工学院) ; UIUC(伊利诺伊大学香槟分校) ; Insta360 ; UC Merced(加州大学默塞德分校)
AI总结 MOSIV通过从视频中导出的几何目标直接优化连续材料参数,提升多物体系统识别的接地准确性和模拟保真度。
Comments ICLR 2026
Weak-SIGReg: 均值正则化用于稳定的深度学习
机构 * Kreasof AI Jakarta, Indonesia(Kreasof AI 印度尼西亚雅加达)
AI总结 Weak-SIGReg通过协方差正则化稳定深度学习训练,有效恢复ViT在低数据情况下的性能并提升MLP收敛性。
Comments Accepted at GRaM workshop (ICLR 2026). Code & supplementary: https://github.com/kreasof-ai/sigreg
层次化潜在动作模型
机构 * Yonsei University(延世大学) ; New York University(纽约大学)
AI总结 HiLAM通过建模长期时间信息,从无动作视频中发现高层次潜在技能,提升了动态技能发现的鲁棒性。
Comments ICLR 2026 Workshop - 2nd Workshop on World Models: Understanding, Modelling and Scaling
MoE Lens -- 一个专家足矣
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of Maryland(马里兰大学) ; Harvard University(哈佛大学)
AI总结 MoE Lens研究显示,MoE模型主要依赖少数专家,通过针对性剪枝可优化推理,同时保持性能。
Comments 15 pages, 10 figures, ICLR 2025 Workshop on Sparsity in LLMs (SLLM)
ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性
机构 * SCB DataX(SCB数据X) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; SCBX R&D(SCBX研发部) ; SCB 10X
AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。
Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI
面向刚性的几何预训练用于蛋白质设计与构象集合
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学) ; MPI for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所,图宾根) ; National Research Council of Canada(加拿大国家研究理事会) ; University of Ottawa(渥太华大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 RigidSSL通过刚性感知的几何预训练,提升蛋白质设计和构象集合的生成能力。
Comments The Fourteenth International Conference on Learning Representations; Code available at: https://github.com/ZhanghanNi/RigidSSL.git
探索性记忆增强型大语言模型代理:通过混合的在线与离线策略优化
机构 * Microsoft Research(微软研究院) ; KAIST(韩国科学技术院)
AI总结 EMPO²通过混合在线与离线策略优化,提升大语言模型在探索性和通用性方面的性能。
Comments Accepted to ICLR 2026
通过提示级策略欺骗进行对齐审计压力测试
机构 * MATS ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Google Deepmind(谷歌DeepMind)
AI总结 本文提出自动红队流水线,通过生成针对白盒和黑盒审计方法的欺骗提示,揭示了当前对齐审计方法在面对强大非对齐模型时的脆弱性。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI
COMI:通过边际信息增益的粗到细上下文压缩
机构 * Tsinghua University(清华大学) ; Future Living Lab of Alibaba(阿里巴巴未来生活实验室) ; Sun Yat-sen University(中山大学)
AI总结 COMI通过边际信息增益实现粗到细的上下文压缩,在长上下文任务中提升压缩效率和语义保留能力。
Comments Accepted at ICLR 2026
理解并改进双曲深度强化学习
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) ; Department of Machine Learning and Systems Biology, Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所机器学习与系统生物学部门) ; ds:UniVie, University of Vienna(维也纳大学ds:UniVie)
AI总结 Hyper++通过改进双曲深度RL的训练稳定性与效率,提升了强化学习性能。
Comments ICLR 2026 Camera-ready
Whatever Remains Must Be True: 过滤驱动LLM推理,塑造多样性
机构 * NAVER Labs Europe(NAVER欧洲实验室)
AI总结 本文通过过滤错误答案获得目标分布,利用α-散度族控制精度与多样性权衡,提升LLM在推理任务中的覆盖与精度表现。
Comments Published as an ICLR 2026 conference paper
通过软Q函数的重参数化策略梯度进行扩散微调
AI总结 SQDF通过软Q函数的重参数化策略梯度方法,解决扩散模型奖励过优化问题,提升样本多样性和自然性。
Comments ICLR 2026
ParaS2S:用于基于语篇语言模型的语音到语音交互的基准测试与对齐
AI总结 ParaS2S通过强化学习框架提升语音到语音交互中对语篇线索的处理能力,实现响应内容和风格的显著改进。
Comments To appear in ICLR 2026
LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解
机构 * University of Oxford(牛津大学) ; MBZUAI(穆斯林人工智能研究所) ; University of Chicago(芝加哥大学) ; UWE Bristol(布里斯托尔大学)
AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。
Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/
Journal ref ICLR 2026