QKV Projections Require a Fraction of Their Memory
QKV投影需要部分内存
机构 * Department of Computer Science Technion, Israel Institute of Technology(计算机科学系技术离子理工学院)
AI总结 本文提出PAMM技术,通过压缩QKV投影的激活值,显著降低内存消耗,同时保持模型性能,适用于高效的大语言模型训练。
Comments Accepted to ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
QKV投影需要部分内存
机构 * Department of Computer Science Technion, Israel Institute of Technology(计算机科学系技术离子理工学院)
AI总结 本文提出PAMM技术,通过压缩QKV投影的激活值,显著降低内存消耗,同时保持模型性能,适用于高效的大语言模型训练。
Comments Accepted to ICLR 2026
VPI-Bench:用于计算机使用代理的视觉提示注入攻击
机构 * National University of Singapore(国立新加坡大学) ; Cyber Emerging Tech and R&D Co(网络安全与研发公司)
AI总结 本文提出VPI-Bench基准,用于评估计算机使用代理和浏览器使用代理在视觉提示注入攻击下的鲁棒性,发现当前代理在某些平台上被欺骗率达51%和100%。
Comments ICLR 2026
CityLens:评估大型视觉-语言模型用于城市社会经济感知
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) ; School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)
AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。
Comments Accepted by ICLR 2026
概率核函数用于快速角度测试
机构 * Yamanashi University(山阳大学) ; Osaka University(大阪大学) ; Nagoya University(名古屋大学)
AI总结 本文提出了一种基于确定性投影结构的概率核函数,用于高维空间中的快速角度测试,实验表明其在近似最近邻搜索中性能优于HNSW算法。
Comments ICLR 2026 Oral, source code available at https://github.com/KejingLu-810/KS
基于令牌重要性的直接偏好优化
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; ByteDance(字节跳动) ; Microsoft Research AI4Science(微软研究院AI4Science) ; University of Science and Technology Beijing(北京科技大学)
AI总结 本文提出TI-DPO方法,通过混合加权机制和三元组损失实现细粒度语义控制,提升模型对偏好响应的准确性和生成多样性。
Comments ICLR 2026 Oral
在大规模生成音乐模型中发现和引导可解释概念
机构 * Dartmouth College(达特茅斯学院) ; MIT(麻省理工学院)
AI总结 本文提出了一种基于稀疏自编码器的方法,在大规模生成音乐模型中发现可解释概念,并用于引导模型生成,揭示了传统方法未发现的音乐结构原理。
Comments ICLR 2026, 20 pages, 12 figures
ICYM2I: 多模态信息性在缺失情况下的错觉
机构 * Department of Biomedical Informatics, Columbia University(生物医学信息学系,哥伦比亚大学) ; Seymour, Paul, and Gloria Milstein Division of Cardiology, Department of Medicine, Columbia University Irving Medical Center(塞缪尔、保罗和格洛丽亚米尔斯坦心脏病科,哥伦比亚大学伊万格琳医学中心)
AI总结 ICYM2I框架通过逆概率加权修正,解决多模态学习中因缺失模式变化导致的信息增益估计偏差问题。
Comments Published as a conference paper at ICLR 2026
mCLM:一种模块化化学语言模型,能够生成功能性强且可制造的分子
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) ; Department of Chemistry, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学系) ; Allchemy Inc.(Allchemy公司) ; Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学与生物分子工程系) ; Ulsan National Institute of Science and Technology(乌山国立科学技术研究院) ; Institute of Organic Chemistry, Polish Academy of Sciences(波兰科学院有机化学研究所)
AI总结 mCLM是一种模块化化学语言模型,通过功能构建模块生成具有功能性和可制造性的分子,提升合成可行性和药物研发效率。
Comments Accepted to ICLR 2026 (Oral). Code: https://github.com/blender-nlp/mCLM Data and Model: https://huggingface.co/collections/language-plus-molecules/mclm
自我毁灭型语言模型
机构 * Department of Computer Science(计算机科学系)
AI总结 SEAM是一种通过自我毁灭机制增强大语言模型安全性的新型防御方法,通过使模型在面对有害数据微调时性能急剧下降,从而有效抵御攻击。
Comments Accepted to ICLR 2026
回到平方根:多轮差分隐私SGD中矩阵分解误差的最优界限
机构 * Institute of Science and Technology (ISTA)(科学与技术研究所) ; Google Research(谷歌研究) ; Rutgers University(罗格斯大学)
AI总结 本文提出BISR方法,通过带状结构优化多轮差分隐私SGD中的矩阵分解误差,实现渐近最优性能。
Comments Published at ICLR 2026
变换器的计数能力
机构 * RPTU Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) ; MPI-SWS(马克斯·普朗克研究所-软件系统研究中心) ; Centro Nacional de Inteligencia Artificial(智人工智能国家中心)
AI总结 本文研究了变换器的计数能力,证明其能表达高度非线性的计数属性,并通过半代数属性扩展了现有结果,同时揭示了变换器模型的不可判定性。
Comments Accepted for ICLR 2026
从阅读中的眼动解码开放性信息寻求目标
机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology(数据与决策科学学院,技术离子-以色列理工学院)
AI总结 本研究首次通过阅读中的眼动数据自动解码开放性信息寻求目标,开发了多模态LLM模型并展示了在目标选择和文本重构上的显著成果。
Comments Accepted to ICLR 2026
AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件
机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) ; Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) ; Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) ; Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) ; Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) ; Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) ; Kunming University of Science and Technology, China(昆明理工大学)
AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。
Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;
当推理遇见压缩:理解LLMs压缩对大推理模型的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究了压缩对大推理模型的影响,通过基准测试和机制解释,发现权重数量对知识记忆的影响大于推理,并揭示了蒸馏模型中关键组件的重要性。
Comments ICLR 2026
Openfly:面向空中视觉-语言导航的综合性平台
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Beihang University(北航) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; East China University of Science and Technology(东华大学) ; Fudan University(复旦大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; TeleAI
AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。
Comments accepted by ICLR 2026
MoMa:一种用于材料属性预测的模块化深度学习框架
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; Department of Chemical Engineering, Tsinghua University(化学工程系,清华大学)
AI总结 MoMa提出了一种模块化深度学习框架,通过训练专门模块并自适应组合以提升材料属性预测的性能,实验表明其在多个数据集上表现优异。
Comments Accepted to ICLR 2026
无需身份的延迟决策
AI总结 IFD通过强制排列对称性,解决未见过专家的延迟决策问题,提升泛化能力并减少标注需求。
Comments Fourteenth International Conference on Learning Representations (ICLR) 2026
扩散模型中文本生成的精确参数定位
机构 * Warsaw University of Technology(华沙技术大学) ; CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍茨中心) ; IDEAS NCBR
AI总结 通过局部化扩散模型中负责文本生成的注意力层,提升文本生成效率和性能,同时防止生成有毒文本。
Comments ICLR 2025
多项式、三角函数和热带激活函数
AI总结 本文提出多项式、三角函数和热带激活函数,通过简单初始化训练深度模型,解决激活和梯度爆炸问题,并提升大规模学习任务效率。
Comments Published at ICLR 2026
通过利用2p0s微分博弈的均衡结构来解决足球
AI总结 通过利用2p0s微分博弈的均衡结构,解决具有连续动作空间的22人足球游戏,提升学习准确性和效率。
Comments Published in ICLR 2026
Grounding-IQA: 多模态语言模型的接地图像质量评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Joy Future Academy(京东探索研究院) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Westlake University(西湖大学) ; Huawei(华为)
AI总结 本文提出grounding-IQA任务范式,通过结合多模态指称与图像质量评估,实现更细粒度的图像质量感知。
Comments Accepted to ICLR 2026. Code is available at: https://github.com/zhengchen1999/Grounding-IQA
SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距
机构 * Allen Institute for AI(艾伦人工智能研究所) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。
Comments ICLR 2026
解耦动态丰富性与表示学习:迈向实用测量
机构 * Oxford University(牛津大学) ; Seoul National University(首尔国立大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出了一种计算高效且性能无关的丰富性度量标准,用于分析动态丰富性与表示学习之间的关系,并探讨了训练因素对丰富性的影响。
Comments Published at ICLR 2026
pySpatial: 为零样本空间推理生成3D视觉程序
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Pittsburgh(匹兹堡大学) ; University of Michigan(密歇根大学)
AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。
Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io
原理化快速与元知识学习器用于持续强化学习
机构 * University of Alberta(阿尔伯塔大学) ; National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院) ; Edmonton Research Center, Huawei Canada(华为加拿大爱德蒙顿研究中心) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; BetaInfinity
AI总结 本研究提出双学习器框架,通过快速学习器与元学习器协同作用,解决持续强化学习中的知识转移与整合问题,实现高效累积学习。
Comments Published in ICLR 2026
MC-Search:基于结构化长推理链评估和增强多模态代理搜索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; IBM Research(IBM研究院) ; Stony Brook University(石溪大学)
AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。
Comments ICLR 2026
神经潜在任意拉格朗日-欧拉网格用于流固耦合
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) ; School of Electrical and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院)
AI总结 Fisale通过多尺度潜在ALE网格和分区耦合模块,实现复杂双向流固耦合问题的高效建模与学习。
Comments Proceedings of the 14th International Conference on Learning Representations
UniHM: 一体化的视觉语言模型用于统一的灵巧手操作
机构 * ShanghaiTech University(上海科技大学) ; InstAdapt
AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。
Comments Accepted by ICLR 2026
适应数据到模型:面向领域共享时间序列基础模型的自适应转换优化
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
AI总结 TATO通过自适应转换优化提升领域适应的预测性能,显著降低MSE并提高效率。
Comments Published as a conference paper at ICLR 2026
多领域黎曼图粘合用于构建图基础模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; North China Electric Power University(华北电力大学) ; University of Illinois Chicago(伊利诺伊大学香槟分校)
AI总结 GraphGlue通过黎曼几何视角整合多领域图数据,构建统一流形以提升模型可转移性与性能。
Comments Accepted by ICLR'26, 41 pages