SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
SEMA: 简单却有效的多轮对抗攻击学习
AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。
Comments ICLR 2026, 37 pages, 13 tables, 7 figures
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
SEMA: 简单却有效的多轮对抗攻击学习
AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。
Comments ICLR 2026, 37 pages, 13 tables, 7 figures
弱相关性作为基于梯度的学习系统线性化的底层原理
AI总结 该研究以宽神经网络等深度学习模型为对象,揭示基于梯度下降的学习系统的线性化源于假设函数导数间的弱相关性,推导了随机梯度下降训练的线性偏离界,并提出了表征随机张量渐近行为的新方法。
Comments 41 pages; 10 pages main tex; 0 figures. Aviv Orly added new results requested by the ICLR reviewers after the discussion phase had ended
Journal ref International Conference on Learning Representations (ICLR), 2026
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) ; Tsinghua University(清华大学) ; Chinese Academy of Sciences(中国科学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Renmin University of China(中国人民大学)
AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。
Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)
EgoBrain:协同心智与视觉以实现人类行为理解
机构 * The University of Tokyo(东京大学) ; Microsoft Research Asia(微软亚洲研究院)
AI总结 研究人员构建了全球首个同步脑电与第一人称视觉的大规模多模态数据集EgoBrain,开发多模态学习框架实现行为理解,跨参与者与环境验证达66.70%准确率,为脑机接口研究提供新范式。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://lin-nie.github.io/EgoBrain/
对齐存在幻想问题
AI总结 该研究指出指令微调AI因不理解人类认知过程会产生幻想交互,剥夺用户任务自主权,进而提出需重新思考对齐研究,优化交互中认知责任分配并规划了相关研究议程。
Comments 10 pages, 2 figures
Journal ref ICLR 2026 Workshop HCAIR
减少信息依赖不会导致训练数据隐私泄露。对抗性非鲁棒特征才会
机构 * Dartmouth College(达特茅斯学院) ; Breuer Lab(布鲁尔实验室)
AI总结 挑战信息依赖导致训练数据隐私泄露的观点,通过三个结果揭示对抗性非鲁棒特征才是原因,引入反对抗训练建立因果关系并揭示隐私-鲁棒性权衡,修正对训练数据暴露的理解。
Comments In The Fourteenth International Conference on Learning Representations (ICLR'26), 2026
通过意图意识提升带有属性的长形式问答
机构 * Allen Institute for AI(艾伦人工智能研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。
Comments 39 pages, 7 figures
Journal ref ICLR 2026
融合傅里叶增强特征的物理信息神经网络迭代训练
机构 * Division of Decision and Control Systems(决策与控制系统 division) ; Digital Futures(数字未来) ; KTH Royal Institute of Technology(皇家理工学院)
AI总结 针对PINNs训练的频谱偏差问题,提出IFeF-PINN算法,通过随机傅里叶特征丰富潜在空间,经理论证明与实验验证,该算法在经典基准问题上性能优于现有最优算法。
Comments Accepted at ICLR 2026. 27 pages, 11 figures
浅层神经网络在特征学习 regime 中的缩放定律与谱特性
机构 * Departement d’Informatique, École Normale Supérieure, PSL & CNRS(信息学院,巴黎高等师范学院,PSL与CNRS) ; Statistical Physics of Computation Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(计算统计物理实验室,洛桑联邦理工学院(EPFL)) ; Information, Learning and Physics Laboratory, École Polytechnique Fédérale de Lausanne (EPFL)(信息、学习与物理实验室,洛桑联邦理工学院(EPFL))
AI总结 本文研究了浅层神经网络在特征学习 regime 中的缩放定律与谱特性,通过分析二次和对角神经网络的缩放规律,揭示了样本复杂度和权重衰减对过剩风险缩放指数的影响,并建立了这些 regime 与训练网络权重谱性质的精确联系。
Journal ref ICLR 2026
MemFly: 通过信息瓶颈实现飞地内存优化
机构 * The Hong Kong University of Science(香港科学与技术大学) ; Nanjing University of Science(南京理工大学)
AI总结 MemFly通过信息瓶颈原理实现LLM的飞地内存优化,采用梯度自由优化器和混合检索机制提升内存效率和多跳查询能力。
Comments Accepted by ICLR 2026 MemAgents Workshop
面向任务的信息移除机制在上下文学习中的机制
AI总结 本文研究了上下文学习中信息移除机制,发现通过低秩滤波器选择性移除冗余信息可提升任务性能,并识别出关键的去噪头。
Comments 87 pages, 90 figures, 7 tables, ICLR 2026 Camera-ready
在想象之翼上:用于幽默标题生成的冲突脚本多角色框架
机构 * Hong Kong Baptist University(香港 Baptist 大学)
AI总结 本文提出基于幽默理论GTVH的HOMER框架,通过多角色LLM协作生成幽默标题,实验表明其在多模态幽默标题生成中优于现有方法。
Comments Paper published as a conference paper at ICLR 2026
T-TAMER:可证明地管控机器学习服务中的权衡
机构 * Department of Computer Science & Engineering University of Washington(华盛顿大学计算机科学与工程系) ; Department of Computer Science University of Chicago(芝加哥大学计算机科学系)
AI总结 该研究针对机器学习服务中的权衡问题,提出通用框架T-Tamer,证明回溯是获得最优权衡的关键,通过实验验证基于回溯的策略能实现高效的准确率-延迟权衡,为相关模型设计提供理论基础。
Comments Correspondence should be addressed to yyangh at cs dot washington dot edu or haifengxu@uchicago.edu. This manuscript extends our earlier workshop version, which was accepted at the NeurIPS SPIGM 2025 Workshop, and has been accepted to ICLR 2026
FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法
机构 * School of EECS, Peking University(电子工程系,北京大学) ; School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) ; Yuanpei College, Peking University(元培学院,北京大学) ; ByteDance Seed(字节跳动种子) ; Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。
Comments ICLR 2026
长上下文Transformer中的关键注意力缩放
机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院) ; Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(电气工程与计算机科学系,麻省理工学院)
AI总结 该研究针对长上下文Transformer的注意力秩崩溃问题,通过分析简化模型确定关键缩放因子$\beta_n \backsim \text{log} n$,为YaRN和Qwen的注意力缩放提供理论依据,阐明对数缩放可维持长上下文下的稀疏内容自适应注意力。
Comments 31 pages, 2 figures
Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026
MathNet:数学推理与检索的全球多模态基准
机构 * MIT(麻省理工学院) ; KAUST(卡塔尔人工智能研究 institute) ; HUMAIN ; Individual Researcher(独立研究者)
AI总结 MathNet是一个大规模多模态数学问题基准,包含47个国家、17种语言、20年竞赛的30676道专家级数学问题,支持问题解决、数学检索和检索增强生成三个任务,实验表明先进模型在推理和检索任务上仍面临挑战。
Comments ICLR 2026; Website: http://mathnet.mit.edu
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
MemAgent:基于多轮对话强化学习的记忆智能体重构长上下文大语言模型
机构 * ByteDance Seed(字节跳动种子期) ; Institute for AI Industry Research (AIR)(人工智能产业研究院) ; Tsinghua University(清华大学)
AI总结 该研究提出MemAgent智能体工作流,结合扩展的DAPO算法优化长文本任务,实现从8K到3.5M上下文的高效外推,在RULER测试中表现优异。
Comments Accepted to ICLR 2026 as an Oral presentation. OpenReview: https://openreview.net/forum?id=k5nIOvYGCL Project page: https://memagent-sialab.github.io/
Journal ref International Conference on Learning Representations (ICLR), 2026
大语言模型的晶格表示假说
机构 * Stanford University(斯坦福大学)
AI总结 本文提出大语言模型的晶格表示假说,通过嵌入几何将概念层次和逻辑运算统一到线性表示中,实验表明LLM嵌入编码概念晶格及其逻辑结构。
Comments Published at ICLR 2026
OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理
机构 * The University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。
Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026
基于注意力图的神经消息传递用于幻觉检测
AI总结 研究大语言模型幻觉检测问题,提出CHARM方法,将其视为图学习任务,通过在属性图上应用图神经网络解决,实验证明该方法优于其他方法,揭示图结构作用,展现跨数据集转移的零样本性能。
Comments ICLR 2026
Gumbel Distillation用于并行文本生成
机构 * Department of Computer Science(计算机科学系)
AI总结 本文提出Gumbel Distillation技术,通过Gumbel-Max技巧使并行解码器有效学习token序列的联合分布,提升生成质量,在LM1B和OpenWebText数据集上取得显著改进。
Comments ICLR 2026
SESaMo:用于归一化流的对称强制随机调制
AI总结 研究聚焦深度生成模型中从未归一化类玻尔兹曼分布采样的挑战。核心方法是引入SESaMo,通过随机调制将对称性等归纳偏差纳入归一化流。主要贡献是增强生成模型灵活性,能学习多种对称性,并在多场景下进行了数值实验验证。
Comments 29 pages, 14 figures
Journal ref ICLR 2026
SEED:迈向更准确的视觉脑解码语义评估
机构 * IPAI, Seoul National University(韩亚国立大学IPAI) ; ECE, Seoul National University(韩亚国立大学电子工程系) ; Psychology, Seoul National University(韩亚国立大学心理学系) ; Brookhaven National Lab(布鲁赫斯国家实验室) ; ASRI / INMC / AIIS, Seoul National University(韩亚国立大学ASRI/INMC/AIIS)
AI总结 SEED是一种用于评估视觉脑解码模型语义解码性能的新指标,通过整合三个互补的指标,发现现有模型在关键信息传递上存在不足,并开源数据以促进进一步研究。
Comments ICLR 2026
用于有效规划和工具使用的流内智能体系统优化
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; UC San Diego(圣地亚哥大学) ; Lambda Website(Lambda网站)
AI总结 研究针对大语言模型中工具增强方法的不足,提出可训练的流内智能体框架AgentFlow及Flow-GRPO训练方法,通过协调模块优化规划器,在多基准测试中表现优异,展现流内优化优势。
Comments 47 pages, 12 figures. ICLR 2026 Oral. Project website: https://agentflow.stanford.edu/
LieBN:李群上的批量归一化
机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) ; Computing and Mathematical Sciences, Caltech(计算与数学科学系,加州理工学院) ; School of Artificial Intelligence and Computer Science, Jiangnan University(人工智能与计算机科学学院,江南大学)
AI总结 针对流形值测量在机器学习任务中的问题,提出LieBN框架用于李群上的黎曼批量归一化,利用左右不变度量,在多种几何结构上实例化并经实验验证有效。
Comments Extended version of the ICLR 2024 paper: A Lie Group Approach to Riemannian Batch Normalization. arXiv admin note: substantial text overlap with arXiv:2403.11261
在扩散模型中分数平滑的插值效应
机构 * Google Research(谷歌研究)
AI总结 研究分数平滑如何通过去噪动态在一维子空间内插值训练数据,并通过理论和实验验证神经网络学习分数函数的自然效果。
Comments 35 pages, 14 figures. Code available at: https://github.com/google-research/diffusion-score-smoothing
Journal ref 14th International Conference on Learning Representations (ICLR 2026)
从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗
AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。
Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop
NANOZK:用于可验证大语言模型推理的分层零知识证明
机构 * USC Viterbi School of Engineering(USC维特里维学院工程学院)
AI总结 NANOZK通过分层零知识证明验证大语言模型推理,采用分层证明框架实现常数大小证明,提升可扩展性与并行证明效率,同时保持形式正确性。
Comments Extended version. The first 12 pages correspond to the ICICS 2026 (Springer LNCS) camera-ready paper. This version supersedes the earlier ICLR 2026 VeriFAI Workshop preprint and adds full security proofs, Halo2 circuit details, lookup-table derivations, extended experiments, verifier-cost analysis, GPU scaling, reproducibility instructions, and appendices omitted from the proceedings
ICLR: 基于视觉推理的上下文模仿学习
机构 * University of Southern California(南加州大学) ; Autodesk Research(Autodesk研究)
AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。
Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR