Hybrid Training for Vision-Language-Action Models
视觉-语言-动作模型的混合训练
机构 * Qualcomm AI Research(高通AI研究)
AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。
Comments Published as a conference paper at ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
视觉-语言-动作模型的混合训练
机构 * Qualcomm AI Research(高通AI研究)
AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。
Comments Published as a conference paper at ICLR 2026
通过场景分割策略对文本到视频模型进行劫持
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院) ; AIM Intelligence(AIM智能) ; Seoul National University(首尔国立大学) ; Kyung Hee University(庆熙大学)
AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。
Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/
超越分类准确度:Neural-MedBench与更深层次推理基准的需求
机构 * School of Physics Science and Technology, Beijing University of Posts and Telecommunications(北京邮电大学物理科学与技术学院) ; Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院) ; Beijing Chaoyang Hospital, Capital Medical University(北京朝阳医院) ; Sleep Medical Center, Huzhou Third Municipal Hospital, Affiliated Hospital of Wenzhou Medical University(湖州第三人民医院睡眠医学中心,温州医科大学附属医院) ; University of Macau(澳门大学) ; Renyixun Health Technology Co., Ltd(仁颐讯健康科技有限公司) ; Academy for Advanced Interdisciplinary Studies, Peking University(北京大学交叉学科研究院)
AI总结 本文提出Neural-MedBench,一个专门用于测试多模态神经病学推理能力的基准,揭示现有医疗数据集过于强调分类准确度的问题,并通过系统评估发现模型推理失败而非感知误差主导性能下降,强调需要兼顾广度与深度的评估框架。
Comments 23 pages, 12 figures
Journal ref ICLR'2026
QWHA: 量化感知的沃尔什-哈达玛适应用于大型语言模型的参数高效微调
机构 * Seoul National University(首尔国立大学) ; Sungkyunkwan University(全北国立大学)
AI总结 本文提出QWHA方法,通过将基于傅里叶变换的适配器与沃尔什-哈达玛变换结合,改进量化感知参数高效微调,有效减少量化误差并降低计算成本。
Comments 25 pages, 9 figures, 14 tables
Journal ref ICLR 2026 Poster
IR-Agent: 专家启发的LLM代理用于从红外光谱中解析分子结构
机构 * KAIST(韩国科学技术院) ; KRICT(韩国信息通信技术研究院)
AI总结 本文提出IR-Agent,一种新的多代理框架,用于从红外光谱中解析分子结构,通过模拟专家驱动的分析过程,提升结构解析的准确性。
Comments ICLR 2026
HSG-12M: 一种大规模空间多图基准,源自非厄密晶体能量谱
机构 * National University of Singapore(新加坡国立大学) ; NUS Centre for Bioimaging Sciences(新加坡国立大学生物成像科学中心)
AI总结 本文提出HSG-12M,一个包含1160万静态和510万动态哈密顿量谱图的数据集,用于研究非厄密量子物理中的复杂几何结构,填补了现有图基准在空间多边学习方面的空白。
Comments Accepted to ICLR 2026, OpenReview: [https://openreview.net/forum?id=YxuKCME576]. 49 pages, 13 figures, 14 tables. Code & pipeline: [https://github.com/sarinstein-yan/Poly2Graph] Dataset: [https://github.com/sarinstein-yan/HSG-12M] Dataset released under CC BY 4.0. The Fourteenth International Conference on Learning Representations (ICLR 2026)
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)
自适应摄像头传感器用于视觉模型
机构 * Graduate School of Data Science(数据科学研究生院) ; Seoul National University(首尔国立大学) ; Department of Computer Science & Engineering(计算机科学与工程系) ; Seogang University(世宗大学) ; Ulsan National Institute of Science and Technology(乌山国立科学技术研究院)
AI总结 本文提出Lens,一种基于人类视觉感知的自适应摄像头传感器控制方法,通过从模型视角捕获高质量图像来提升模型性能,同时在真实时间内适应特定模型和场景,并通过新的ImageNet-ES Diverse数据集验证了其有效性。
Comments The International Conference on Learning Representations (ICLR 2025)
归一化常数估计的复杂性分析:从Jarzynski等式到退火重要性采样及其进一步发展
机构 * Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文研究了归一化常数估计问题,提出了一种非渐近分析方法,推导了退火重要性采样估计归一化常数的复杂度,并提出了一种新的算法以处理多模态问题。
Comments Accepted at ICLR 2026 (https://openreview.net/forum?id=96fJALwotm)
99%成功悖论:当近完美检索等于随机选择
机构 * Meta Platforms Inc.(Meta平台公司)
AI总结 该研究引入了Bits-over-Random(BoR)指标,揭示了高成功率可能掩盖随机水平性能的现象,指出在大规模数据集上,即使检索结果覆盖率达到99%,其选择性仍可能接近零,从而表明需要重新考虑检索深度和传统指标的报告方式。
Comments 12 pages, 2 figures, 7 tables. Accepted at ICLR 2026 Blog Track, https://iclr-blogposts.github.io/2026/blog/2026/bits-over-random/
Journal ref ICLR Blog Track 2026, https://iclr.cc/virtual/2026/poster/10012083
记忆专家的组合用于扩散世界模型
机构 * Computer Vision Group(计算机视觉组) ; Department of Computer Science(计算机科学系) ; University of Bern(伯恩大学)
AI总结 本文提出了一种基于扩散的世界模型框架,通过组合专门化的记忆专家来解决记忆与效率之间的权衡问题,提升了时间一致性、过去观察的回忆和导航性能。
Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR), 2026
基于查询意识的流扩散图基RAG系统:具有检索保证
机构 * Samsung SDS Research America(三星SDS美国研究院)
AI总结 本文提出了一种无需训练的Query-Aware Flow Diffusion RAG(QAFD-RAG)系统,通过动态适应查询语义来改进图基RAG系统的检索能力,提供了首次统计保证,证明在弱信号-噪声条件下,QAFD-RAG能够以高概率恢复相关子图。
Comments Published at the International Conference on Learning Representations (ICLR) 2026. 38 pages, 5 figures, 10 tables
DiffWind: 基于物理的可微风驱物体动力学建模
机构 * State Key Laboratory of CAD & CG(CAD与计算机图形学国家重点实验室) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; Ant Group(蚂蚁集团) ; Shenzhen University(深圳大学)
AI总结 本文提出DiffWind,一种基于物理的可微框架,统一了风-物体相互作用建模、基于视频的重建和正向模拟。通过将风表示为基于网格的物理场,物体表示为从3D高斯点散布派生的粒子系统,并利用材料点方法(MPM)建模其相互作用,从而实现了对风驱物体动力学的重建。此外,本文还引入了WD-Objects数据集,通过大量实验证明了该方法在重建精度和模拟保真度方面显著优于现有动态场景建模方法。
Comments Accepted by ICLR 2026. Project page: https://zju3dv.github.io/DiffWind/
先浅后深:一种由深度诱导的sharpness-aware minimization的隐式偏见
机构 * Graduate School of AI, KAIST(韩国成均馆大学人工智能研究生院) ; Mobilint, Inc.(Mobilint公司)
AI总结 该研究探讨了在训练线性可分二分类问题时,sharpness-aware minimization (SAM) 的隐式偏见,发现对于深度L=2的情况,SAM的行为与深度L=1时不同,展示了sequential feature amplification现象。
Comments Accepted to ICLR 2026, 84 pages, 35 figures
在可以的时候使用在线网络:迈向快速且稳定的强化学习
机构 * Technical University of Darmstadt(德累斯顿技术大学) ; German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) ; Robotics Institute Germany (RIG)(德国机器人研究所(RIG)) ; University of Würzburg(弗赖堡大学)
AI总结 本文提出了一种新的更新规则,通过在目标网络和在线网络之间取最小估计来改进价值函数学习,从而实现更快且更稳定的强化学习。
Comments Accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)
Stein Diffusion Guidance: Training-Free Posterior Correction for Sampling Beyond High-Density Regions
机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系)
AI总结 本文提出了一种基于Stein扩散引导的训练自由后验校正方法,用于在高密度区域之外进行采样。该方法结合了随机最优控制和Stein变分推断,通过引入新的理论界和运行成本函数,实现了在低密度区域的有效引导。
Comments Revised version accepted to the ICML 2026 main track; prior version accepted to two ICLR 2026 workshops: ReALM-GEN and DeLTa
零阶硬阈值化中方差减少的新见解:缓解梯度误差和扩张性矛盾
机构 * IASM, Harbin Institute of Technology(哈尔滨工业大学人工智能研究所,哈尔滨工业大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
AI总结 本文提出了一种通用的方差减少零阶硬阈值化算法,通过考虑方差的作用,缓解零阶梯度与硬阈值操作之间的冲突,从而消除对随机方向数量的限制,提高收敛速度和应用范围。
Comments Published as a conference paper at ICLR 2024. 9 pages main paper, 24 pages appendix, 11 figures, 7 tables. Correspondence to Bin Gu and Huan Xiong
Journal ref International Conference on Learning Representations (ICLR), 2024
释放大语言模型于贝叶斯优化:用于科学发现的偏好引导框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出了一种基于大语言模型的贝叶斯优化框架LGBO,通过在优化循环中持续整合大语言模型的语义推理,提高了科学发现中的优化效率和收敛速度。
Comments Published as a conference paper at ICLR 2026. 10 pages main paper, 21 pages appendix, 26 figures
Journal ref International Conference on Learning Representations (ICLR), 2026
忘却众多,忘却正确:扩散模型中可扩展且精确的概念反学习
机构 * The University of Arizona(亚利桑那大学) ; Clemson University(克莱姆森大学) ; The University of Tulsa(塔尔萨大学)
AI总结 本文提出了一种名为ScaPre的统一框架,用于在大规模扩散模型中实现精确的概念反学习,通过解决冲突更新、不精确机制和依赖额外数据的问题,提高了反学习的效率和精度。
Comments Accepted at ICLR 2026
Journal ref International Conference on Learning Representations (ICLR) 2026
在图神经网络中学习历史激活
机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) ; NVIDIA ; Ben-Gurion University of the Negev(贝内-约尔根大学) ; University of Cambridge(剑桥大学)
AI总结 本文提出HISTOGRAPH,一种基于注意力的两阶段最终聚合层,通过层间和节点间的注意力机制,利用节点的激活历史和图结构来优化最终预测特征,从而在多个图分类基准上实现了优于传统方法的性能。
Comments ICLR 2026
针对重尾噪声下的非光滑凸优化的截断梯度方法:一种细化分析
机构 * Stern School of Business(斯特恩商学院)
AI总结 本文针对重尾噪声下的非光滑凸优化问题,提出了一种改进的截断梯度方法,并在高概率和期望收敛方面提供了更优的收敛速率和理论分析。
Comments A preliminary conference version is accepted at ICLR 2026. This full version includes the formal statements of lower bounds and their proofs. v3: fixed some typos
参数化的Zonotope包含与神经网络验证的难度
机构 * Technische Universität Berlin(柏林技术大学) ; Max Planck Institute for Mathematics in the Sciences(马克斯·普朗克数学研究所) ; University of Technology Nuremberg(纽伦堡技术大学)
AI总结 研究探讨了2层ReLU网络函数的正性判定问题,证明其在参数d下属于W[1]-难问题,并展示了Zonotope包含、Lp-Lipschitz常数近似等任务的计算复杂性,揭示了这些基础问题的最优解法。
Comments 20 pages, 5 figures, paper accepted at ICLR 2026
面向机器人操作的几何感知4D视频生成
机构 * Stanford University(斯坦福大学) ; Toyota Research Institute(丰田研究院)
AI总结 本文提出了一种几何感知的4D视频生成模型,通过跨视角点图对齐进行训练,以确保生成视频在多视角下的3D一致性,从而在单个RGB-D图像输入下生成时空一致的未来视频序列,并在不依赖相机姿态的情况下实现稳定的视觉和空间对齐预测。
Comments ICLR 2026; Project website: https://robot4dgen.github.io
对Llama3-8b-Instruct自生成文本识别能力的检查与控制
AI总结 本研究探讨了LLM是否能识别自身生成的文本,发现Llama3-8b-Instruct模型能够区分自身输出与人类输出,并通过残差流中的特定向量控制其行为和感知,揭示了模型自我归属的认知机制。
Comments 10 pages, 13 figs, 2 tables, accepted as conference paper to ICLR 2025
Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)
UNR-Explainer: 为无监督节点表示学习模型生成反事实解释
机构 * Department of Artificial Intelligence(人工智能系)
AI总结 本文提出UNR-Explainer,一种基于蒙特卡洛树搜索的反事实解释生成方法,用于无监督节点表示学习模型,通过识别关键子图来提升对下游任务如链接预测和聚类的理解。
Comments Accepted at ICLR 2024
WOW-Seg: 无词开放世界分割模型
机构 * NKIARI, Shenzhen Futian(深圳福田NKIARI) ; VCIP, CS, Nankai University(南开大学VCIP实验室) ; AAIS, Nankai University(南开大学AAIS实验室) ; Sichuan Agricultural University(四川农业大学) ; Peking University Shenzhen Graduate School(北京大学深圳研究生院)
AI总结 本文提出WOW-Seg模型,旨在解决开放世界图像分割中的目标精确分割与语义理解问题,通过引入Mask2Token模块和Cascade Attention Mask,提升模型性能,并构建了Region Recognition Dataset (RR-7K)数据集,在LVIS数据集上取得优异成果。
Comments Accepted by ICLR 2026. Code and benchmark dataset are available at https://github.com/AAwCAA/WOW-Seg-Meta
SinkTrack: 基于注意力sink的上下文锚定用于大语言模型
机构 * The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室)
AI总结 SinkTrack通过将<BOS>作为信息锚点,注入关键上下文特征,缓解大语言模型的幻觉和上下文遗忘问题,实验显示在文本和多模态任务中均取得显著提升。
Comments ICLR 2026. Code: https://github.com/67L1/SinkTrack
ProfBench:需要专业知识回答和评判的多领域评分标准
机构 * NVIDIA
AI总结 ProfBench通过7000多个由专业领域专家评估的响应-评分对,评估大语言模型在处理专业文档、信息整合和生成综合报告方面的能力,揭示了即使顶级模型在专业任务上也面临挑战。
Comments Published at ICLR 2026, 30 pages
利用量子计算机加速多层神经网络推理
机构 * Department of Materials, University of Oxford(牛津大学材料系) ; Mathematical Institute, University of Oxford(牛津大学数学研究所) ; Quantum Motion(Quantum Motion公司) ; Centre for Quantum Technologies, National University of Singapore(新加坡国立大学量子中心) ; Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
AI总结 本文首次提出全相干的多层神经网络量子实现,采用残差块、多滤波2D卷积、Sigmoid激活等结构,分析了不同量子数据访问模式下的推理复杂度,证明了在不同条件下可实现二次到四次方的加速效果。
Comments Published at the International Conference on Learning Representations (ICLR), 2026
大语言模型能否拒绝它们不知道的问题?在事实性任务中测量知识感知的拒绝
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Harbin Institute of Technology(哈尔滨工业大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)
AI总结 本文提出Refusal Index(RI)作为衡量大语言模型知识感知拒绝能力的新指标,通过评估拒绝概率与错误概率的相关性,揭示模型在事实性任务中的可靠性问题。
Comments Accepted at ICLR 2026
RLBFF:二进制灵活反馈用于连接人类反馈与可验证奖励
机构 * NVIDIA
AI总结 RLBFF结合人类偏好与规则验证,提升奖励模型对响应质量的精准捕捉,优于Bradley-Terry模型,在RM-Bench和JudgeBench上取得优异成绩,且支持用户自定义反馈原则。
Comments Published at ICLR 2026, 21 pages