arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

至 收录 72
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

URL PDF HTML 收藏
2608.12387 2026-08-14 cs.CL cs.AI 新提交

Query Timing Produces Opposite Positional Biases Between LLMs and Humans

查询时机在大型语言模型(LLMs)与人类之间产生相反的位置偏差

Jasin Cekinmez, Addison J. Wu, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

AI总结 该研究探究查询时机对LLMs和人类位置偏差的影响,发现二者存在差异,且新LLMs的位置偏差比前代更显著。

Comments Entropic Award (Top 3 Paper), ICBINB @ ICLR 2026

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

URL PDF HTML 收藏
2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

URL PDF HTML 收藏
2608.02455 2026-08-04 cs.LG stat.ML 新提交

Aggregate-then-Calibrate for Human-centered Assessment with Theoretical Guarantees

面向以人为中心评估的聚合后校准方法(AtC)及理论保证

Zejun Xie, Xintong Li, Guang Wang, Desheng Zhang

AI总结 该研究针对以人为中心评估的两难问题,提出AtC两阶段框架,结合人类判断与模型分数,兼具理论保证,在半合成及真实数据集上提升了评估的准确性与鲁棒性。

Comments Accepted by ICLR 2026

URL PDF HTML 收藏
2608.01734 2026-08-04 cs.LG 新提交

LLM-Guided Retrieval for Prediction of Molecular Perturbation Responses

大语言模型引导的检索用于分子扰动响应预测

Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

机构 * Stanford University(斯坦福大学) Genentech(基因泰克)

AI总结 本研究提出LLM引导的检索方法,在Tahoe-100M数据集上优于多个基线,可提升分子扰动预测的方向准确率,是零样本分子扰动预测的关键驱动因素。

Comments Published at MLGenX @ ICLR 2026

URL PDF HTML 收藏
2608.01160 2026-08-04 cs.LG cs.SI 新提交

Differentiable Lifting for Topological Neural Networks

拓扑神经网络的可微提升

Jorge Luiz Franco, Gabriel Duarte, Alexander Nikitin, Moacir Ponti, Diego Mesquita, Amauri H. Souza

机构 * University of São Paulo(圣保罗大学) Instituto Curvelo(库尔韦洛研究所) Federal Institute of Ceará(塞阿拉联邦学院) Aalto University(阿尔托大学) Getulio Vargas Foundation(热图利奥·瓦加斯基金会)

AI总结 针对拓扑神经网络(TNNs)图提升操作先验识别的缺陷,提出可微提升框架DiffLift,实验显示其在多基准分类任务上优于现有方法,最高提升45%。

Comments Published as a conference paper at ICLR 2026 (OpenReview: https://openreview.net/forum?id=eC89CbINIw). 20 pages, 4 figures

URL PDF HTML 收藏
2608.00737 2026-08-04 cs.LG cs.AI cs.PF 新提交

An Embedded RISC-V Evaluation of Kolmogorov--Arnold Networks in Hard-Constrained Recurrent Physics-Informed Models

硬约束循环物理信息模型中柯尔莫哥洛夫-阿诺德网络的嵌入式RISC-V评估

Enzo Nicolas Spotorno, Josafat Leal Filho

AI总结 本文在RISC-V嵌入式平台上评估硬约束循环物理信息模型的KAN残差分支,发现其部署时延迟和能耗高于MLP,量化后可靠性更差,不适合作为默认选择。

Comments 6 pages, submitted to SBESC 2026 as an extension to the ICLR Workshop Paper https://openreview.net/forum?id=iHpbQn99RB

URL PDF HTML 收藏
2607.27987 2026-07-31 cs.LG 新提交

It's All Just Vectorization: einx, a Universal Notation for Tensor Operations

这全都是向量化:einx,一种通用的张量运算表示法

Florian Fervers, Sebastian Bullinger, Christoph Bodensteiner, Michael Arens

AI总结 针对主流张量框架表示法难读写、易出错的问题,引入通用张量运算表示法einx,简化API、统一规则,提供可与现有框架无缝集成的Python实现。

Comments Published at ICLR 2026 (oral)

URL PDF HTML 收藏
2607.28259 2026-07-31 cs.LG math.AT 新提交

TopoFormer: Topology Meets Attention for Graph Learning

TopoFormer:拓扑与注意力融合的图学习方法

Md Joshem Uddin, Astrit Tola, Cuneyt Gurcan Akcora, Baris Coskunuzer

AI总结 该研究提出TopoFormer框架,通过核心模块Topo-Scan将图拓扑结构编码为注意力友好序列,结合Transformer实现图表示学习,在相关基准上达到SOTA性能,开辟了拓扑与注意力融合的图学习新方向。

Comments 26 pages, 5 figures

Journal ref ICLR 2026

URL PDF HTML 收藏
2607.26723 2026-07-30 cs.CR cs.AI 新提交

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

FARI:用于扩散模型水印的鲁棒单步反演

Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen

AI总结 本研究提出FARI框架,通过单步反演结合轻量级对抗LoRA微调,在提升扩散模型水印验证鲁棒性的同时大幅缩短推理时间,效率与性能均优于50步DDIM反演。

Comments Accepted by ICLR 2026

URL PDF HTML 收藏
2607.26398 2026-07-30 cs.LG 新提交

Flow Map Learning via Nongradient Vector Flow

基于非梯度向量流的流图学习

Mark Goldstein, Anshuk Uppal, Raghav Singhal, Aahlad Puli, Rajesh Ranganath

机构 * Flatiron Institute(弗拉蒂隆研究所) Technical University of Denmark(丹麦技术大学) Courant Institute, New York University(纽约大学柯朗研究所)

AI总结 本文提出SGFlow方法,绕过流图学习的可逆性与迭代微分难题,在CIFAR基准上10采样步时FID最优,其他步数具竞争力且有驻点保证。

Comments ICLR 2026

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

URL PDF HTML 收藏
2607.23466 2026-07-28 cs.LG 新提交

Extending Fourier Neural Operators for Modeling Parameterized and Coupled PDEs

扩展傅里叶神经算子用于参数化和耦合偏微分方程建模

Cheng Jing, Uvini Balasuriya Mudiyanselage, Abhishek Verma, Kallol Bera, Shahid Rauf, Kookjin Lee

机构 * Arizona State University(亚利桑那州立大学) Applied Materials Inc.(应用材料公司)

AI总结 研究针对参数化和耦合偏微分方程建模问题,通过最少架构修改扩展傅里叶神经算子。对参数化动力学用超网络调制,对耦合系统探索架构选择,实验表明该方法比基线误差大幅降低,有效提升了偏微分方程建模效果。

Comments Accepted to ICLR 2026

URL PDF HTML 收藏
2607.22039 2026-07-27 cs.CL 新提交

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

过犹不及:强化学习如何减轻大语言模型中任务冲突的综合分析

Zixuan Ren, Jinliang Lu, Junhong Wu, Yang Zhao, Dai Dai, Hua Wu, Haifeng Wang, Chengqing Zong

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

AI总结 研究对比强化学习与监督微调训练的大语言模型的合并行为,经五项任务评估发现强化学习能减少任务冲突及合并后性能下降。通过实验和分析揭示三个关键因素,表明强化学习在模型合并中更具优势。

Comments Published in ICLR 2026

URL PDF HTML 收藏
2607.22012 2026-07-27 cs.LG 新提交

Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits

上下文博弈的跨域离策略评估与学习

Yuta Natsubori, Masataka Ushiku, Yuta Saito

机构 * Hakuhodo DY Holdings, Inc.(博报堂DY控股公司) Cornell University(康奈尔大学)

AI总结 研究上下文博弈中离策略评估与学习问题,提出跨域OPE/L新设置,可利用目标域和其他域日志数据,开发新估计器和策略梯度方法,有效解决现有方法面临的挑战,增强离策略评估与学习能力。

Comments 21 pages, 10 figures, accepted to ICLR 2025

URL PDF HTML 收藏
2607.21120 2026-07-24 cs.LG cs.AI 新提交

Relative Value Learning

相对价值学习

Marc Höftmann, Jan Robine, Stefan Harmeling

AI总结 研究提出相对价值学习框架,通过反对称函数学习价值差异,引入成对贝尔曼算子并推导相关目标及估计器,将其与PPO集成,在Atari基准测试中取得有竞争力性能,证明相对价值估计可替代绝对评论家。

Comments Published as a conference paper at ICLR 2026

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

URL PDF HTML 收藏
2607.17624 2026-07-21 cs.LG 新提交

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

变压器真的无所不能吗?论跨任务归纳偏差的兼容性

Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

机构 * Idiap Research Institute(Idiap研究所) EPFL(洛桑联邦理工学院) Adelaide University(阿德莱德大学)

AI总结 研究探讨变压器对给定任务是否最优,提出为数据集优化变压器架构的方法,在算法玩具任务和代码语言建模数据集上实验,发现标准变压器非局部最优,简单替代方案有优劣,暗示有改进架构可支持多种能力。

Comments Published as a conference paper at ICLR 2026. https://github.com/idiap/lm-afs

URL PDF HTML 收藏
2607.17336 2026-07-21 cs.LG 新提交

When Drift Detectors cry Wolf: False Alarm Rates in continuous ML Monitoring

当漂移检测器发出错误警报时:连续机器学习监测中的误报率

Raj Shekhar Singh

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

AI总结 研究连续机器学习监测中常用漂移检测器的误报率,通过实证分析PSI、KS等五种检测器,发现不同检测器对批量大小的敏感性不同,应用邦费罗尼校正有稳定性 - 敏感性权衡,为生产ML系统选择和校准检测器提供实用指南。

Comments Accepted in ICLR 2026 CAO workshop

URL PDF HTML 收藏
2607.18043 2026-07-21 cs.LG cs.NA math.AP math.NA 新提交

Adaptive Mamba Neural Operators

自适应曼巴神经算子

Zeyuan Song, Zheyu Jiang

AI总结 研究如何准确求解任意几何形状和各种网格上的偏微分方程,提出自适应曼巴神经算子,通过构建竹内 - 马尔姆奎斯特系统集成再生核,在多个领域的基准问题上,其相对\(L^2\)误差优于现有求解器,为神经算子框架设计提供新范例。

Comments 22 pages, accepted by ICLR 2026 conference (https://openreview.net/forum?id=OenyzvFZPs)

URL PDF HTML 收藏
2607.15713 2026-07-20 eess.SP cs.AI cs.LG 新提交

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型

Yong Chu, Xun Zhou, Zenglin Xu, Hui Wang, Yue Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。

Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026

URL PDF HTML 收藏
2607.14125 2026-07-17 cs.LG cs.CV 新提交

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models

CARPRT:用于黑盒视觉语言模型的类感知零样本提示重加权

Ruijiang Dong, Zesheng Ye, Jianzhong Qi, Lei Feng, Feng Liu, Gang Niu, Masashi Sugiyama

机构 * University of Melbourne(墨尔本大学) Southeast University(东南大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The University of Tokyo(东京大学)

AI总结 研究针对预训练视觉语言模型零样本图像分类中提示与类独立性假设不成立的问题,提出类感知零样本提示重加权方法CARPRT,通过无训练方式量化提示与类的相关性并调整权重,实验表明该方法优于现有方法。

Comments Accepted at ICLR 2026

URL PDF HTML 收藏
2607.13069 2026-07-16 cs.AI cs.CL cs.LO 新提交

Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution

介入式基础审计:通过谓词替换对大语言模型思维链进行黑盒前提依赖性测试

Hironao Nakamura

AI总结 研究大语言模型思维链前提依赖性问题,提出介入式基础审计方法,通过谓词替换干预前提并重新运行模型,在ProntoQA基准测试中检测前提依赖性表现优异,还发现了“正确答案,错误推理”信号。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models (https://iclr.cc/virtual/2026/10017466)

URL PDF HTML 收藏
2607.12362 2026-07-15 cs.CV 新提交

Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements

用于大帧间位移快速运动的隐式4D高斯点云渲染

Seung-gyeom Kim, Areum Kim, Yongjae Yoo, Sukmin Yun

机构 * Hanyang University(汉阳大学) Hanyang University ERICA(汉阳大学衣理校区)

AI总结 针对快速运动大帧间位移下4DGS方法失效问题,提出SPIN-4DGS,从显式时空位置学习高斯属性,用轻量级网络预测属性,避免高内存开销,实验证明该方法在大位移下保真度更高,提升了PSNR和SSIM。

Comments Accepted at ICLR 2026. Project page at https://seung-gyeom.github.io/SPIN-4DGS

URL PDF HTML 收藏
2607.11541 2026-07-14 cs.LG 新提交

Random Label Prediction Heads for Studying Memorization in Deep Neural Networks

用于研究深度神经网络中记忆的随机标签预测头

Marlon Becker, Jonas Konrad, Luis Garcia Rodriguez, Benjamin Risse

机构 * University of Münster(明斯特大学)

AI总结 该研究提出用随机标签预测头研究深度神经网络分类任务中的记忆,通过其性能估计拉德马赫复杂度,分析泛化与过拟合,还基于此提出正则化技术,挑战了过拟合等同于记忆的传统假设,揭示减少记忆对泛化的复杂影响。

Journal ref ICLR 2026

URL PDF HTML 收藏
2607.09743 2026-07-14 cs.AI cs.GT 新提交

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预

Pratyush Singh

机构 * California Institute of Technology(加州理工学院)

AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。

Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning

URL PDF HTML 收藏
2607.09488 2026-07-13 cs.CV 新提交

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

URL PDF HTML 收藏
2607.08883 2026-07-13 cs.LG 新提交

Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal

针对安全表示的优化:激活引导的对抗后缀与拒绝几何

Ege Çakar, Hannah Guan, Kayden Kehe

AI总结 研究大语言模型安全表示,引入激活引导的对抗后缀攻击方法,如Activation-Guided GCG和Soft-GCG,发现安全表示分布特点,不同规模模型的抗性不同,结果阐明安全机制编码及破解方式,为设计对齐策略提供指导。

Comments Accepted at the AAAI 2026 Summer Symposium Series. This paper was presented at the ICLR Re-Align workshop under a different name, "Accelerating Adversarial Suffix Optimization via Continuous Relaxation and Activation-Guided Objectives"

URL PDF HTML 收藏