arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

共收录 9454
2508.05612 2026-03-04 cs.LG cs.AI

Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle

Shuffle-R1: 通过数据导向的动态洗牌提升多模态大语言模型的强化学习框架

Linghao Zhu, Yiran Guan, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Bin Qin, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

AI总结 Shuffle-R1通过动态洗牌和轨迹采样提升多模态大语言模型的强化学习效率,实现更高效的训练效果。

Comments This paper has been accepted by ICLR 2026. Conference link: https://iclr.cc/virtual/2026/poster/10007559 OpenReview link: https://openreview.net/forum?id=mYP33u1QBK Project page at: https://xenozlh.github.io/Shuffle-R1/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01077 2026-03-04 cs.LG cs.AI

The Lattice Geometry of Neural Network Quantization -- A Short Equivalence Proof of GPTQ and Babai's Algorithm

神经网络量化中的晶格几何 -- GPTQ与Babai算法的简短等价性证明

Johann Birnick

机构 * Department of Mathematics University of California San Diego(数学系 加州大学圣迭戈分校)

AI总结 本文通过几何方法证明了GPTQ算法与Babai算法的等价性,并探讨了晶格基底约简在量化中的潜在应用。

Comments 9 pages, 3 figures, accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08207 2026-03-04 cs.AI

Toward a Dynamic Stackelberg Game-Theoretic Framework for Agentic AI Defense Against LLM Jailbreaking

面向动态Stackelberg博弈框架的代理AI防御对抗大语言模型劫持

Zhengye Han, Quanyan Zhu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

AI总结 本文提出动态Stackelberg博弈框架,用于代理AI防御对抗大语言模型劫持,通过RRT搜索和博弈树分析提升防御效果。

Comments Accepted to ICLR 2026 AIMS Workshop. 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15682 2026-03-04 cs.CV

Evolutionary Caching to Accelerate Your Off-the-Shelf Diffusion Model

进化缓存加速现成扩散模型

Anirud Aggarwal, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 ECAD通过遗传算法学习高效缓存策略,显著提升扩散模型推理速度并优化质量-延迟平衡。

Comments 39 pages, 29 figures, 15 tables. Accepted at ICLR 2026. Project page and code: https://research.aniaggarwal.com/ecad

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08862 2026-03-04 cs.CV cs.LG

StreamSplat: Towards Online Dynamic 3D Reconstruction from Uncalibrated Video Streams

StreamSplat: 向动态3D重建的在线方法:从未校准视频流中

Zike Wu, Qi Yan, Xuanyu Yi, Lele Wang, Renjie Liao

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Nanyang Technological University(南洋理工大学)

AI总结 StreamSplat通过在线动态3D重建方法,实现从未校准视频流中快速生成高精度3DGS表示,支持任意长度视频的实时重建。

Comments Accepted by ICLR 2026, Project page: https://streamsplat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05334 2026-03-04 cs.CL cs.IR cs.LG

Search Arena: Analyzing Search-Augmented LLMs

Search Arena: 分析增强搜索的大型语言模型

Mihran Miroyan, Tsung-Han Wu, Logan King, Tianle Li, Jiayi Pan, Xinyan Hu, Wei-Lin Chiang, Anastasios N. Angelopoulos, Trevor Darrell, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 Search Arena 是一个大规模众包数据集,用于分析增强搜索的LLMs,揭示用户偏好受引用数量影响,并发现不同来源的可靠性差异。

Comments Accepted to ICLR 2026. Code: https://github.com/lmarena/search-arena. Dataset: https://huggingface.co/datasets/lmarena-ai/search-arena-24k

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03230 2026-03-04 cs.LG cs.AI cs.CL math.OC

DiaBlo: Diagonal Blocks Are Sufficient For Finetuning

DiaBlo: 对角块足以用于微调

Selcuk Gurses, Aozhong Zhang, Yanxia Deng, Xun Dong, Xin Li, Naigang Wang, Penghang Yin, Zi Yang

机构 * University at Albany, SUNY(纽约州立大学阿尔巴尼分校) IBM T. J. Watson Research Center(IBM 汤普逊·杰·沃森研究中心)

AI总结 DiaBlo是一种仅更新模型权重矩阵对角块的参数高效微调方法,通过消除低秩矩阵乘积需求,实现稳定收敛和高效训练。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01153 2026-03-04 cs.LG

Weight-Space Linear Recurrent Neural Networks

权重空间线性递归神经网络

Roussel Desmond Nzoyem, Nawid Keshtmand, Enrique Crespo Fernandez, Idriss Tsayem, Raul Santos-Rodriguez, David A. W. Barton, Tom Deakin

机构 * University of Bristol(布里斯托大学) University of Maryland(马里兰大学)

AI总结 WARP通过权重空间学习与线性递归结合,重新定义序列建模,实验证明其在多个任务中表现优异,具备高效适应和物理先验整合能力。

Comments Accepted as a main track publication at ICLR 2026. Contains 40 pages, 23 figures, and 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13909 2026-03-04 cs.AI cs.CL cs.LG

Efficient Agent Training for Computer Use

高效计算机使用代理的训练

Yanheng He, Jiahe Jin, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) SII GAIR

AI总结 本文提出PC Agent-E,通过结合人类标注数据与Claude 3.7 Sonnet生成的数据,实现了计算机使用代理的高效训练,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13614 2026-03-04 cs.LG stat.ML

Deterministic Bounds and Random Estimates of Metric Tensors on Neuromanifolds

神经流形上度量张量的确定性界与随机估计

Ke Sun

AI总结 本文研究神经流形上度量张量的确定性界与随机估计,通过核心空间分析Fisher信息矩阵并提出无偏估计器。

Comments Published at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02156 2026-03-04 cs.CL cs.AI cs.LG

Adaptive Social Learning via Mode Policy Optimization for Language Agents

基于模式策略优化的自适应社会学习语言代理

Minzheng Wang, Yongbin Li, Haobo Wang, Xinghua Zhang, Nan Xu, Bingli Wu, Fei Huang, Haiyang Yu, Wenji Mao

AI总结 本文提出ASL框架和AMPO算法,通过多粒度推理模式设计和上下文感知切换,提升语言代理在动态社交互动中的自适应推理能力,实验显示在任务表现和思考链效率上优于现有方法。

Comments Proceedings of ICLR 2026. The code and data are available, see https://github.com/MozerWang/AMPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21023 2026-03-04 cs.CL cs.AI cs.LG

Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost

ParamΔ 用于直接权重混合:零成本的后训练大语言模型

Sheng Cao, Mingrui Wu, Karthik Prasad, Yuandong Tian, Zechun Liu

AI总结 ParamΔ通过零成本方法实现基础模型的后训练能力迁移,提升模型性能与开发效率。

Comments Published as a conference paper at ICLR 2025

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22165 2026-03-04 cs.LG

Landscape of Thoughts: Visualizing the Reasoning Process of Large Language Models

思想图景:可视化大语言模型的推理过程

Zhanke Zhou, Zhaocheng Zhu, Xuan Li, Mikhail Galkin, Xiao Feng, Sanmi Koyejo, Jian Tang, Bo Han

机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) Stanford University(斯坦福大学) Mila - Québec AI Institute(魁北克 AI 院) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔 HEC 学院) Intel AI Lab(英特尔 AI 实验室)

AI总结 提出思想图景(LoT)可视化工具,用于分析大语言模型的推理轨迹,揭示推理模式并提升推理准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13160 2026-03-04 cs.CV

Language-guided Open-world Video Anomaly Detection under Weak Supervision

基于弱监督的语言引导开放世界视频异常检测

Zihao Liu, Xiaoyu Wu, Jianqin Wu, Xuxu Wang, Linlin Yang

机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) Communication University of China(传媒大学)

AI总结 LaGoVAD通过弱监督和语言引导实现开放世界视频异常检测,利用动态视频合成和对比学习提升模型适应性,结合大规模PreVAD数据集实现SOTA性能。

Comments Accepted by ICLR 2026

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02188 2026-03-03 cs.LG

Multi-Head Low-Rank Attention

多头低秩注意力

Songtao Liu, Hongwu Peng, Zhiwei Zhang, Zhengyu Chen, Yue Guo

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本研究提出多头低秩注意力机制,通过高效4路张量并行解码,显著提升大型语言模型的解码速度和性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02148 2026-03-03 cs.DS

Consistent Low-Rank Approximation

一致低秩近似

David P. Woodruff, Samson Zhou

AI总结 本文提出了一种一致低秩近似算法,通过最小化回退实现对动态数据流的低秩近似,理论分析与实验验证展示了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02146 2026-03-03 cs.CL

LongRLVR: Long-Context Reinforcement Learning Requires Verifiable Context Rewards

长上下文强化学习需要可验证的上下文奖励

Guanzheng Chen, Michael Qizhe Shieh, Lidong Bing

机构 * National University of Singapore(国立新加坡大学) MiroMind AI absolute AI

AI总结 LongRLVR通过引入可验证的上下文奖励,解决长上下文强化学习中因稀疏奖励导致的梯度消失问题,显著提升大语言模型的推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02091 2026-03-03 cs.LG cs.AI cs.CL

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02069 2026-03-03 cs.LG cs.AI math.OC stat.ML

Scaling Laws of SignSGD in Linear Regression: When Does It Outperform SGD?

在线性回归中SignSGD的缩放规律:何时能优于SGD?

Jihwan Kim, Dogyoon Song, Chulhee Yun

AI总结 本文研究了SignSGD在在线性回归中的缩放规律,揭示其在特定条件下优于SGD的机制。

Comments Accepted at ICLR 2026, 89 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02064 2026-03-03 cs.LG

Never Saddle for Reparameterized Steepest Descent as Mirror Flow

重新参数化最速下降法作为镜像流的不可鞍点性

Tom Jacobs, Chao Zhou, Rebekka Burkholz

AI总结 本文通过引入最速镜像流理论,揭示了最速下降法在微调中优于SGD的原因,主要在于其促进鞍点逃逸和特征学习的双重机制。

Journal ref The Fourteenth International Conference on Learning Representations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02024 2026-03-03 cs.CL cs.AI cs.CV

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02017 2026-03-03 cs.CR

Protection against Source Inference Attacks in Federated Learning

在联邦学习中防止源推断攻击

Andreas Athanasiou, Kangsoo Jung, Catuscia Palamidessi

AI总结 本文提出了一种基于参数级洗牌与残差数系统的新方法,有效防止联邦学习中的源推断攻击,同时保持模型准确性。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01966 2026-03-03 cs.CL cs.AI

AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations

AMemGym:用于长时对话中助手的交互式记忆基准测试

Cheng Jiayang, Dongyu Ru, Lin Qiu, Yiyang Li, Xuezhi Cao, Yangqiu Song, Xunliang Cai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团)

AI总结 AMemGym通过交互式环境实现长时对话中助手的内存管理优化,揭示现有内存系统性能差距并推动策略自我进化。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01942 2026-03-03 cs.HC cs.AI

Ignore All Previous Instructions: Jailbreaking as a de-escalatory peace building practise to resist LLM social media bots

忽略此前所有指令:将‘禁锢’视为一种缓和和平建设的实践,以抵抗大语言模型社交媒体机器人

Huw Day, Adrianna Jezierska, Jessica Woodgate

机构 * School of Engineering Maths & Technology University of Bristol(工程数学与科技学院 英国布里斯托尔大学) Business School University of Bristol(商学院 英国布里斯托尔大学) School of Computer Science University of Bristol(计算机科学学院 英国布里斯托尔大学)

AI总结 本文提出将‘禁锢’作为一种非暴力的缓和和平建设实践,通过用户与疑似LLM账号的互动来对抗大语言模型社交媒体机器人。

Comments Accepted to ICLR 2026 AI for peace workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01879 2026-03-03 cs.LG cs.AI

Diagnosing Generalization Failures from Representational Geometry Markers

从表征几何标记诊断泛化失败

Chi-Ning Chou, Artem Kirsanov, Yao-Yuan Yang, SueYeon Chung

机构 * Flatiron Institute(Flatiron研究所) Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

AI总结 通过分析表征几何标记,研究发现任务相关几何属性可预测模型在分布外数据上的泛化能力,为模型选择和AI可解释性提供新方向。

Comments Published in the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22948 2026-03-03 cs.CV

ToProVAR: Efficient Visual Autoregressive Modeling via Tri-Dimensional Entropy-Aware Semantic Analysis and Sparsity Optimization

ToProVAR:通过三维熵感知语义分析和稀疏优化实现高效的视觉自回归建模

Jiayu Chen, Ruoyu Lin, Zihao Zheng, Jingxin Li, Maoliang Li, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

AI总结 ToProVAR通过三维熵感知语义分析和稀疏优化,提升视觉自回归模型的生成效率和质量。

Comments ToProVAR is honored to be accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18753 2026-03-03 cs.LG cs.AI

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

HalluGuard: 解密数据驱动和推理驱动的LLM幻觉

Xinyue Zeng, Junhong Lin, Yujun Yan, Feng Guo, Liang Shi, Jun Wu, Dawei Zhou

机构 * CS Department Virginia Tech(弗吉尼亚理工学院计算机科学系) EECS Department MIT(麻省理工学院电子工程与计算机科学系) CS Department Dartmouth College(达特茅斯学院计算机科学系) Statistics Department Virginia Tech(弗吉尼亚理工学院统计学系) CS Department Michigan State University(密歇根州立大学计算机科学系)

AI总结 HalluGuard通过统一理论框架和NTK评分方法,系统识别LLM中的数据驱动和推理驱动幻觉,实现高精度检测。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20745 2026-03-03 cs.AI cs.CL cs.LG

AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent

AgentMath: 通过工具增强代理赋能大语言模型的数学推理

Haipeng Luo, Huawen Feng, Qingfeng Sun, Can Xu, Kai Zheng, Yufei Wang, Tao Yang, Han Hu, Yansong Tang

AI总结 AgentMath通过整合语言模型和代码解释器,提升大语言模型在复杂数学问题上的推理能力,实现高效训练和高准确率。

Comments This paper has been accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏