arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-03-03 至 2026-03-03 共收录 251
2510.09285 2026-03-03 cs.CV

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08919 2026-03-03 cs.CV cs.LG

PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性

Daiki Yoshikawa, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。

Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08630 2026-03-03 cs.CL

ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection

ExPO-HM:为仇恨表情包检测学习解释-然后检测

Jingbiao Mei, Mingsheng Sun, Jinghong Chen, Pengda Qin, Yuhong Li, Da Chen, Bill Byrne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Xiaohongshu Inc.(小红书公司) University of Bath(巴斯大学) Tencent Company, China(腾讯公司) Alibaba Group(阿里巴巴集团)

AI总结 ExPO-HM通过结合SFT预热、GRPO与课程学习及CDE,提升仇恨表情包检测的解释性和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07746 2026-03-03 cs.LG

t-SNE Exaggerates Clusters, Provably

t-SNE放大聚类,可证明

Noah Bergam, Szymon Snoeck, Nakul Verma

AI总结 本文证明t-SNE无法可靠推断输入聚类强度和异常点极端性,挑战了其可视化结构匹配输入的常规认知。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06377 2026-03-03 cs.LG cs.AI cs.DB

Relational Transformer: Toward Zero-Shot Foundation Models for Relational Data

关系变换器:面向关系数据的零样本基础模型

Rishabh Ranjan, Valter Hudovernik, Mark Znidar, Charilaos Kanatsoulis, Roshan Upendra, Mahmoud Mohammadi, Joe Meyer, Tom Palczewski, Carlos Guestrin, Jure Leskovec

AI总结 关系变换器通过零样本迁移能力,为关系数据提供高效的基础模型解决方案。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06218 2026-03-03 cs.CV cs.AI

EgoNight: Towards Egocentric Vision Understanding at Night with a Challenging Benchmark

EgoNight: 向夜间视角理解迈进的挑战性基准

Deheng Zhang, Yuqian Fu, Runyi Yang, Yang Miao, Tianwen Qian, Xu Zheng, Guolei Sun, Ajad Chhatkuli, Xuanjing Huang, Yu-Gang Jiang, Luc Van Gool, Danda Pani Paudel

机构 * East China Normal University(东华大学) HKUST(GZ)(香港科技大学(广州)) Nankai University(南开大学) Fudan University(复旦大学)

AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05132 2026-03-03 cs.CL cs.AI cs.LG

Training Large Language Models To Reason In Parallel With Global Forking Tokens

训练大型语言模型以并行推理与全局分叉标记

Sheng Jia, Xiao Wang, Shiva Prasad Kasiviswanathan

机构 * University of Toronto(多伦多大学) Amazon(亚马逊) Vector Institute(向量研究所)

AI总结 本文提出SSFT和GFPO方法,通过集合基于的损失和双射匹配,提升大型语言模型在并行推理中的多样性和准确性,从而在数学推理和代码生成任务中取得优于传统SFT的性能。

Comments Accepted at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), https://openreview.net/forum?id=xBQvvkg4Wc

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05069 2026-03-03 cs.CL cs.AI

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

SwiReasoning: 在潜在空间和显式空间中切换以实现帕累托更优推理的LLM

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao

AI总结 SwiReasoning通过在潜在空间和显式空间之间切换,提升推理LLMs的准确率和令牌效率。

Comments ICLR 2026. Code: https://github.com/sdc17/SwiReasoning, Website: https://swireasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05060 2026-03-03 cs.LG math.ST stat.ML stat.TH

ResCP: Reservoir Conformal Prediction for Time Series Forecasting

ResCP:用于时间序列预测的水库置信区间预测

Roberto Neglia, Andrea Cini, Michael M. Bronstein, Filippo Maria Bianchi

机构 * UiT the Arctic University of Norway(UiT北极大学) IDSIA USI-SUPSI, Università della Svizzera italiana(IDSIA瑞士联合大学) University of Oxford(牛津大学) NORCE Norwegian Research Centre AS(挪威研究机构)

AI总结 ResCP通过水库计算实现无训练时间序列预测的置信区间方法,有效处理局部时间动态并保持计算效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04474 2026-03-03 cs.AI cs.LG

DRPO: Efficient Reasoning via Decoupled Reward Policy Optimization

DRPO:通过解耦奖励策略优化实现高效推理

Gang Li, Yan Chen, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯A&M大学) The University of Virginia(弗吉尼亚大学)

AI总结 DRPO通过解耦奖励策略优化,有效解决大型推理模型过度思考问题,实现高效推理并减少响应延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03253 2026-03-03 cs.LG cs.AI

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习

Heyang Gao, Zexu Sun, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Xu Chen

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02386 2026-03-03 cs.CR cs.AI cs.LG

On The Fragility of Benchmark Contamination Detection in Reasoning Models

在推理模型中基准污染检测的脆弱性

Han Wang, Haoyu Li, Brian Ko, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学)

AI总结 研究发现LRMs在基准污染检测中存在脆弱性,通过简单方法可轻易污染模型以提升排行榜表现,威胁评估公平性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02253 2026-03-03 cs.CV cs.AI cs.LG

DragFlow: Unleashing DiT Priors with Region Based Supervision for Drag Editing

DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑

Zihan Zhou, Shilin Lu, Shuli Leng, Shaocong Zhang, Zhuming Lian, Xinlei Yu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学)

AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01265 2026-03-03 cs.LG cs.AI cs.CL

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00504 2026-03-03 stat.ML cond-mat.dis-nn cs.IT cs.LG math.IT

A universal compression theory for lottery ticket hypothesis and neural scaling laws

彩票彩票假说和神经扩展定律的通用压缩理论

Hong-Yi Wang, Di Luo, Tomaso Poggio, Isaac L. Chuang, Liu Ziyin

AI总结 本研究提出了一种通用压缩理论,证明了大规模模型可以被压缩到 polylog 宽度并保持学习动态,同时数据集可压缩到 polylog 大小而保持损失景观不变。

Comments 26 pages. Accepted by ICLR 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26432 2026-03-03 cs.LG cs.AI

AdaBlock-dLLM: Semantic-Aware Diffusion LLM Inference via Adaptive Block Size

AdaBlock-dLLM: 通过自适应块大小实现语义感知的扩散语言模型推理

Guanxi Lu, Hao Mark Chen, Yuto Karashima, Zhican Wang, Daichi Fujiki, Hongxiang Fan

AI总结 AdaBlock-dLLM通过自适应块大小实现语义感知的扩散语言模型推理,提升解码准确性与效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25087 2026-03-03 cs.LG cs.AI cs.CL

Scaling with Collapse: Efficient and Predictable Training of LLM Families

按比例崩溃:高效且可预测的LLM家族训练

Shane Bergsma, Bin Claire Zhang, Nolan Dey, Shaheer Muhammad, Gurpreet Gosal, Joel Hestness

机构 * Cerebras Systems(Cerebras系统)

AI总结 该研究发现LLM训练中的崩溃现象,表明通过优化超参数可实现高效且可预测的训练,提出了Celerity模型并展示了其在训练诊断和超参数调优中的应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24245 2026-03-03 cs.CL cs.AI

Prompt and Parameter Co-Optimization for Large Language Models

用于大型语言模型的提示与参数联合优化

Xiaohe Bo, Rui Li, Zexu Sun, Quanyu Dai, Zeyu Zhang, Zihang Tian, Xu Chen, Zhenhua Dong

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

AI总结 本文提出MetaTuner框架,通过联合优化提示和参数提升大型语言模型性能,通过共享编码层和监督正则化损失实现协同优化。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24156 2026-03-03 cs.AI cs.CL

Reasoning or Retrieval? A Study of Answer Attribution on Large Reasoning Models

推理还是检索?对大推理模型答案归因的研究

Yuhui Wang, Changjiang Li, Guangke Chen, Jiacheng Liang, Ting Wang

机构 * Stony Brook University(石溪大学) Palo Alto Networks(帕洛阿尔托网络) Wuhan University(武汉大学)

AI总结 本研究探讨了大型推理模型在推理与检索机制之间的冲突,提出FARL框架通过抑制检索捷径提升推理能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23365 2026-03-03 cs.LG

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

连续思维的涌现:揭示连续思维链的训练动态

Hanlin Zhu, Shibo Hao, Zhiting Hu, Jiantao Jiao, Stuart Russell, Yuandong Tian

机构 * UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Nvidia(英伟达) Meta AI

AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。

Comments 32 pages, 9 figures, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21993 2026-03-03 cs.AI cs.LG

Bilinear representation mitigates reversal curse and enables consistent model editing

双线性表示缓解反转诅咒并实现一致的模型编辑

Dong-Kyum Kim, Minsung Kim, Jea Kwon, Nakyeong Yang, Meeyoung Cha

机构 * MPI-SP(马克斯·普朗克研究所(德国)) SNU(首尔国立大学(韩国)) KAIST(韩国科学技术院(韩国))

AI总结 双线性表示缓解语言模型的反转诅咒,通过构建内在几何结构实现一致的模型编辑。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21513 2026-03-03 cs.LG cs.AI cs.CV math.PR stat.ML

DistillKac: Few-Step Image Generation via Damped Wave Equations

DistillKac:通过阻尼波动方程实现少步图像生成

Weiqiao Han, Chenlin Meng, Christopher D. Manning, Stefano Ermon

机构 * MIT(麻省理工学院) Stanford(斯坦福大学)

AI总结 DistillKac通过阻尼波动方程和随机Kac表示实现少步高质量图像生成,结合无分类指导和终点蒸馏方法,在保持数值稳定性的同时提升生成质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21057 2026-03-03 cs.CR cs.CL

PMark: Towards Robust and Distortion-free Semantic-level Watermarking with Channel Constraints

PMark: 向鲁棒且无失真语义级水印技术迈进:在通道约束下

Jiahao Huo, Shuliang Liu, Bin Wang, Junyan Zhang, Yibo Yan, Aiwei Liu, Xuming Hu, Mingxun Zhou

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 PMark通过代理函数框架实现鲁棒且无失真的语义级水印技术,提升对改写攻击的鲁棒性并优化采样效率。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20719 2026-03-03 cs.LG q-bio.QM

A Genetic Algorithm for Navigating Synthesizable Molecular Spaces

一种用于可合成分子空间导航的遗传算法

Alston Lo, Connor W. Coley, Wojciech Matusik

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 SynGA是一种用于可合成分子空间导航的遗传算法,通过自定义交叉和变异算子确保合成可行性,并结合机器学习过滤器提升性能,适用于属性优化等任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏