arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-01-27 至 2026-01-27 共收录 14
2601.18735 2026-01-27 cs.AI cs.LG

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Jiawei Yao, Jian Wang, Guanlong Qu, Ziliang Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Snap Inc.(Snap公司) Syracuse University(雪城大学)

AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18525 2026-01-27 cs.LG cs.CV

Closing the Modality Gap Aligns Group-Wise Semantics

弥合模态差距以对齐群体语义

Eleonora Grassucci, Giordano Cicchetti, Emanuele Frasca, Aurelio Uncini, Danilo Comminiello

机构 * Department of Information Engineering, Electronics, and Telecommunications(信息工程、电子与电信系)

AI总结 本文提出了一种方法,证明模态差距在群体级任务中显著影响性能,而非实例级任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18513 2026-01-27 cs.LG

LipNeXt: Scaling up Lipschitz-based Certified Robustness to Billion-parameter Models

LipNeXt: 将基于Lipschitz的认证鲁棒性扩展到十亿参数模型

Kai Hu, Haoqi Hu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 LipNeXt通过无约束和无卷积的1-Lipschitz架构,在大规模模型中实现高效的认证鲁棒性提升。

Comments ICLR 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26441 2026-01-27 cs.CV

A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models

A-TPT:面向视觉语言模型测试时提示微调的角多样性校准特性

Shihab Aaqil Ahamed, Udaya S. K. P. Miriya Thanthrige, Ranga Rodrigo, Muhammad Haris Khan

机构 * Dept. of Electronic and Telecommunication Engineering, University of Moratuwa(摩图瓦大学电子与电信工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 A-TPT通过引入角度多样性提升视觉语言模型测试时提示微调的校准性能,有效减少校准误差并提升适应能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06913 2026-01-27 cs.LG cs.AI cs.RO

DecompGAIL: Learning Realistic Traffic Behaviors with Decomposed Multi-Agent Generative Adversarial Imitation Learning

DecompGAIL: 通过分解多智能体生成对抗模仿学习学习真实交通行为

Ke Guo, Haochen Liu, Xiaojun Wu, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Desay SV Automotive(德赛西威汽车)

AI总结 DecompGAIL通过分解多智能体生成对抗模仿学习方法,解决多智能体设置中GAIL的不稳定性问题,提升交通行为的真实性和整体性能。

Comments accepted by ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04182 2026-01-27 cs.CL cs.AI

Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization

飞行中的思考:通过潜在思维策略优化提升测试时推理

Wengao Ye, Yan Liang, Lianlei Shan

AI总结 LTPO通过在测试时优化潜在思维向量,提升LLM在复杂推理任务中的鲁棒性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22500 2026-01-27 cs.LG math.OC

Dual Optimistic Ascent (PI Control) is the Augmented Lagrangian Method in Disguise

双乐观上升(PI控制)是惩罚拉格朗日方法的伪装

Juan Ramirez, Simon Lacoste-Julien

机构 * Mila - Quebec AI Institute(魁北克AI研究所) DIRO, Université de Montréal(蒙特利尔大学DIRO) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文揭示了双乐观上升方法与惩罚拉格朗日方法的等价性,为该方法提供了理论保障并指导超参数调整。

Comments Published at ICLR 2026. Code available at https://github.com/juan43ramirez/pi-control-is-alm

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02831 2026-01-27 cs.CV

No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves

无需其他表示组件:扩散变换器本身可以提供表示指导

Dengyang Jiang, Mengmeng Wang, Liuzhuozheng Li, Lei Zhang, Haoyu Wang, Wei Wei, Guang Dai, Yanning Zhang, Jingdong Wang

机构 * Northwestern Polytechnical University(西北工业大学) SGIT AI Lab, State Grid Corporation of China(国网SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

AI总结 本文提出SRA方法,利用扩散变换器自身内部表示进行对齐,无需外部组件即可提升生成模型性能。

Comments ICLR 2026. Self-Representation Alignment for Diffusion Transformers. Code: https://github.com/vvvvvjdy/SRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18712 2026-01-27 cs.CV

LLaVAction: evaluating and training multi-modal large language models for action understanding

LLaVAction:评估和训练多模态大语言模型进行动作理解

Haozhe Qi, Shaokai Ye, Alexander Mathis, Mackenzie W. Mathis

AI总结 LLaVAction通过引入动作标记和两阶段流程提升多模态大语言模型的动作理解能力,显著提升基准测试性能。

Comments https://github.com/AdaptiveMotorControlLab/LLaVAction

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17507 2026-01-27 cs.RO

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17069 2026-01-27 cs.LG cs.AI

Multi-Agent Deep Reinforcement Learning Under Constrained Communications

在受限通信下多智能体深度强化学习

Shahil Shaik, Jonathon M. Smereka, Yue Wang

机构 * US Army CCDC Ground Vehicle Systems Center(美国陆军地面车辆系统中心)

AI总结 本文提出了一种无需集中信息的分布式多智能体强化学习框架DG-MAPPO,通过多跳通信实现全局状态推断,有效提升了协作任务的鲁棒性和可扩展性。

Comments 21 pages, 8 figures, Under review at ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏