arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-02-18 至 2026-02-18 共收录 15
2602.15817 2026-02-18 cs.LG cs.RO math.OC

Solving Parameter-Robust Avoid Problems with Unknown Feasibility using Reinforcement Learning

利用强化学习解决未知可行性参数鲁棒避障问题

Oswin So, Eric Yang Yu, Songyuan Zhang, Matthew Cleaveland, Mitchell Black, Chuchu Fan

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与航天系)

AI总结 本文提出Feasibility-Guided Exploration方法,通过识别可行初始条件并学习安全策略,提升在未知可行性下的避障性能。

Comments ICLR 2026. The project page can be found at https://oswinso.xyz/fge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15776 2026-02-18 cs.AI

GlobeDiff: State Diffusion Process for Partial Observability in Multi-Agent Systems

GlobeDiff:多智能体系统中部分可观测性的状态扩散过程

Yiqin Yang, Xu Yang, Yuhua Jiang, Ni Mu, Hao Hu, Runpeng Xie, Ziyou Zhang, Siyuan Li, Yuan-Hua Ni, Qianchuan Zhao, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) Tsinghua University(清华大学) Moonshot AI Nankai University(南开大学) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)

AI总结 GlobeDiff通过多模态扩散过程解决多智能体系统中部分可观测性问题,实现高保真度的全局状态推断。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15669 2026-02-18 cs.AI

PERSONA: Dynamic and Compositional Inference-Time Personality Control via Activation Vector Algebra

PERSONA:通过激活向量代数实现动态和组合性的人格控制

Xiachong Feng, Liang Zhao, Weihong Zhong, Yichong Huang, Yuxuan Gu, Lingpeng Kong, Xiaocheng Feng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

AI总结 PERSONA通过激活向量代数实现动态人格控制,无需训练即可达到微调水平性能,并在多个基准测试中表现出色。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08032 2026-02-18 cs.LG

Horizon Imagination: Efficient On-Policy Rollout in Diffusion World Models

地平线想象:在扩散世界模型中实现高效的 on-policy 滚动

Lior Cohen, Ofir Nabati, Kaixin Wang, Navdeep Kumar, Shie Mannor

机构 * Technion(技术学院) Microsoft Research(微软研究院)

AI总结 本文提出地平线想象方法,通过并行去噪和子帧预算优化,在扩散世界模型中实现高效的 on-policy 滚动,提升生成质量与控制性能。

Comments This paper will be published in the ICLR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01761 2026-02-18 cs.LG cs.AI stat.ML

Enhanced Generative Model Evaluation with Clipped Density and Coverage

增强的生成模型评估:剪裁密度与覆盖度

Nicolas Salvy, Hugues Talbot, Bertrand Thirion

AI总结 本文提出剪裁密度和剪裁覆盖度两种新指标,用于提升生成模型评估的鲁棒性、灵敏度和可解释性。

Journal ref The Fourteenth International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22914 2026-02-18 cs.CV cs.LG

cadrille: Multi-modal CAD Reconstruction with Reinforcement Learning

cadrille: 多模态CAD重建与强化学习

Maksim Kolodiazhnyi, Denis Tarasov, Dmitrii Zhemchuzhnikov, Alexander Nikulin, Ilya Zisman, Anna Vorontsova, Anton Konushin, Vladislav Kurenkov, Danila Rukhovich

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) AXXX ETH Zurich(苏黎世联邦理工学院) Innopolis University(因诺波利斯大学) Institute of Mechanics, Armenia(亚美尼亚力学研究所)

AI总结 cadrille通过强化学习实现多模态CAD重建,首次在CAD任务中应用RL微调,提升重建性能并设定新基准。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15456 2026-02-18 cs.CL

In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations

我们信任代理,但代理信任谁?潜在的来源偏好引导LLM生成

Mohammad Aflah Khan, Mahsa Amani, Soumi Das, Bishwamittra Ghosh, Qinyuan Wu, Krishna P. Gummadi, Manish Gupta, Abhilasha Ravichander

AI总结 研究发现LLM在处理信息时存在潜在的来源偏好,影响信息选择和呈现,需进一步探索其来源并提供透明机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15124 2026-02-18 cs.CV

Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition

基于多模态大语言模型的零样本人-物交互检测

Shiyu Xuan, Dongkai Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics(西南财经大学计算机与人工智能学院) Nanjing Forestry University(南京林业大学)

AI总结 本文提出基于多模态大语言模型的零样本人-物交互检测框架,通过解耦检测与识别任务,结合确定性生成方法和空间感知模块,实现高效准确的零样本交互识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11661 2026-02-18 cs.AI

SR-Scientist: Scientific Equation Discovery With Agentic AI

SR-Scientist:基于代理AI的科学方程发现

Shijie Xia, Yuhan Sun, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) GAIR

AI总结 SR-Scientist通过代理AI实现科学方程发现,具备自主编写代码、分析数据、优化方程的能力,实验表明其在多个科学领域表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10509 2026-02-18 cs.SD cs.AI

MARS-Sep: Multimodal-Aligned Reinforced Sound Separation

MARS-Sep: 多模态对齐强化声音分离

Zihan Zhang, Xize Cheng, Zhennan Jiang, Dongjie Fu, Jingyuan Chen, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 MARS-Sep通过强化学习框架实现多模态对齐,提升声音分离的语义一致性和信号质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03269 2026-02-18 cs.LG cs.AI cs.CL

General Exploratory Bonus for Optimistic Exploration in RLHF

在RLHF中引入乐观探索的通用探索奖金

Wendi Li, Changdae Oh, Sharon Li

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

AI总结 本文提出GEB框架,通过理论分析和实验验证,解决了RLHF中乐观探索的偏差问题,提供了一种统一且有效的探索奖金方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00565 2026-02-18 cs.AI cs.LG

Toward Safer Diffusion Language Models: Discovery and Mitigation of Priming Vulnerability

迈向更安全的扩散语言模型:发现和缓解提示漏洞

Shojiro Yamabe, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

AI总结 本文发现扩散语言模型存在因迭代去噪过程导致的提示漏洞,并提出针对性的安全对齐方法以缓解该问题。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06134 2026-02-18 cs.AI

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16051 2026-02-18 cs.CL

Moving Beyond Medical Exams: A Clinician-Annotated Fairness Dataset of Real-World Tasks and Ambiguity in Mental Healthcare

超越医学考试:一个由临床专家标注的现实任务及精神卫生领域模糊性公平性数据集

Max Lamparth, Declan Grabb, Amy Franks, Scott Gershan, Kaitlyn N. Kunstman, Aaron Lulla, Monika Drummond Roots, Manu Sharma, Aryan Shrivastava, Nina Vasan, Colleen Waickman

机构 * Stanford University(斯坦福大学) University of Colorado(科罗拉多大学) Northwestern University(西北大学) University of Wisconsin(威斯康星大学) Yale School of Medicine(耶鲁医学院) University of Chicago(芝加哥大学) Ohio State University(俄亥俄州立大学)

AI总结 本文提出一个由临床专家标注的现实任务公平性数据集,用于评估模型在精神卫生领域决策中的性能和偏见问题。

Comments Camera-ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03862 2026-02-18 cs.LG cs.AI

Robust Deep Reinforcement Learning against Adversarial Behavior Manipulation

对抗性行为操控下的鲁棒深度强化学习

Shojiro Yamabe, Kazuto Fukuchi, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) University of Tsukuba(筑波大学) RIKEN AIP(理化学研究所AIP)

AI总结 本文提出了一种基于模仿学习的对抗性攻击方法,并通过时间折扣正则化提升强化学习对行为定向攻击的鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏