arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Learning Representations · 会议 · Machine Learning

2026-04-10 至 2026-04-10 共收录 10
2604.08203 2026-04-10 cs.CV cs.AI

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21872 2026-04-10 cs.AI

WebArbiter: A Principle-Guided Reasoning Process Reward Model for Web Agents

WebArbiter: 一种基于原则的推理过程奖励模型用于网络代理

Yao Zhang, Shijie Tang, Zeyu Li, Zhen Han, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

AI总结 本文提出WebArbiter,一种基于原则的推理过程奖励模型,用于网络导航任务。该模型通过文本生成产生结构化的解释,以指导任务完成。通过两阶段训练流程,提升模型的泛化能力,并在WebPRMBench基准测试中优于现有方法。

Comments Published as a conference paper at ICLR 2026. Extended version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01062 2026-04-10 cs.CL cs.AI cs.LG

SealQA: Raising the Bar for Reasoning in Search-Augmented Language Models

SealQA: 提升搜索增强语言模型在事实性问题中的推理能力

Thinh Pham, Nguyen Nguyen, Pratibha Zunjare, Weiyuan Chen, Yu-Min Tseng, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。

Comments Camera Ready version for ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07955 2026-04-10 cs.LG

Rethinking Residual Errors in Compensation-based LLM Quantization

重新思考基于补偿的LLM量化中的残差误差

Shuaiting Li, Juncan Deng, Kedong Xu, Rongtao Deng, Hong Gu, Minghan Jiang, Haibin Shen, Kejie Huang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 本文重新审视残差误差的定义,指出现有方法的校准目标存在次优问题,并引入补偿感知误差以提升LLM量化性能。

Comments ICLR'26 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07739 2026-04-10 cs.IR cs.LG

Efficient Dataset Selection for Continual Adaptation of Generative Recommenders

高效数据选择用于生成推荐系统的持续适应

Cathy Jiao, Juan Elenter, Praveen Ravichandran, Bernd Huber, Joseph Cauteruccio, Todd Wasson, Timothy Heath, Chenyan Xiong, Mounia Lalmas, Paul Bennett

机构 * Spotify Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过针对性数据选择缓解时间分布漂移导致的性能下降,采用梯度表示与分布匹配提升模型性能,实现训练效率提升与鲁棒性保障。

Comments ICLR 2026 CAO Workshop (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07569 2026-04-10 cs.LG cs.AI cs.CL cs.IT math.IT

Learning is Forgetting: LLM Training As Lossy Compression

学习是遗忘:LLM训练作为有损压缩

Henry C. Conklin, Tom Hosking, Tan Yi-Chern, Julian Gold, Jonathan D. Cohen, Thomas L. Griffiths, Max Bartolo, Seraphina Goldfarb-Tarrant

机构 * Princeton University(普林斯顿大学) Cohere

AI总结 本文提出LLM训练可视为有损压缩过程,通过保留训练数据中与目标相关的信息,揭示模型表示结构与下游性能的联系。

Comments 12 page core paper, 16 page Appendix - A shorter version with fewer visuals appears at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10723 2026-04-10 cs.LG

Generalized Spherical Neural Operators: Green's Function Formulation

广义球面神经算子:格林函数公式

Hao Tang, Hao Chen, Chao Li

机构 * University of Dundee, United Kingdom(英国邓迪大学) University of Cambridge, United Kingdom(英国剑桥大学)

AI总结 本文提出基于可设计球面格林函数及其谐波展开的广义算子设计框架,提出适应非等变系统的GSNO算子,结合多尺度谱模型与球面上下采样构建SHNet,实验证明其在扩散磁共振成像、浅水动力学和全球天气预测中优于现有方法。

Comments ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12184 2026-04-10 cs.CV cs.AI

CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs

CompoDistill:多模态大语言模型中基于注意力的知识蒸馏用于组合推理

Jiwan Kim, Kibum Kim, Sangwoo Seo, Chanyoung Park

机构 * KAIST(韩国科学技术院)

AI总结 本文提出CompoDistill,通过显式对齐学生与教师模型的视觉注意力,提升多模态大语言模型的组合推理能力,同时保持视觉问答任务的性能。

Comments ICLR'26, Project Page : https://ptkjw1997.github.io/CompoDistill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11752 2026-04-10 q-bio.QM cs.AI cs.LG

Fast and Interpretable Protein Substructure Alignment via Optimal Transport

通过最优传输实现快速且可解释的蛋白质亚结构对齐

Zhiyu Wang, Bingxin Zhou, Jing Wang, Yang Tan, Weishu Zhao, Pietro Liò, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

AI总结 本文提出PLASMA框架,通过最优传输解决蛋白质局部结构对齐问题,实现高效且可解释的残基级对齐,并通过实验验证其准确性与实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04500 2026-04-10 cs.AI cs.RO

"Don't Do That!": Guiding Embodied Systems through Large Language Model-based Constraint Generation

别这样做!

Amin Seffo, Aladin Djuhera, Masataro Asai, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 本文提出STPR框架,利用LLM将自然语言中的约束转化为可执行Python代码,解决复杂约束的翻译问题,并在仿真环境中验证其高效性和兼容性。

Comments ICLR 2026 Workshop -- Agentic AI in the Wild: From Hallucinations to Reliable Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏