arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

ETH Zurich(苏黎世联邦理工学院)

2026-08-27 至 2026-08-27 共收录 3
2608.23831 2026-08-27 cs.RO cs.LG 版本更新

Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency

等待时学习行动:考虑推理延迟的通用机器人策略的强化学习微调

Brian Zhu, Momen Khalil, E Harrison, Emanuele Poggi, Philipp Schmitt, Bernd Kast, Philine Meister, Pranav Atreya, Qiyang Li, Finn Ferchau, Cesar Colmenero, Yash Shahapurkar, Gokul Narayanan, Melih Erdogan, Kai Wurm, Georg von Wichert, Oier Mees, Eugen Solowjow, Andrew Wagenmaker, Sergey Levine

机构 * Siemens(西门子) UC Berkeley(加州大学伯克利分校) Microsoft(微软) ETH Zurich(苏黎世联邦理工学院)

AI总结 本研究针对通用机器人策略因推理延迟破坏马尔可夫假设导致标准RL失效的问题,提出ARLI框架,通过状态增强等设计实现延迟下的RL微调,在模拟及真实任务中表现优异。

Comments 25 pages, 12 figures, project website: this https URL (https://async-rl-intermediate-information.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-08-27 cs.CV 版本更新

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01120 2026-08-27 cs.AI math.CO 版本更新

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏