arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-19 至 2026-05-19 共收录 4
2605.18748 2026-05-19 cs.CV

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18652 2026-05-19 cs.CV

MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

MementoGUI: 学习代理多模态记忆控制以实现长周期GUI代理

Ziyun Zeng, Hang Hua, Bocheng Zou, Mu Cai, Rogerio Feris, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出MementoGUI,一种学习代理多模态记忆控制框架,用于提升长周期GUI代理的任务状态维持能力,通过模块化记忆控制和可扩展的数据管道提高记忆检索和决策效率。

Comments Preprint, 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20216 2026-05-19 cs.CL cs.AI cs.LG

Locally Coherent Parallel Decoding in Diffusion Language Models

局部相干并行解码在扩散语言模型中

Michael Hersche, Nicolas Menet, Ronan Tanios, Abbas Rahimi

机构 * IBM Research - Zurich(IBM瑞士研究实验室)

AI总结 本文提出CoDiLA方法,通过引入小型辅助自回归模型来解决扩散语言模型在并行解码中的相干性问题,从而在代码生成任务中实现更高的准确性和速度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21523 2026-05-19 cs.LG stat.ML

Interpretable epistemic uncertainty decomposition in sequential generative models via polynomial chaos surrogates

通过多项式混沌代理实现序列生成模型中可解释的epistemic不确定性分解

Ramón Nartallo-Kaluarachchi, Shashanka Ubaru, Małgorzata J Zimoń, Dongsung Huh, Robert Manson-Sawko, Lior Horesh, Yoshua Bengio

机构 * Mathematical Institute, University of Oxford, United Kingdom(牛津大学数学研究所,英国) IBM Research, Thomas J. Watson Research Center, USA(IBM研究院,托马斯·J·沃森研究中心,美国) IBM Research Europe, Daresbury, United Kingdom(IBM欧洲研究院,达尔斯伯里,英国) MIT–IBM Watson AI Lab, Massachusetts, USA(麻省理工–IBM沃森人工智能实验室,马萨诸塞州,美国) Université de Montréal, Mila–Quebec AI Institute, Montreal, Quebec, Canada(蒙特利尔大学,魁北克人工智能研究所,蒙特利尔,魁北克,加拿大)

AI总结 本文提出通过多项式混沌展开分析序列生成模型中epistemic不确定性的来源,揭示奖励组件对生成决策的影响,优于深度集合、贝叶斯神经网络等方法,且在多个真实任务中展现高效性和鲁棒性。

Comments 37 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏