arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-07-01 至 2026-07-01 共收录 16
2606.32032 2026-07-01 cs.CL cs.AI 新提交

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

基于元认知反馈的强化学习引发LLM忠实的不确定性表达

Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan

机构 * Yale University(耶鲁大学) Google Research(谷歌研究院)

AI总结 提出强化学习与元认知反馈(RLMF)和元认知数据选择方法,通过模型自我判断质量优化偏好学习,实现忠实校准(FC),在保持准确性的同时显著提升LLM不确定性表达的忠实度。

Comments Code: https://github.com/yale-nlp/RLMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31576 2026-07-01 cs.LG 新提交

Introduction to Stochastic Differential Equations for Generative Machine Learning: A Variational Perspective

生成式机器学习中的随机微分方程导论:变分视角

Ole Winther, Paul Jeha, Sander Dieleman, Andriy Mnih, Manfred Opper, Andrea Dittadi

机构 * Department of Biology, University of Copenhagen(哥本哈根大学生物系) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Google DeepMind(谷歌DeepMind) Technical University of Berlin (TU Berlin)(柏林工业大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文从变分视角出发,介绍常微分和随机微分方程在生成式机器学习中的应用,推导ELBO,并统一讨论扩散模型、分数匹配和流匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31556 2026-07-01 cs.CV 新提交

AugSplat: Radiance Field-Informed Gaussian Splatting for Sparse-View Settings

AugSplat: 基于辐射场信息的高斯泼溅用于稀疏视图设置

Lorenzo Lazzaroni, Riccardo Bollati, Daniel Barath, Michael Niemeyer, Keisuke Tateno

机构 * Google(谷歌) ETH Zurich(苏黎世联邦理工学院)

AI总结 针对稀疏视图下高斯泼溅对初始几何敏感的问题,提出AugSplat,利用辐射场合成新视角图像作为辅助监督,提升重建质量并保持实时渲染。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30790 2026-07-01 cs.CL cs.AI 新提交

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的基准测试

Avisha Das, Mihir Parmar, Mohana Ramnath, Pulkit Verma

机构 * Shiv Nadar University Chennai(金奈希夫·纳达尔大学) Google Cloud AI Research(谷歌云人工智能研究) IIT Madras(印度理工学院马德拉斯分校)

AI总结 提出Indi-RomCoM基准,用于评估大语言模型在罗马化印度语-英语混合指令上的表现,涵盖7个任务、4种语言和3种混合强度,发现模型性能随混合密度增加而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14307 2026-07-01 cs.CV 新提交

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Pano3D:统一的3D重建与全景分割

Victor Barberteguy, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Gül Varol, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 巴黎理工学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

AI总结 提出统一框架,在3D前馈重建网络中集成全景分割,通过联合训练几何与语义损失实现互惠提升,在多个数据集上达到最优性能。

Comments Accepted at ECCV 2026. Project page: https://victorbbt.github.io/Pano3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14200 2026-07-01 cs.LG

TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning

TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准

Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien, Alpay Hasanli, Max Rosenblattl, Fan Wu, Kevin Riehl, Maxwell A. Xu, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) Stanford University(2 斯坦福大学) Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) Google(5 谷歌) Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)

AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。

Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23461 2026-07-01 cs.LG 版本更新

End-to-End Efficient RL for Linear Bellman Complete MDPs with Deterministic Transitions

具有确定性转移的线性Bellman完备MDP的端到端高效强化学习

Zakaria Mhammedi, Alexander Rakhlin, Nneka Okolo

机构 * Google Research, NYC(谷歌研究院纽约) MIT(麻省理工学院)

AI总结 针对线性Bellman完备MDP,提出一种在确定性转移下计算高效的算法,对有限动作空间端到端高效,对无限动作空间仅需标准argmax oracle,实现多项式样本与计算复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17139 2026-07-01 cs.CL cs.IR 版本更新

Rethinking On-policy Optimization for Query Augmentation

重新思考查询增强的在线策略优化

Zhichao Xu, Shengyao Zhuang, Xueguang Ma, Bingsen Chen, Yijun Tian, Fengran Mo, Tao Li, Jie Cao, Vivek Srikumar

机构 * University of Utah(犹他大学) The University of Queensland(昆士兰大学) University of Waterloo(滑铁卢大学) New York University(纽约大学) University of Notre Dame(圣母大学) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind) University of Oklahoma(俄克拉荷马大学)

AI总结 本文系统比较了基于提示和强化学习的查询增强方法,发现计算量感知下简单方法常优于RL方法,并提出混合方法OPQE,通过RL生成伪文档以最大化检索性能。

Comments TMLR camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22123 2026-07-01 cs.LG 版本更新

Learning Hamiltonian Flow Maps: Mean Flow Consistency for Large-Timestep Molecular Dynamics

学习哈密顿流映射:大时间步长分子动力学的平均流一致性

Winfried Ripken, Michael Plainer, Gregor Lied, Thorben Frank, Oliver T. Unke, Stefan Chmiela, Frank Noé, Klaus-Robert Müller

机构 * Technical University Berlin(柏林工业大学) Free University of Berlin(柏林自由大学) Zuse School ELIZA Google DeepMind(谷歌DeepMind) Rice University(莱斯大学) MPI for Informatics, Saarbrücken(马克斯·普朗克信息学研究所,萨尔布吕肯)

AI总结 提出平均流一致性条件学习哈密顿流映射,实现远超经典积分器稳定性极限的大时间步长更新,无需轨迹生成,在分子动力学模拟中显著提升步长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15029 2026-07-01 cs.LG cond-mat.dis-nn cs.CL 版本更新

Symmetry in language statistics shapes the geometry of model representations

语言统计中的对称性塑造了模型表示的几何结构

Dhruva Karkada, Daniel J. Korchinski, Andres Nava, Matthieu Wyart, Yasaman Bahri

机构 * UC Berkeley(加州大学伯克利分校) EPFL(瑞士联邦理工学院洛桑分校) Johns Hopkins(约翰斯·霍普金斯大学) Google DeepMind(谷歌DeepMind)

AI总结 本文证明语言统计中的平移对称性(如月份共现频率仅取决于时间间隔)决定了词嵌入模型的高维几何结构,并推导出表示流形的解析形式,该几何在统计扰动下仍保持鲁棒。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏