arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-28 至 2026-08-28 共收录 11
2608.27454 2026-08-28 cs.AI cs.CL 新提交

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

WikiSkill:将智能体经验编译为持久知识以实现技能演化

Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu

机构 * Google Research(谷歌研究院) Virginia Tech(弗吉尼亚理工大学)

AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26701 2026-08-28 cs.AI 新提交

Accelerating Scientific Research with Gemini in the Real-World

利用Gemini加速现实世界中的科学研究

Samuel Schmidgall, Xiaokai Zhu, Marian Shaw, Lin Yang, Valentin Liévin, Jingyun Yang, Yuchen Zhuang, Tim Strother, Alex Bijamov, Min Woo Sun, Anil Palepu, Justin Chen, David Steiner, Jacqueline Shreibati, Wei-Hung Weng, Yilin Zhao, Xingjian Hu, Nicholas Zahn, Sadhya Garg, Julia Kirby, Yuxiang Gan, Jiaoli Li, Divy Thakkar, Shekoofeh Azizi, David Racz, Juraj Gottweis, Vivek Natarajan, Chenglin Wu, Tal Danino, Keran Rong, Haozhe Wang, Benoit Schillings, Yong Cheng, Quoc V. Le, Tao Tu

机构 * Google DeepMind(谷歌DeepMind) Duke University(杜克大学) Columbia University(哥伦比亚大学) Google Research(谷歌研究) Texas A&M University(德克萨斯农工大学)

AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26430 2026-08-28 cs.AI 新提交

Fine-Tuning of Transformer models with Frames

基于帧的Transformer模型微调

Harshavardhan Adepu, Li Zhang, Sanjiv Kumar, Vikas Singh

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

AI总结 该研究提出FrameFT方法,采用融合帧基的稀疏系数矩阵实现Transformer模型的参数高效微调,性能优于或媲美现有PEFT技术,且所需可训练参数更少。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26332 2026-08-28 cs.LG 新提交

Beyond Capability Benchmarks: Learning Operational Fingerprints of LLM Cloud Services from Production Incident Metadata

超越能力基准:从生产事件元数据学习LLM云服务的操作指纹

Meiwei Zhang, Eduardo Miranda, Bruce Baynes, Suvigya Jain, Wanlong Chen, Tao He, Sergey Borodavkin

机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)

AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26263 2026-08-28 cs.AI cs.MA 新提交

SKILL.state: Scalable Long-Horizon Agent Skills

SKILL.state:可扩展的长程智能体技能

Sanket Badhe, Priyanka Tiwari, Jonghyun Chung

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。

Comments accepted at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12929 2026-08-28 cs.CV 版本更新

Grasp in Gaussians: Fast Monocular Reconstruction of Dynamic Hand-Object Interactions

高斯中的抓取:从单目视频快速重建动态手-物体交互

Ayce Idil Aytekin, Xu Chen, Zhengyang Shen, Thabo Beeler, Helge Rhodin, Rishabh Dabral, Christian Theobalt

机构 * Google(谷歌) Bielefeld University, Bielefeld, Germany(比勒菲尔德大学,德国)

AI总结 本文提出GraG方法,通过高效跟踪手和物体实现快速动态3D重建,采用紧凑的高斯求和表示提升效率并保持几何精度,实验表明其在长序列中速度提升6.4倍,物体重建精度提高13.4%。

Comments Project page: this https URL (https://aidilayce.github.io/GraG-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18161 2026-08-28 cs.CL cs.AI 版本更新

How LLMs Distort Our Written Language

大语言模型如何扭曲我们的书面语言

Marwa Abdulhai, Isadora White, Yanming Wan, Ibrahim Qureshi, Joel Z. Leibo, Max Kleiman-Weiner, Natasha Jaques

机构 * UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Zaytuna College(扎亚图纳学院) Google DeepMind(谷歌DeepMind)

AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11017 2026-08-28 cs.CL cs.AI 版本更新

Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics

超越罗塞塔石碑:泛化动态中的统一力量

Carter Blum, Katja Filippova, Ann Yuan, Asma Ghandeharioun, Julian Zimmert, Fred Zhang, Jessica Hoffmann, Tal Linzen, Martin Wattenberg, Lucas Dixon, Mor Geva

机构 * Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) Harvard University(哈佛大学) New York University(纽约大学)

AI总结 本研究通过在合成多语言数据集上训练小型Transformer模型,揭示了LLMs跨语言知识迁移困难的原因,提出了统一表征视角,为改善LLMs跨语言迁移提供了方法。

详情

展开后加载摘要…

URL PDF HTML 收藏