WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
WikiSkill:将智能体经验编译为持久知识以实现技能演化
机构 * Google Research(谷歌研究院) ; Virginia Tech(弗吉尼亚理工大学)
AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。
大厂专区
WikiSkill:将智能体经验编译为持久知识以实现技能演化
机构 * Google Research(谷歌研究院) ; Virginia Tech(弗吉尼亚理工大学)
AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。
4DSynth:面向动态具身模拟的可控程序式世界合成
机构 * Nanyang Technological University(南洋理工大学) ; University of Oxford(牛津大学) ; Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。
可指令智能体的规划与控制解耦
机构 * UC Berkeley(加州大学伯克利分校) ; UBC(不列颠哥伦比亚大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。
Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)
利用Gemini加速现实世界中的科学研究
机构 * Google DeepMind(谷歌DeepMind) ; Duke University(杜克大学) ; Columbia University(哥伦比亚大学) ; Google Research(谷歌研究) ; Texas A&M University(德克萨斯农工大学)
AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。
用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写
机构 * KAIST(韩国科学技术院) ; Korea University(高丽大学) ; Google Cloud AI Research(谷歌云人工智能研究院)
AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。
Comments Work in progress
基于帧的Transformer模型微调
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究提出FrameFT方法,采用融合帧基的稀疏系数矩阵实现Transformer模型的参数高效微调,性能优于或媲美现有PEFT技术,且所需可训练参数更少。
Comments 21 pages, 6 figures
超越能力基准:从生产事件元数据学习LLM云服务的操作指纹
机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)
AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。
SKILL.state:可扩展的长程智能体技能
机构 * Google LLC(谷歌公司) ; Purdue University(普渡大学)
AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。
Comments accepted at EMNLP
高斯中的抓取:从单目视频快速重建动态手-物体交互
机构 * Google(谷歌) ; Bielefeld University, Bielefeld, Germany(比勒菲尔德大学,德国)
AI总结 本文提出GraG方法,通过高效跟踪手和物体实现快速动态3D重建,采用紧凑的高斯求和表示提升效率并保持几何精度,实验表明其在长序列中速度提升6.4倍,物体重建精度提高13.4%。
Comments Project page: this https URL (https://aidilayce.github.io/GraG-page/)
大语言模型如何扭曲我们的书面语言
机构 * UC Berkeley(加州大学伯克利分校) ; UC San Diego(加州大学圣地亚哥分校) ; University of Washington(华盛顿大学) ; Zaytuna College(扎亚图纳学院) ; Google DeepMind(谷歌DeepMind)
AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。
超越罗塞塔石碑:泛化动态中的统一力量
机构 * Google DeepMind(谷歌DeepMind) ; Tel Aviv University(特拉维夫大学) ; Harvard University(哈佛大学) ; New York University(纽约大学)
AI总结 本研究通过在合成多语言数据集上训练小型Transformer模型,揭示了LLMs跨语言知识迁移困难的原因,提出了统一表征视角,为改善LLMs跨语言迁移提供了方法。