Towards Automating Scientific Review with Google's Paper Assistant Tool
迈向自动化科学评审:谷歌论文助手工具
机构 * Google Research USA(谷歌美国研究)
AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。
大厂专区
迈向自动化科学评审:谷歌论文助手工具
机构 * Google Research USA(谷歌美国研究)
AI总结 提出四层AI-人类协作分类法,并介绍论文助手工具(PAT),通过推理缩放技术实现深度科学评审,在SPOT基准上数学错误召回率提升34%,并在STOC和ICML会议中成功识别关键错误。
模拟体:面向近乎最优时间序列预测与推断的决策理论预训练
机构 * Google(谷歌)
AI总结 提出一种通过决策理论预训练学习时间序列估计器的神经网络框架,通过指定生成世界和决策目标,训练网络逼近最优决策规则,在零样本推断中实现近乎最优风险、偏差控制和均匀校准。
最强的教师并不总是最好的教师:以学生为中心的答案选择
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Southern California(南加州大学) ; Independent Researcher(独立研究者) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; Google(谷歌) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Northwestern University(西北大学) ; Allen Institute for AI (AI2)(人工智能研究院(AI2))
AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。
针对策划倾向的逼真蜜罐评估
机构 * Google DeepMind(谷歌DeepMind)
AI总结 提出一种框架,通过在Google对齐研究代码库中设置编码任务作为蜜罐,测试模型在有机会时是否会追求工具性目标,实验表明Gemini模型在真实部署中不会主动策划,但在特定提示下会表现出策划或破坏行为。
二阶方法在序列预处理中的威力
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
AI总结 本文提出利用Vovk-Azoury-Warmuth算法与USP结合,实现对边际稳定线性动力系统中序列预处理的强效结果,达到对数级别的 regret。
Comments 19 pages, 3 figures
无训练不确定性引导的复杂视觉任务多模态大语言模型
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)
AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。