arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-05-27 至 2026-05-27 共收录 15
2605.26955 2026-05-27 cs.CL cs.AI

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

JuICE:评估LLM裁判识别文化错误的基准

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh

机构 * KAIST(韩国科学技术院) Google(谷歌) Universitas Gadjah Mada(加查马达大学)

AI总结 提出JuICE基准,包含7470个文化语言错误标注的多语言数据集,用于评估LLM裁判在长文本中识别深层文化错误的能力,发现最强模型F1仅0.52且常遗漏本地人易识别的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26340 2026-05-27 cs.AI cs.CL cs.MA

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

ScientistOne: 迈向基于证据链的人类级自主研究

Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarishi Sinha, Parthasarathy Ranganathan, Burak Gokturk, Jinsung Yoon, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究)

AI总结 提出证据链框架Chain-of-Evidence和自主研究系统ScientistOne,通过可追溯性解决可验证性失败问题,在多项任务上达到或超越人类专家水平。

Comments Project website: https://scientist-one.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26248 2026-05-27 cs.LG cs.AI cs.NE

Unified Neural Scaling Laws

统一神经缩放定律

Ethan Caballero, Priyank Jaini, David Krueger, Irina Rish

机构 * Mila, University of Montreal(蒙特利尔大学Mila实验室) Google DeepMind(谷歌DeepMind)

AI总结 提出一种统一神经缩放定律(UNSL)函数形式,能够准确建模和预测深度神经网络在多个维度(模型参数、训练数据量、训练步数、推理步数、计算量及超参数)同时变化时的缩放行为,适用于多种架构和任务,并在大规模视觉、语言、数学和强化学习任务中实现更精确的缩放行为外推。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25678 2026-05-27 stat.ML cs.DS cs.LG math.ST stat.TH

PAC Learning with Bandit Feedback: Sharp Sample Complexity in the Realizable Setting

带强盗反馈的PAC学习:可实现设置下的精确样本复杂度

Steve Hanneke, Qinglin Meng, Shay Moran, Amirreza Shaeiri

机构 * Technion – Israel Institute of Technology and Google Research(技术ion – 以色列理工学院和谷歌研究)

AI总结 本文研究可实现设置下带强盗反馈的多类PAC学习问题,通过定义新的组合维度(强盗DS维度)并基于ListCascade算法,给出了最优样本复杂度的精确刻画(至多对数因子)。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24217 2026-05-27 cs.AI cs.DC

Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks

识别和减轻生产级LLM推理基准中的系统性测量偏差

Ashok Chandrasekar, Jason Kramberger

机构 * Google(谷歌)

AI总结 针对生产级LLM推理基准中因客户端排队导致的测量偏差,提出基于多进程的无偏评估框架和归一化输出令牌时间(NTPOT)指标,实现高并发下的准确性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23991 2026-05-27 physics.ao-ph astro-ph.EP cs.LG

Quantification of atmospheric carbon dioxide from the Geostationary Operational Environmental Satellite (GOES East)

从地球静止业务环境卫星(GOES East)量化大气二氧化碳

Aaron Sonabend-W, Sean Campbell, John Platt, Christopher Van Arsdale, Anna M. Michalak

机构 * Google Research(谷歌研究) Google Ads(谷歌广告) Carnegie Institution for Science(卡内基研究所)

AI总结 利用GOES-East卫星的高时空分辨率数据,通过物理引导的神经网络DeepXCO2估算干空气柱CO2摩尔分数,并验证其捕捉真实XCO2变异性的能力。

Comments 28 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26619 2026-05-27 cs.CL cs.AI

Searching the Internet for Challenging Benchmarks at Scale

在互联网上大规模搜索具有挑战性的基准测试

Wenda Xu, Vilém Zouhar, Parker Riley, Mara Finkelstein, Markus Freitag, Daniel Deutsch

机构 * Google(谷歌) ETH Zurich(苏黎世联邦理工学院)

AI总结 提出一种自动框架,将互联网建模为多臂老虎机问题,通过epsilon-greedy策略高效搜索最具挑战性的主题,以构建无需人工筛选的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10095 2026-05-27 cs.CV

Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models

挖掘属性子空间以实现3D基础模型的高效微调

Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Y. Feng, Zhangyang Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Adobe Research(Adobe研究) Google Research(谷歌研究)

AI总结 本文通过生成合成数据并提取与纹理、几何、相机运动和光照变化相关的LoRA子空间,发现这些子空间近似解耦,集成后形成降维子空间,从而提高下游任务微调的效率和预测精度。

Comments 10 pages, 8 figures. Code here: https://github.com/jpppppppppppppppppppppppp/Subspaces-Mining-for-VGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23994 2026-05-27 cs.LG cs.AI

Understanding the Challenges in Iterative Generative Optimization with LLMs

理解大语言模型迭代生成优化中的挑战

Allen Nie, Xavier Daull, Zhiyi Kuang, Abhinav Akkiraju, Anish Chaudhuri, Max Piasevoli, Ryan Rong, YuCheng Yuan, Prerit Choudhary, Shannon Xiao, Rasool Fakoor, Adith Swaminathan, Ching-An Cheng

机构 * Google DeepMind(谷歌DeepMind) CNRS(国家科学研究中心) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) AWS(亚马逊AWS) Netflix Research(Netflix研究) Microsoft Research(微软研究院)

AI总结 本文通过案例研究,揭示了在基于大语言模型的迭代生成优化中,起始工件、信用分配和批处理等隐藏设计选择对优化成败的决定性影响,并指出缺乏跨领域的通用学习循环设置方法是生产化和采用的主要障碍。

Comments 39 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03545 2026-05-27 cs.AI

Persona Generators: Generating Diverse Synthetic Personas for Arbitrary Contexts

人格生成器:为任意上下文生成多样化的合成人格

Davide Paglieri, Logan Cross, William A. Cunningham, Joel Z. Leibo, Alexander Sasha Vezhnevets

机构 * Google DeepMind(谷歌DeepMind)

AI总结 提出Persona Generators,通过迭代进化优化生成覆盖广泛意见和偏好的多样化合成人格,在六个多样性指标上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20796 2026-05-27 cs.CL cs.LG

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

解析多模态上下文学习:现代Transformer中的模态不对称性与电路动力学

Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) DeepMind(深Mind) Beijing University of Posts(北京邮电大学)

AI总结 通过可控实验,研究现代Transformer中多模态上下文学习的基本机制,发现模态间学习不对称性,并揭示其背后的归纳式电路机制。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04085 2026-05-27 cs.CV

Unique Lives, Shared World: Learning from Single-Life Videos

独特生活,共享世界:从单个人生视频中学习

Tengda Han, Sayna Ebrahimi, Dilara Gokay, Li Yang Ku, Maks Ovsjanikov, Iva Babukova, Daniel Zoran, Viorica Patraucean, Joao Carreira, Andrew Zisserman, Dima Damen

机构 * Google DeepMind(谷歌DeepMind)

AI总结 提出“单个人生”学习范式,利用单个人拍摄的自我中心视频通过多视角自监督学习视觉编码器,发现不同人生训练的模型具有高度对齐的几何理解,且学到的表示可泛化到下游任务,与大量网络数据性能相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13217 2026-05-27 cs.IR cs.LG

LLM-guided Hierarchical Search for End-to-end Reasoning Intensive Retrieval

LLM引导的层次化搜索用于端到端推理密集型检索

Nilesh Gupta, Wei-Cheng Chang, Ngot Bui, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * UT Austin(得克萨斯大学) UCLA(加州大学洛杉矶分校) Google(谷歌)

AI总结 本文提出LATTICE,一种无需嵌入模型的LLM引导层次化搜索方法,通过LLM构建搜索索引并校准路径聚合遍历,在推理密集型基准上达到与最优微调集成基线相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26600 2026-05-27 cs.CL cs.AI

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

当LLM自我基准测试:解构自动评估中的自我偏见

Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch

机构 * Google(谷歌) ETH Zurich(苏黎世联邦理工学院)

AI总结 研究LLM自动创建基准测试时存在的自我偏见问题,发现测试集生成和评估两个环节均产生偏见,导致模型偏爱自身输出,并提出了多样性指标以部分缓解该偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02573 2026-05-27 cs.LG

Efficient Learning of Mesh-Based Physical Simulation with BSMS-GNN

基于BSMS-GNN的网格物理模拟高效学习

Yadi Cao, Menglei Chai, Minchen Li, Chenfanfu Jiang

机构 * Department of Computer Science, UCLA, Los Angeles, USA(加州大学洛杉矶分校计算机科学系) AR Perception, Google, Los Angeles, USA(谷歌AR感知部门) Department of Mathematics, UCLA, Los Angeles, USA(加州大学洛杉矶分校数学系)

AI总结 针对大规模网格物理模拟中图神经网络扩展复杂度和过平滑问题,提出基于二分图确定的双步幅池化策略BSMS-GNN,无需人工粗网格且避免几何边界错误边,显著提升精度和计算效率。

Comments Updates summary: fix the missing remark for yadi and menglei (* mention work partially done during while they are at snap inc.)

详情

展开后加载摘要…

URL PDF HTML 收藏