arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Google(谷歌)

2026-04-21 至 2026-04-21 共收录 15
2604.18574 2026-04-21 cs.LG cs.AI

When Can LLMs Learn to Reason with Weak Supervision?

大语言模型何时能通过弱监督学习推理?

Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel, Pavel Izmailov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New York University(纽约大学) Google(谷歌)

AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18547 2026-04-21 stat.ML cs.CL cs.LG

FUSE: Ensembling Verifiers with Zero Labeled Data

FUSE:无需标注数据的验证器集成

Joonhyuk Lee, Virginia Ma, Sarah Zhao, Yash Nair, Asher Spector, Regev Cohen, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) Google(谷歌)

AI总结 FUSE通过无监督集成验证器提升大语言模型输出验证质量,无需标注数据,在多种生成模型和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17912 2026-04-21 cs.LG cs.AI

Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought

学习修正:校准强化学习用于多尝试链式推理

Muhammed Emrullah Ildiz, Halil Alperen Gozeten, Ege Onur Taga, Samet Oymak

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡) Google Research(谷歌研究院)

AI总结 本文提出Calibrated Attempt-Level (CAL) GRPO方法,通过校准每尝试的权重来提升多尝试链式推理的校准效果,实验证明其在合成和真实数据中优于传统GRPO和简单加权方法。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06987 2026-04-21 cs.LG cond-mat.mtrl-sci

OXtal: An All-Atom Diffusion Model for Organic Crystal Structure Prediction

OXtal:一种用于有机晶体结构预测的全原子扩散模型

Emily Jin, Andrei Cristian Nica, Mikhail Galkin, Jarrid Rector-Brooks, Kin Long Kelvin Lee, Santiago Miret, Frances H. Arnold, Michael Bronstein, Avishek Joey Bose, Alexander Tong, Cheng-Hao Liu

机构 * University of Oxford(牛津大学) Synteny Google(谷歌) Mila Université de Montréal(蒙特利尔大学) Caltech(加州理工学院) NVIDIA(英伟达) Lila AITHYRA FutureHouse Imperial College London(伦敦帝国学院)

AI总结 OXtal通过全原子扩散模型直接学习分子构象与周期性排列的联合分布,利用数据增强策略提升效率,实现对晶体结构的高精度预测,显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10370 2026-04-21 cs.CV cs.AI cs.LG

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

SHRUG-FM:面向地球观测的可靠性感知基础模型

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe Massant, Shruti Nath, Patrick Ebel, Vasileios Sitokonstantinou

机构 * Universitat de València(瓦伦西亚大学) Wageningen University & Research(瓦赫宁根大学与研究所) Delft University of Technology(代尔夫特理工大学) European Space Agency(欧洲航天局) Heidelberg University(海德堡大学) Ghent University(根特大学) University of Oxford(牛津大学) Google Research(谷歌研究)

AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。

Comments Accepted for proceedings at CVPR EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17808 2026-04-21 cs.AR cs.CL cs.CR cs.DS cs.PL

Enabling AI ASICs for Zero Knowledge Proof

使零知识证明具备AI专用集成电路

Jianming Tong, Jingtian Dang, Simon Langowski, Tianhao Huang, Asra Ali, Jeremy Kun, Jevin Jiang, Srinivas Devadas, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) Google(谷歌)

AI总结 MORPH框架通过重新设计零知识证明内核,利用AI专用集成电路的矩阵吞吐量和能效,提升NTT和MSM的性能,实现10倍的吞吐量提升。

Comments Design Automation Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17501 2026-04-21 cs.CL

CoAct: Co-Active LLM Preference Learning with Human-AI Synergy

CoAct:基于人机协同的LLM偏好学习

Ruiyao Xu, Mihir Parmar, Tiankai Yang, Zhengyu Hu, Yue Zhao, Kaize Ding

机构 * Northwestern University(西北大学) Google(谷歌) University of Southern California(南加州大学) University of Washington(华盛顿大学)

AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17476 2026-04-21 cs.CR cs.AR cs.CV cs.SY eess.SY

Privatar: Scalable Privacy-preserving Multi-user VR via Secure Offloading

Privatar: 通过安全卸载实现可扩展的隐私保护多用户VR

Jianming Tong, Hanshen Xiao, Krishna Kumar Nair, Hao Kang, Ashish Sirasao, Ziqi Zhang, G. Edward Suh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) Google(谷歌) Purdue University/NVIDIA(普渡大学/NVIDIA) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

AI总结 Privatar通过安全卸载实现多用户VR的可扩展隐私保护,利用领域知识在本地设备保留高能量频率组件,减少信息泄露,同时采用分布感知最小扰动技术提升隐私保障与效用。

Comments Proceedings of the 7th Machine Learning and System Conference (MLSys)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15974 2026-04-21 cs.CL cs.AI cs.LG

BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes

BEFT: 在低数据环境下高效优化语言模型的偏置项

Baichuan Huang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(Lund 大学) Google DeepMind(谷歌DeepMind)

AI总结 本文研究了在低数据环境下优化语言模型偏置项(b_q, b_k, b_v)对下游任务性能的影响,发现直接优化b_v能显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10137 2026-04-21 cs.LG cs.AI

Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning

用于行为克隆中组合泛化的自预测表示

Daniel Lawson, Adriana Hugessen, Charlotte Cloutier, Glen Berseth, Khimya Khetarpal

机构 * Mila Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出BYOL-γ方法,通过自预测表示近似后继表示,提升行为克隆在组合泛化任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17143 2026-04-21 cs.LG

SeekerGym: A Benchmark for Reliable Information Seeking

SeekerGym:一个评估可靠信息检索的基准

Remy Kim, Minseung Lee, Shuo Li, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) Curation Labs Google DeepMind(谷歌DeepMind)

AI总结 SeekerGym旨在评估AI代理检索信息的完整性,通过文档检索任务测试代理对信息完整性的量化能力,实验显示现有模型在Wikipedia和ML调研论文上分别检索出42.5%和29.2%的段落,仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16871 2026-04-21 cs.AI cs.LG

GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning

GRAIL:自主概念 grounding 用于神经符号强化学习

Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) Google Intrinsic(谷歌内在) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)

AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12013 2026-04-21 cs.LG

Sample Complexity of Autoregressive Reasoning: Chain-of-Thought vs. End-to-End

自回归推理的样本复杂性:链式推理与端到端

Steve Hanneke, Idan Mehalel, Shay Moran

机构 * Purdue University(普渡大学) The Hebrew University(希伯来大学) Technion and Google Research(技术学院和谷歌研究)

AI总结 本文研究自回归系统的学习难度,发现端到端监督下样本复杂性随生成长度T变化丰富,而链式推理监督可使样本复杂性与T无关,从而消除对生成长度的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01801 2026-04-21 cs.CL

Detecting LLM-Generated Spam Reviews by Integrating Language Model Embeddings and Graph Neural Network

通过整合语言模型嵌入和图神经网络检测LLM生成的垃圾评论

Xin Liu, Rongwu Xu, Xinyi Jia, Jason Liao, Jiao Sun, Ling Huang, Wei Xu

机构 * Tsinghua University(清华大学) University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出FraudSquad模型,结合预训练语言模型嵌入和门控图变压器,有效检测LLM生成的垃圾评论,实验表明其在精度和召回率上优于现有方法,且模型规模小,训练数据需求低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02617 2026-04-21 cs.LG cs.AI cs.CV

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

通过AI反馈提升文本到视频生成中动态物体交互

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang

机构 * Google DeepMind(谷歌DeepMind) The University of Tokyo(东京大学) Stanford University(斯坦福大学)

AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。

Comments Website: https://sites.google.com/view/aif-dynamic-t2v/

详情

展开后加载摘要…

URL PDF HTML 收藏