When Can LLMs Learn to Reason with Weak Supervision?
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
大厂专区
大语言模型何时能通过弱监督学习推理?
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; New York University(纽约大学) ; Google(谷歌)
AI总结 研究探讨了在弱监督下大语言模型推理能力的提升条件,发现训练奖励饱和动态决定泛化能力,通过分离预训练和微调发现显式推理轨迹的监督微调是关键。
FUSE:无需标注数据的验证器集成
机构 * Stanford University(斯坦福大学) ; Google(谷歌)
AI总结 FUSE通过无监督集成验证器提升大语言模型输出验证质量,无需标注数据,在多种生成模型和基准测试中表现优异。
学习修正:校准强化学习用于多尝试链式推理
机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡) ; Google Research(谷歌研究院)
AI总结 本文提出Calibrated Attempt-Level (CAL) GRPO方法,通过校准每尝试的权重来提升多尝试链式推理的校准效果,实验证明其在合成和真实数据中优于传统GRPO和简单加权方法。
Comments 24 pages
OXtal:一种用于有机晶体结构预测的全原子扩散模型
机构 * University of Oxford(牛津大学) ; Synteny ; Google(谷歌) ; Mila ; Université de Montréal(蒙特利尔大学) ; Caltech(加州理工学院) ; NVIDIA(英伟达) ; Lila ; AITHYRA ; FutureHouse ; Imperial College London(伦敦帝国学院)
AI总结 OXtal通过全原子扩散模型直接学习分子构象与周期性排列的联合分布,利用数据增强策略提升效率,实现对晶体结构的高精度预测,显著优于传统方法。
SHRUG-FM:面向地球观测的可靠性感知基础模型
机构 * Universitat de València(瓦伦西亚大学) ; Wageningen University & Research(瓦赫宁根大学与研究所) ; Delft University of Technology(代尔夫特理工大学) ; European Space Agency(欧洲航天局) ; Heidelberg University(海德堡大学) ; Ghent University(根特大学) ; University of Oxford(牛津大学) ; Google Research(谷歌研究)
AI总结 本文提出SHRUG-FM框架,通过整合三种互补信号提升地球观测基础模型的可靠性,实验证明其在高风险任务中有效降低预测风险。
Comments Accepted for proceedings at CVPR EarthVision 2026
使零知识证明具备AI专用集成电路
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Google(谷歌)
AI总结 MORPH框架通过重新设计零知识证明内核,利用AI专用集成电路的矩阵吞吐量和能效,提升NTT和MSM的性能,实现10倍的吞吐量提升。
Comments Design Automation Conference 2026
CoAct:基于人机协同的LLM偏好学习
机构 * Northwestern University(西北大学) ; Google(谷歌) ; University of Southern California(南加州大学) ; University of Washington(华盛顿大学)
AI总结 本文提出CoAct框架,通过策略性的人机协作结合自奖励与主动学习,提升LLM在不同任务中的对齐效果,在三个推理基准测试中取得显著提升。
Comments ACL 2026
Privatar: 通过安全卸载实现可扩展的隐私保护多用户VR
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Massachusetts Institute of Technology(麻省理工学院) ; Google(谷歌) ; Purdue University/NVIDIA(普渡大学/NVIDIA) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AMD
AI总结 Privatar通过安全卸载实现多用户VR的可扩展隐私保护,利用领域知识在本地设备保留高能量频率组件,减少信息泄露,同时采用分布感知最小扰动技术提升隐私保障与效用。
Comments Proceedings of the 7th Machine Learning and System Conference (MLSys)
BEFT: 在低数据环境下高效优化语言模型的偏置项
机构 * Lund University(Lund 大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文研究了在低数据环境下优化语言模型偏置项(b_q, b_k, b_v)对下游任务性能的影响,发现直接优化b_v能显著提升性能。
用于行为克隆中组合泛化的自预测表示
机构 * Mila ; Université de Montréal(蒙特利尔大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出BYOL-γ方法,通过自预测表示近似后继表示,提升行为克隆在组合泛化任务中的泛化能力。
SeekerGym:一个评估可靠信息检索的基准
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Curation Labs ; Google DeepMind(谷歌DeepMind)
AI总结 SeekerGym旨在评估AI代理检索信息的完整性,通过文档检索任务测试代理对信息完整性的量化能力,实验显示现有模型在Wikipedia和ML调研论文上分别检索出42.5%和29.2%的段落,仍有改进空间。
GRAIL:自主概念 grounding 用于神经符号强化学习
机构 * Technical University of Darmstadt(达姆施塔特技术大学) ; Google Intrinsic(谷歌内在) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)
AI总结 GRAIL通过环境交互自主 grounding 关系概念,利用大语言模型提供弱监督,提升在稀疏奖励和概念对齐问题中的性能,实验显示其在Atari游戏中表现优异。
Comments Preprint
自回归推理的样本复杂性:链式推理与端到端
机构 * Purdue University(普渡大学) ; The Hebrew University(希伯来大学) ; Technion and Google Research(技术学院和谷歌研究)
AI总结 本文研究自回归系统的学习难度,发现端到端监督下样本复杂性随生成长度T变化丰富,而链式推理监督可使样本复杂性与T无关,从而消除对生成长度的依赖。
通过整合语言模型嵌入和图神经网络检测LLM生成的垃圾评论
机构 * Tsinghua University(清华大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出FraudSquad模型,结合预训练语言模型嵌入和门控图变压器,有效检测LLM生成的垃圾评论,实验表明其在精度和召回率上优于现有方法,且模型规模小,训练数据需求低。
通过AI反馈提升文本到视频生成中动态物体交互
机构 * Google DeepMind(谷歌DeepMind) ; The University of Tokyo(东京大学) ; Stanford University(斯坦福大学)
AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。
Comments Website: https://sites.google.com/view/aif-dynamic-t2v/