Hardware Mechanisms to Dynamically Throttle AI Performance
动态限制人工智能性能的硬件机制
机构 * Princeton University(普林斯顿大学) ; Princeton University Electrical(普林斯顿大学电子与计算机工程)
AI总结 研究在人工智能模型集成到关键系统时缺乏意图控制的问题,提出用微架构旋钮动态控制硬件资源限制AI性能,评估候选旋钮并构建机制,展示其高性能敏感度等优势及多旋钮组合效果。
高校专区
动态限制人工智能性能的硬件机制
机构 * Princeton University(普林斯顿大学) ; Princeton University Electrical(普林斯顿大学电子与计算机工程)
AI总结 研究在人工智能模型集成到关键系统时缺乏意图控制的问题,提出用微架构旋钮动态控制硬件资源限制AI性能,评估候选旋钮并构建机制,展示其高性能敏感度等优势及多旋钮组合效果。
SportD:视觉语言模型能进行物理策略制定吗?
机构 * Princeton University(普林斯顿大学) ; Rice University(莱斯大学) ; UC Irvine(加州大学欧文分校) ; POSTECH(浦项科技大学) ; NYU Shanghai(纽约大学上海分校) ; UC Santa Barbara(加州大学圣塔芭芭拉分校) ; Zhejiang University(浙江大学)
AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。
通过在线学习预处理器实现瞬态偏微分方程求解器的一次性加速
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Seoul National University(首尔国立大学) ; Princeton University(普林斯顿大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究针对瞬态偏微分方程数值模拟,提出用强盗算法利用线性求解器反馈在线学习预处理器配置的PCGBandit方法,直接在OpenFOAM上实现,可一次性加速模拟,在流体和MHD问题上验证了有效性。
Comments code available at https://github.com/mkhodak/PCGBandit
Journal ref Computer Physics Communications 327 (2026) 110304
用于教育评估中可扩展自动作文评分的成本效益高的生成式人工智能摘要
机构 * Princeton University(普林斯顿大学)
AI总结 研究针对自动作文评分受输入长度限制问题,提出用生成式人工智能辅助摘要框架,用GPT-5变体生成摘要作输入,结合手工语言特征形成混合框架,评估其在评分等方面表现,揭示相关权衡,为AES提供初步评估及基线等。
Comments 23 pages, 7 figures, 5 tables
T^2MLR:具有时间中层循环的Transformer
机构 * Princeton University(普林斯顿大学)
AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。
交错噪声注入提高干净、受损和分布外数据的性能
机构 * Princeton University(普林斯顿大学)
AI总结 研究探索交错噪声注入在优化中的效果,通过理论分析揭示其作用机制,引入梯度范数稳定技术,与其他方法比较发现能显著提升在CIFAR-100-C等数据集上的抗噪及分布外数据性能,是提升测试性能的有效工具。
Comments 24 pages, 11 figures
利用大语言模型学习化学反应的机理推理
机构 * Princeton University(普林斯顿大学) ; University of Pittsburgh(匹兹堡大学) ; Northeastern University(东北大学) ; University of Florida(佛罗里达大学)
AI总结 研究利用大语言模型学习化学反应机理推理,构建大规模推理数据集及福山基准,通过机理感知训练微调Qwen3 - 30B - A3B,在福山基准集A上精确路径匹配超FlowER模型,增强了语言模型的化学推理能力。
DeepLoop:循环变换器的深度缩放
机构 * Princeton University(普林斯顿大学) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。
Comments 25 pages
基于表示的语言模型探索:从测试时到训练后
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。
Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io
大语言模型中置信度的计算基础
机构 * Google DeepMind(谷歌深度思维) ; École Polytechnique(巴黎综合理工学院) ; Princeton University(普林斯顿大学)
AI总结 研究大语言模型中置信度的计算基础,利用统计决策置信度框架,通过答案 - 对数差异测试其预测特征,结果表明在多种任务中答案对数可作潜在决策变量读出,为多模态语言模型置信度提供解释并统一研究框架。
得分哈密顿量:将扩散模型映射到绝热输运
机构 * Computer Science Department, Princeton University(普林斯顿大学计算机科学系) ; ORFE Department, Princeton University(普林斯顿大学ORFE系)
AI总结 本文通过构建得分哈密顿量,建立了基于得分的扩散模型采样与薛定谔算子基态绝热输运之间的精确对应关系,并利用绝热定理推导了密度重建误差界和退火调度方案。
Comments 26 pages, 10 figures. v3: Expanded supplementary discussion in appendix of application to various score-based parameterizations. Main results and main text unchanged
首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型
机构 * Princeton University(普林斯顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; Chinese Academy of Sciences(中国科学院) ; Columbia University(哥伦比亚大学) ; Beijing Normal University(北京师范大学) ; Tsinghua University(清华大学) ; University of California San Diego(加利福尼亚大学圣地亚哥分校) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。
Comments 8 pages, 4 tables; work in progress
SFO:通过谱滤波学习偏微分方程算子
机构 * Technion - Israel Institute of Technology(技术离子-以色列理工学院) ; Princeton University(普林斯顿大学)
AI总结 研究如何让神经算子有效捕捉偏微分方程解映射中的长程非局部相互作用,提出谱滤波算子SFO,利用通用谱基参数化积分核,通过学习快速衰减特征值的谱系数实现高效表示,在六个基准测试中达最优精度,大幅降误差并减少参数。
人们使用快速且扁平的模拟来对新游戏进行推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Princeton University(普林斯顿大学) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 研究人们对新游戏的推理,通过超千名参与者和121种新棋盘游戏的研究,发现人们玩新游戏或评估时具系统性和适应性理性,用“直观玩家”模型解释,为新问题应对及类人AI系统设计提供见解。
基于强化学习的目标导航方法中什么重要?实证研究与统一框架
机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) ; Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) ; Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) ; Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) ; Microsoft, Switzerland(微软公司)
AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。
幂律的力量:不对称性使组合推理成为可能
机构 * Princeton University(普林斯顿大学) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文研究了幂律分布对组合推理任务的影响,发现其在状态跟踪和多步算术等任务中优于均匀分布,通过理论分析揭示了幂律分布通过引入有益的不对称性,使模型能更高效地学习长尾技能。
我们真的能学习一种表示来优化所有奖励吗?
机构 * Princeton University(普林斯顿大学)
AI总结 研究无监督预训练中通过交互的无监督学习,聚焦前向 - 后向表示学习。通过理论分析阐明其表示存在条件及收敛情况,提出更易理解和优化的变体。实验表明该变体误差更小、零样本性能提升,还能为下游任务提供有效初始化。
回答之前先解释:组合视觉推理综述
机构 * Monash University(墨尔本大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Griffith University(格里菲斯大学) ; Princeton University(普林斯顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。
Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey
关于具有对称散度的图拉普拉斯算子的收敛性
机构 * Program in Applied and Computational Mathematics, Princeton University(应用与计算数学项目,普林斯顿大学)
AI总结 研究在特定黎曼子流形上,基于满足条件的对称散度$D$构造图拉普拉斯算子,证明其逐点收敛性,并给出$D$由Sinkhorn散度给出的例子。
Comments 51 pages, 10 figures
EgoPolice:用于高风险警察随身摄像机视频中自我中心视频理解的基准
机构 * Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 研究旨在为高风险警察随身摄像机视频中的自我中心视频理解创建基准EgoPolice,通过精心挑选标注数据,设置分类和问答任务,对模型测试发现即使优秀模型预测高风险行动也有困难,该基准为开发相关模型及下游人工审查奠定基础。
大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变
机构 * Princeton University(普林斯顿大学)
AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。
BabyVision:超越语言的视觉推理
机构 * UniPat AI ; xbench ; Alibaba Group(阿里巴巴集团) ; MoonShot AI ; StepFun ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Princeton University(普林斯顿大学) ; Nanyang Technological University(南洋理工大学) ; G Labs Equal Core Contributors(0G Labs 等核心贡献者)
AI总结 研究发现当代多模态语言模型依赖语言先验,在基本视觉任务上表现差。为此引入BabyVision基准评估其核心视觉能力,涵盖多任务。结果显示模型缺乏基本视觉原语,BabyVision的进展迈向人类水平视觉能力,还探索了用生成模型解决视觉推理的方法。
Comments 26 pages, Homepage at https://unipat.ai/blog/BabyVision
模型参数中的不可检测后门:在高维空间中隐藏稀疏秘密
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Princeton University(普林斯顿大学)
AI总结 提出Sparse Backdoor供应链攻击,通过注入带高斯抖动的结构化稀疏扰动在预训练图像分类器中植入可证不可检测后门,其检测难度等价于Sparse PCA,可抵御白盒区分。
InFlux++:用于估计动态相机内参的真实与合成数据
机构 * Princeton University(普林斯顿大学)
AI总结 针对动态相机内参估计的训练数据匮乏、评测基准多样性不足问题,构建含大规模合成数据集与真实基准的InFlux++,可提升RGB图像的逐帧内参估计性能。
Comments Accepted to ECCV 2026
重新思考思维模型的在线策略自蒸馏
机构 * Princeton University(普林斯顿大学) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室)
AI总结 针对思维模型自蒸馏性能退化问题,研究发现特权上下文在线策略蒸馏会降低长推理轨迹性能,揭示其作用机制,为强思维模型自蒸馏优化提供方向。
图神经网络中的超参数转移
机构 * Department of Operations Research and Financial Engineering(运营研究与金融工程系) ; School of Engineering and Applied Science(工程与应用科学学院) ; Princeton University(普林斯顿大学)
AI总结 研究图神经网络超参数转移,开发并验证适用于多种优化器的转移参数化,通过理论分析和实验表明其能实现稳定特征更新、学习率转移及性能提升,为不同任务和场景缩放图神经网络提供实用方法。
评估语言相关性对大型多语言自动语音识别中跨语言迁移的影响
机构 * Princeton University(普林斯顿大学) ; Maseno University(马塞诺大学)
AI总结 研究在大型多语言自动语音识别中,通过系统实验设计,探讨语言相关性能否可靠预测跨语言迁移增益,发现仅语言相关性难以有效促进跨语言迁移。
RoboVista:评估用于各种机器人应用的视觉语言模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; Google DeepMind(谷歌深度思维)
AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。
Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/
一种内存高效的线性动力系统在线学习统一算法
机构 * Tel Aviv University(特拉维夫大学) ; Princeton University(普林斯顿大学)
AI总结 针对低不稳定性复杂度的线性动力系统,提出一种在线预测算法,参数复杂度为Õ(k),实现亚线性遗憾,内存适应内在复杂度而非全状态维度。
Comments 34 pages, 1 figure
MLS-Bench:对构建更好AI的AI系统的全面且严格评估
机构 * UC Berkeley(伯克利大学) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学) ; University of Washington(华盛顿大学) ; Purdue University(Purdue 大学) ; Harvard University(哈佛大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Shanghai Jiao Tong University(上海交通大学) ; UC San Diego(圣地亚哥大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。