PAI-Bench: A Comprehensive Benchmark For Physical AI
PAI-Bench: 一个全面的物理AI基准
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学)
AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。
高校专区
PAI-Bench: 一个全面的物理AI基准
机构 * Georgia Tech(佐治亚理工学院) ; CMU(卡内基梅隆大学)
AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。
快速思考:用于弹药拦截的实时动力学信念空间规划
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出了一种实时动力学信念空间规划方法,用于快速移动目标的拦截,采用树状结构和自适应卡尔曼滤波器实现高效目标追踪和实时更新。
为人类oid像素到动作策略转移打开仿真到现实的大门
机构 * NVIDIA ; UC Berkeley(加州大学伯克利分校) ; CMU(卡内基梅隆大学) ; CUHK(香港中文大学)
AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。
Comments https://doorman-humanoid.github.io/
多评分者医学图像分割的概率建模用于多样性和个性化
机构 * Zhejiang University(浙江大学) ; University of Cambridge(剑桥大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 ProSeg通过概率建模实现医学图像分割的多样化和个性化,结合专家偏好和边界模糊性,提升分割结果的多样性和个性化水平。
关于用户界面在AI代理治理中的调节潜力
机构 * University of Washington(华盛顿大学) ; KAIST(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学) ; UIUC(伊利诺伊大学香槟分校)
AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。
Comments RegML workshop at NeurIPS 2025 (oral)
REM:通过多帧轨迹评估大语言模型的具身空间推理
机构 * Department of Computer Science(计算机科学系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。
Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)
利用快速权重深度自编码器网络建模视觉皮层中的快速上下文学习
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究利用基于ViT的自编码器探讨熟悉训练如何在深度神经网络早期层中诱导对全局上下文的敏感性,通过快速权重机制实现快速学习,并验证LoRA在增强快速权重效果中的作用。
SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商
机构 * Kyoto University(京都大学) ; NVIDIA ; Carnegie Mellon University(卡内基梅隆大学) ; Institute of Science Tokyo(东京科学研究院)
AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。
Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ
检查表比奖励模型更能对齐语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。
Comments Presented at NeurIPS 2025
SWE-RL:通过强化学习提升大语言模型推理能力
机构 * Meta AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 SWE-RL通过强化学习提升大语言模型在软件工程领域的推理能力,实现了41.0%的解决率,超越了现有中等规模LLM的性能。
Comments Accepted to NeurIPS 2025 Main Track
通过文本到图像潜在扩散模型简化盲逆问题求解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团) ; Bosch Center for AI(博世人工智能中心)
AI总结 LADiBI通过文本到图像潜在扩散模型无需训练解决多种盲逆问题,利用贝叶斯框架和新型后验采样算法实现灵活且高效的图像恢复。
通过后续查询预测黑盒大语言模型的性能
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。
Comments NeurIPS 2025