arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2025-12-02 至 2025-12-02 共收录 12
2512.01989 2025-12-02 cs.CV

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01108 2025-12-02 cs.RO

Think Fast: Real-Time Kinodynamic Belief-Space Planning for Projectile Interception

快速思考:用于弹药拦截的实时动力学信念空间规划

Gabriel Olin, Lu Chen, Nayesha Gandotra, Maxim Likhachev, Howie Choset

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种实时动力学信念空间规划方法,用于快速移动目标的拦截,采用树状结构和自适应卡尔曼滤波器实现高效目标追踪和实时更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01061 2025-12-02 cs.RO cs.CV

Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

为人类oid像素到动作策略转移打开仿真到现实的大门

Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) CUHK(香港中文大学)

AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。

Comments https://doorman-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00748 2025-12-02 cs.CV cs.AI

Probabilistic Modeling of Multi-rater Medical Image Segmentation for Diversity and Personalization

多评分者医学图像分割的概率建模用于多样性和个性化

Ke Liu, Shangde Gao, Yichao Fu, Shangqi Gao, Chunhua Shen

机构 * Zhejiang University(浙江大学) University of Cambridge(剑桥大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ProSeg通过概率建模实现医学图像分割的多样化和个性化,结合专家偏好和边界模糊性,提升分割结果的多样性和个性化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00742 2025-12-02 cs.CY cs.AI

On the Regulatory Potential of User Interfaces for AI Agent Governance

关于用户界面在AI代理治理中的调节潜力

K. J. Kevin Feng, Tae Soo Kim, Rock Yuren Pang, Faria Huq, Tal August, Amy X. Zhang

机构 * University of Washington(华盛顿大学) KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出通过调节AI代理的用户界面来增强透明性和行为规范,从而在系统和基础设施层面实现治理。

Comments RegML workshop at NeurIPS 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00736 2025-12-02 cs.LG cs.AI cs.CV

REM: Evaluating LLM Embodied Spatial Reasoning through Multi-Frame Trajectories

REM:通过多帧轨迹评估大语言模型的具身空间推理

Jacob Thompson, Emiliano Garcia-Lopez, Yonatan Bisk

机构 * Department of Computer Science(计算机科学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 REM通过多帧轨迹评估大语言模型的空间推理能力,揭示其在复杂空间任务中的不足,推动更 robust 的空间表示研究。

Journal ref Proceedings of the Conference on Language Modeling (COLM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04988 2025-12-02 cs.CV

Modeling Rapid Contextual Learning in the Visual Cortex with Fast-Weight Deep Autoencoder Networks

利用快速权重深度自编码器网络建模视觉皮层中的快速上下文学习

Yue Li, Weifan Wang, Tai Sing Lee

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究利用基于ViT的自编码器探讨熟悉训练如何在深度神经网络早期层中诱导对全局上下文的敏感性,通过快速权重机制实现快速学习,并验证LoRA在增强快速权重效果中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18449 2025-12-02 cs.SE cs.AI cs.CL

SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

SWE-RL:通过强化学习提升大语言模型推理能力

Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, Sida I. Wang

机构 * Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SWE-RL通过强化学习提升大语言模型在软件工程领域的推理能力,实现了41.0%的解决率,超越了现有中等规模LLM的性能。

Comments Accepted to NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00557 2025-12-02 cs.CV cs.AI cs.LG

Blind Inverse Problem Solving Made Easy by Text-to-Image Latent Diffusion

通过文本到图像潜在扩散模型简化盲逆问题求解

Michail Dontas, Yutong He, Naoki Murata, Yuki Mitsufuji, J. Zico Kolter, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) Bosch Center for AI(博世人工智能中心)

AI总结 LADiBI通过文本到图像潜在扩散模型无需训练解决多种盲逆问题,利用贝叶斯框架和新型后验采样算法实现灵活且高效的图像恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01558 2025-12-02 cs.LG cs.CL

Predicting the Performance of Black-box LLMs through Follow-up Queries

通过后续查询预测黑盒大语言模型的性能

Dylan Sam, Marc Finzi, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏