POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration
POPE: 通过优先级在线探索学习解决难题
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。
高校专区
POPE: 通过优先级在线探索学习解决难题
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。
多智能体机器人系统(MARS)挑战的进展与创新
机构 * SJTU(上海交通大学) ; Oxford(牛津大学) ; USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; CMU(卡内基梅隆大学) ; HKU(香港大学) ; Tongji(同济大学) ; UC San Diego(南加州大学) ; CUHK-SZ(香港中文大学(深圳)) ; SYSU(华南理工大学) ; Harvard(哈佛大学)
AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。
Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/
翻译中获益:特权成对评判增强多语言推理
机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所) ; Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) ; Carnegie Mellon University, Software and Societal Systems Department(卡内基梅隆大学软件与社会系统系)
AI总结 SP3F通过自我扮演和特权成对反馈提升多语言推理能力,无需目标语言数据,有效提升模型在多语言任务中的表现。
Comments Code available at https://github.com/lintangsutawika/SP3F
LipNeXt: 将基于Lipschitz的认证鲁棒性扩展到十亿参数模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 LipNeXt通过无约束和无卷积的1-Lipschitz架构,在大规模模型中实现高效的认证鲁棒性提升。
Comments ICLR 2026. 17 pages
UrgentMOS: 统一多指标和偏好学习用于鲁棒语音质量评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Technische Universität Braunschweig(布拉unsch维格技术大学) ; Meta ; Waseda University(早稻田大学) ; VUI Labs(VUI实验室)
AI总结 UrgentMOS通过统一多指标和偏好学习,提升语音质量评估的鲁棒性和泛化能力,适用于多种语音质量评估场景。
SafeRBench: 解析大语言模型推理安全性的本质
机构 * Nanjing University(南京大学) ; Fudan University(复旦大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Chinese Academy of Sciences(中国科学院) ; Nanyang Technological University(南洋理工大学)
AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。
Comments 29 pages, 8 figures
FuseFlow:一种面向稀疏深度学习的流数据流编译框架
机构 * Stanford University(斯坦福大学) ; SambaNova Systems, Inc.(SambaNova系统公司) ; Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 FuseFlow是一种用于稀疏深度学习的编译框架,通过融合稀疏操作提升模型效率,展示了融合粒度对模型性能的影响。
以质量为代价:Cursor AI如何在开源项目中提升短期速度和长期复杂性
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究Cursor AI对开源项目开发速度和质量的影响,发现其短期提升速度但长期增加代码复杂性,指出质量保障是早期采用者的主要瓶颈。
Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13--14, 2026, Rio de Janeiro, Brazil
MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理
机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院) ; CMU(卡内基梅隆大学) ; Rutgers University(罗格斯大学) ; Yale University(耶鲁大学)
AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。
Comments ICLR 2026
二分类黑箱中的快捷学习:应用于语音反伪装和生物识别
机构 * TCG CREST ; Carnegie Mellon University(卡内基梅隆大学) ; School of Computing, University of Eastern Finland(东部芬兰大学计算机学院) ; University of Eastern Finland(东部芬兰大学) ; University of Oulu(奥卢大学)
AI总结 本文提出了一种分析二分类黑箱分类器的框架,通过实验验证了在语音反伪装和生物识别任务中减少数据偏见的有效性。
Comments Accepted for Publication in IEEE Journal of Selected Topics in Signal Processing
在人工智能时代重建统计学:关于文化、基础设施和培训的圆桌讨论
机构 * Department of Statistics, Stanford University(斯坦福大学统计学系) ; Department of Biostatistics, University of Michigan, Ann Arbor(密歇根大学安娜堡分校生物统计学系) ; Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院) ; Department of Statistics, Harvard University(哈佛大学统计学系) ; Broad Institute(Broad研究所) ; Yale School of Public Health(耶鲁大学公共卫生学院) ; Department of Statistics and Data Science, Yale University(耶鲁大学统计学与数据科学系) ; Department of Statistics, Iowa State University(爱荷华州立大学统计学系) ; Department of Statistics and Data Science, Carnegie Mellon University(卡内基梅隆大学统计学与数据科学系) ; Baskin School of Engineering, University of California, Santa Cruz(加州大学圣克鲁兹分校Baskin工程学院) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Department of Statistics, Columbia University(哥伦比亚大学统计学系) ; Department of Biostatistics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系)
AI总结 本文记录了2024年JSM圆桌讨论,探讨统计学在人工智能时代的发展,聚焦文化、基础设施和培训等关键问题。
Comments 35 pages, 3 figures,
时间序列基础模型中的多样化缩放推理
机构 * University of Oxford(牛津大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究了时间序列基础模型中多样化缩放推理的影响,通过定制扰动扩展生成分布支持范围,并提出RobustMSE指标量化性能余量。
Comments 23 pages, 16 figures, 9 tables
检验自我披露类型对建模社会规范注释者的作用
机构 * University of Toronto(多伦多大学) ; Carnegie Mellon University(卡内基梅隆大学) ; McMaster University(麦马斯特大学)
AI总结 本研究通过分析自我披露类型对社会规范注释者预测的影响,发现少量相关评论即可有效建模,并指出扩大样本多样性未必提升性能。
Comments Accepted EACL Findings
SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境
机构 * University of Virginia(弗吉尼亚大学) ; UC San Diego(加州大学圣地亚哥分校) ; Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学)
AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。
Comments Conference: NeurIPS 2025 (main)
代理式增材制造合金评估
机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)
AI总结 本文提出利用LLM赋能的多代理系统,自动化加速增材制造合金的评估,通过智能工具调用实现热物理性质计算和工艺窗口分析。
Journal ref Additive Manufacturing Letters, Vol. 17, January 2026, Article 100355
Privy:面向消费者的人工智能产品概念中的隐私风险展望与缓解
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学)
AI总结 Privy通过结构化隐私影响评估帮助无隐私专业知识的从业者识别和缓解人工智能产品概念中的隐私风险,其基于大语言模型的版本效果更佳。
JiraiBench:一个双语基准,用于评估大型语言模型在Jirai社区中检测人类自毁行为内容的效果
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Tokyo(东京大学)
AI总结 JiraiBench通过双语评估揭示文化接近性在检测自毁内容中的重要性,展示跨语言知识迁移的潜力。
Comments 20 pages, 1 figures
提升教育数据中个人可识别信息的脱敏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
AI总结 本文提出使用微调后的GPT-4o-mini模型高效检测教育数据中的PII,实现高召回率和低计算成本,为隐私保护提供新的解决方案。
Journal ref Journal of Educational Data Mining 17(2) (2025) 55-85
SVDD 2024:首届歌唱声音深度伪造检测挑战
机构 * University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Nagoya University(名古屋大学)
AI总结 SVDD 2024挑战通过两个赛道推动AI生成歌唱声音的检测研究,评估了多种方法在受控和真实场景下的性能。
Comments 6 pages, Accepted by 2024 IEEE Spoken Language Technology Workshop (SLT 2024)
通过多层融合和语义特征整合从离散令牌中恢复语音情感识别性能
机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)
AI总结 本文通过多层融合和语义特征整合方法,解决离散语音令牌在语音情感识别中的性能损失问题,提升其与连续表示的性能一致性。
Comments Accepted to ICASSP 2026