arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-01-27 至 2026-01-27 共收录 20
2601.18779 2026-01-27 cs.LG cs.AI cs.CL

POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration

POPE: 通过优先级在线探索学习解决难题

Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18733 2026-01-27 cs.RO cs.AI cs.CV

Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge

多智能体机器人系统(MARS)挑战的进展与创新

Li Kang, Heng Zhou, Xiufeng Song, Rui Li, Bruno N. Y. Chen, Ziye Wang, Ximeng Meng, Stone Tao, Yiran Qin, Xiaohong Liu, Ruimao Zhang, Lei Bai, Yilun Du, Hao Su, Philip Torr, Zhenfei Yin, Ruihao Gong, Yejun Zeng, Fengjun Zhong, Shenghao Jin, Jinyang Guo, Xianglong Liu, Xiaojun Jia, Tianqi Shan, Wenqi Ren, Simeng Qin, Jialing Yang, Xiaoyu Ma, Tianxing Chen, Zixuan Li, Zijian Cai, Yan Qin, Yusen Qin, Qiangyu Chen, Kaixuan Wang, Zhaoming Han, Yao Mu, Ping Luo, Yuanqi Yao, Haoming Song, Jan-Nico Zaech, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * SJTU(上海交通大学) Oxford(牛津大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) CMU(卡内基梅隆大学) HKU(香港大学) Tongji(同济大学) UC San Diego(南加州大学) CUHK-SZ(香港中文大学(深圳)) SYSU(华南理工大学) Harvard(哈佛大学)

AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。

Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18722 2026-01-27 cs.CL cs.LG

Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning

翻译中获益:特权成对评判增强多语言推理

Lintang Sutawika, Gokul Swamy, Zhiwei Steven Wu, Graham Neubig

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) Carnegie Mellon University, Software and Societal Systems Department(卡内基梅隆大学软件与社会系统系)

AI总结 SP3F通过自我扮演和特权成对反馈提升多语言推理能力,无需目标语言数据,有效提升模型在多语言任务中的表现。

Comments Code available at https://github.com/lintangsutawika/SP3F

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18513 2026-01-27 cs.LG

LipNeXt: Scaling up Lipschitz-based Certified Robustness to Billion-parameter Models

LipNeXt: 将基于Lipschitz的认证鲁棒性扩展到十亿参数模型

Kai Hu, Haoqi Hu, Matt Fredrikson

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 LipNeXt通过无约束和无卷积的1-Lipschitz架构,在大规模模型中实现高效的认证鲁棒性提升。

Comments ICLR 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18438 2026-01-27 cs.SD

UrgentMOS: Unified Multi-Metric and Preference Learning for Robust Speech Quality Assessment

UrgentMOS: 统一多指标和偏好学习用于鲁棒语音质量评估

Wei Wang, Wangyou Zhang, Chenda Li, Jiahe Wang, Samuele Cornell, Marvin Sach, Kohei Saijo, Yihui Fu, Zhaoheng Ni, Bing Han, Xun Gong, Mengxiao Bi, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Technische Universität Braunschweig(布拉unsch维格技术大学) Meta Waseda University(早稻田大学) VUI Labs(VUI实验室)

AI总结 UrgentMOS通过统一多指标和偏好学习,提升语音质量评估的鲁棒性和泛化能力,适用于多种语音质量评估场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15169 2026-01-27 cs.AI

SafeRBench: Dissecting the Reasoning Safety of Large Language Models

SafeRBench: 解析大语言模型推理安全性的本质

Xin Gao, Shaohan Yu, Zerui Chen, Yueming Lyu, Weichen Yu, Guanghao Li, Jiyao Liu, Jianxiong Gao, Jian Liang, Ziwei Liu, Chenyang Si

机构 * Nanjing University(南京大学) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Chinese Academy of Sciences(中国科学院) Nanyang Technological University(南洋理工大学)

AI总结 SafeRBench通过端到端评估方法解析大语言模型推理过程中的安全性问题,提出风险分层探测、微思维分析和10项细粒度指标,揭示大模型在增强安全性的同时可能增加可操作风险的悖论。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04768 2026-01-27 cs.LG cs.AR cs.PL

FuseFlow: A Fusion-Centric Compilation Framework for Sparse Deep Learning on Streaming Dataflow

FuseFlow:一种面向稀疏深度学习的流数据流编译框架

Rubens Lacouture, Nathan Zhang, Ritvik Sharma, Marco Siracusa, Fredrik Kjolstad, Kunle Olukotun, Olivia Hsu

机构 * Stanford University(斯坦福大学) SambaNova Systems, Inc.(SambaNova系统公司) Barcelona Supercomputing Center(巴塞罗那超级计算中心) Carnegie Mellon University(卡内基梅隆大学)

AI总结 FuseFlow是一种用于稀疏深度学习的编译框架,通过融合稀疏操作提升模型效率,展示了融合粒度对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04427 2026-01-27 cs.SE cs.AI

Speed at the Cost of Quality: How Cursor AI Increases Short-Term Velocity and Long-Term Complexity in Open-Source Projects

以质量为代价:Cursor AI如何在开源项目中提升短期速度和长期复杂性

Hao He, Courtney Miller, Shyam Agarwal, Christian Kästner, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究Cursor AI对开源项目开发速度和质量的影响,发现其短期提升速度但长期增加代码复杂性,指出质量保障是早期采用者的主要瓶颈。

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26), April 13--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17782 2026-01-27 cs.LG cs.AI

Shortcut Learning in Binary Classifier Black Boxes: Applications to Voice Anti-Spoofing and Biometrics

二分类黑箱中的快捷学习:应用于语音反伪装和生物识别

Md Sahidullah, Hye-jin Shim, Rosa Gonzalez Hautamäki, Tomi H. Kinnunen

机构 * TCG CREST Carnegie Mellon University(卡内基梅隆大学) School of Computing, University of Eastern Finland(东部芬兰大学计算机学院) University of Eastern Finland(东部芬兰大学) University of Oulu(奥卢大学)

AI总结 本文提出了一种分析二分类黑箱分类器的框架,通过实验验证了在语音反伪装和生物识别任务中减少数据偏见的有效性。

Comments Accepted for Publication in IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17510 2026-01-27 stat.ML cs.AI cs.LG

"Rebuilding" Statistics in the Age of AI: A Town Hall Discussion on Culture, Infrastructure, and Training

在人工智能时代重建统计学:关于文化、基础设施和培训的圆桌讨论

David L. Donoho, Jian Kang, Xihong Lin, Bhramar Mukherjee, Dan Nettleton, Rebecca Nugent, Abel Rodriguez, Eric P. Xing, Tian Zheng, Hongtu Zhu

机构 * Department of Statistics, Stanford University(斯坦福大学统计学系) Department of Biostatistics, University of Michigan, Ann Arbor(密歇根大学安娜堡分校生物统计学系) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院) Department of Statistics, Harvard University(哈佛大学统计学系) Broad Institute(Broad研究所) Yale School of Public Health(耶鲁大学公共卫生学院) Department of Statistics and Data Science, Yale University(耶鲁大学统计学与数据科学系) Department of Statistics, Iowa State University(爱荷华州立大学统计学系) Department of Statistics and Data Science, Carnegie Mellon University(卡内基梅隆大学统计学与数据科学系) Baskin School of Engineering, University of California, Santa Cruz(加州大学圣克鲁兹分校Baskin工程学院) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Statistics, Columbia University(哥伦比亚大学统计学系) Department of Biostatistics, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系)

AI总结 本文记录了2024年JSM圆桌讨论,探讨统计学在人工智能时代的发展,聚焦文化、基础设施和培训等关键问题。

Comments 35 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17376 2026-01-27 cs.LG cs.AI

Diversified Scaling Inference in Time Series Foundation Models

时间序列基础模型中的多样化缩放推理

Ruijin Hua, Zichuan Liu, Kun Zhang, Yiyuan Yang

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了时间序列基础模型中多样化缩放推理的影响,通过定制扰动扩展生成分布支持范围,并提出RobustMSE指标量化性能余量。

Comments 23 pages, 16 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16034 2026-01-27 cs.CL

Examining the Utility of Self-disclosure Types for Modeling Annotators of Social Norms

检验自我披露类型对建模社会规范注释者的作用

Kieran Henderson, Kian Omoomi, Vasudha Varadarajan, Allison Lahnala, Charles Welch

机构 * University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学) McMaster University(麦马斯特大学)

AI总结 本研究通过分析自我披露类型对社会规范注释者预测的影响,发现少量相关评论即可有效建模,并指出扩大样本多样性未必提升性能。

Comments Accepted EACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10046 2026-01-27 cs.AI

SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration

SimWorld-Robotics: 为多模态机器人导航与协作合成逼真动态城市环境

Yan Zhuang, Jiawei Ren, Xiaokang Ye, Jianzhi Shen, Ruixuan Zhang, Tianai Yue, Muhammad Faayez, Xuhong He, Ziqiao Ma, Lianhui Qin, Zhiting Hu, Tianmin Shu

机构 * University of Virginia(弗吉尼亚大学) UC San Diego(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学)

AI总结 SimWorld-Robotics通过合成逼真动态城市环境,提出两个多模态机器人基准测试,评估机器人在复杂场景中的导航、协作与通信能力。

Comments Conference: NeurIPS 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02567 2026-01-27 cs.AI cs.LG

Agentic Additive Manufacturing Alloy Evaluation

代理式增材制造合金评估

Peter Pak, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

AI总结 本文提出利用LLM赋能的多代理系统,自动化加速增材制造合金的评估,通过智能工具调用实现热物理性质计算和工艺窗口分析。

Journal ref Additive Manufacturing Letters, Vol. 17, January 2026, Article 100355

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23525 2026-01-27 cs.HC cs.AI

Privy: Envisioning and Mitigating Privacy Risks for Consumer-facing AI Product Concepts

Privy:面向消费者的人工智能产品概念中的隐私风险展望与缓解

Hao-Ping Lee, Yu-Ju Yang, Matthew Bilik, Isadora Krsek, Thomas Serban von Davier, Kyzyl Monteiro, Jason Lin, Shivani Agarwal, Jodi Forlizzi, Sauvik Das

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学)

AI总结 Privy通过结构化隐私影响评估帮助无隐私专业知识的从业者识别和缓解人工智能产品概念中的隐私风险,其基于大语言模型的版本效果更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21679 2026-01-27 cs.CL cs.CY

JiraiBench: A Bilingual Benchmark for Evaluating Large Language Models' Detection of Human Self-Destructive Behavior Content in Jirai Community

JiraiBench:一个双语基准,用于评估大型语言模型在Jirai社区中检测人类自毁行为内容的效果

Yunze Xiao, Tingyu He, Lionel Z. Wang, Yiming Ma, Xingyu Song, Xiaohang Xu, Mona Diab, Irene Li, Ka Chung Ng

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) The University of Tokyo(东京大学)

AI总结 JiraiBench通过双语评估揭示文化接近性在检测自毁内容中的重要性,展示跨语言知识迁移的潜力。

Comments 20 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09765 2026-01-27 cs.CL cs.AI

Enhancing the De-identification of Personally Identifiable Information in Educational Data

提升教育数据中个人可识别信息的脱敏

Zilyu Ji, Yuntian Shen, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 本文提出使用微调后的GPT-4o-mini模型高效检测教育数据中的PII,实现高召回率和低计算成本,为隐私保护提供新的解决方案。

Journal ref Journal of Educational Data Mining 17(2) (2025) 55-85

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16132 2026-01-27 eess.AS cs.MM cs.SD

SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge

SVDD 2024:首届歌唱声音深度伪造检测挑战

You Zhang, Yongyi Zang, Jiatong Shi, Ryuichi Yamamoto, Tomoki Toda, Zhiyao Duan

机构 * University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Nagoya University(名古屋大学)

AI总结 SVDD 2024挑战通过两个赛道推动AI生成歌唱声音的检测研究,评估了多种方法在受控和真实场景下的性能。

Comments 6 pages, Accepted by 2024 IEEE Spoken Language Technology Workshop (SLT 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17085 2026-01-27 eess.AS cs.LG cs.SD

Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration

通过多层融合和语义特征整合从离散令牌中恢复语音情感识别性能

Esther Sun, Abinay Reddy Naini, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)

AI总结 本文通过多层融合和语义特征整合方法,解决离散语音令牌在语音情感识别中的性能损失问题,提升其与连续表示的性能一致性。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏