arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2608.16041 2026-08-18 cs.RO 新提交

ScenarioCharacterization: A Modular Toolkit for Characterizing Safety across Trajectory Datasets

ScenarioCharacterization:用于刻画轨迹数据集安全性的模块化工具包

Ingrid Navarro, Yutong Duan, Jonathan Francis, Jean Oh

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院机器人研究所) Stack AV Bosch Center for Artificial Intelligence(博世人工智能中心)

AI总结 本文提出开源模块化框架ScenarioCharacterization,可自动刻画轨迹数据集的驾驶场景安全性,适配多数据集,在Waymo等数据集上验证,支持下游应用。

Comments 9 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15861 2026-08-18 cs.LG 新提交

TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition

TransfHAR:用于按需活动识别的自监督手腕表征

Aidan Bradshaw, Riku Arakawa, Xin Liu, Karan Ahuja

机构 * Northwestern University(西北大学) Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

AI总结 TransfHAR是一种自监督手腕IMU框架,可通过学习粗粒度运动先验实现按需细粒度活动识别,在跨数据集评估及用户研究中均优于或匹配全监督基线,为该领域提供了有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14566 2026-08-18 cs.AI 新提交

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

立场:AI道德推理的评估仍遗漏了一半关键内容

Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

机构 * University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) Hugging Face

AI总结 该研究指出现有LLM道德推理评估聚焦道德价值问题而忽视规范问题,识别出三大缺口并提出含规范表征、标注数据集及分层评估的研究议程,以推动规范推理的系统研究。

Comments 8 pages, 1 figure. Accepted for archival publication at the ACL 2026 Workshop on Evaluating Evaluations (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13015 2026-08-18 cs.RO 版本更新

Learning Versatile Humanoid Manipulation with Touch Dreaming

通过触觉梦想学习多功能人形操作

Yaru Niu, Zhenlong Fang, Binghong Chen, Shuai Zhou, Revanth Krishna Senthilkumaran, Hao Zhang, Bingqing Chen, Chen Qiu, H. Eric Tseng, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) UT Arlington(UT阿灵顿) Bosch Center for AI(博世人工智能中心)

AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27959 2026-08-18 cs.CV 版本更新

MathGen: Revealing the Illusion of Mathematical Competence through Text-to-Image Generation

MathGen:通过文本到图像生成揭示数学能力的幻觉

Ruiyao Liu, Hui Shen, Ping Zhang, Yunta Hsieh, Yifan Zhang, Jing Xu, Qi Han, Junchen Li, Jiawei Lu, Jianing Ma, Jiaqi Mo, Sicheng Chen, Zhen Zhang, Zhongwei Wan, Jing Xiong, Xin Wang, Ziyuan Liu, Hangrui Cao, Ngai Wong

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) USTC(中国科学技术大学) City University of Hong Kong(香港城市大学) University of Wisconsin(威斯康星大学) UCSB(加州大学圣塔芭芭拉分校) University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 MathGen通过900道跨七个核心领域的数学问题,评估生成模型在视觉化数学解答中的准确性,发现现有模型在数学 fidelity 上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11535 2026-08-18 cs.LG cs.HC math.OC 版本更新

Balancing Optimality and Diversity: Human-Centered Decision Making through Generative Curation

平衡最优性与多样性:通过生成式策展实现以人为中心的决策

Michael Lingzhi Li, Shixiang Zhu

机构 * Technology and Operations Management, Harvard Business School(哈佛商学院技术与运营管理系) Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因兹学院)

AI总结 该研究提出生成式策展框架,通过分解组合合意度、开发适配多行动空间的方法,在决策支持场景下大幅降低遗憾值,适用于警区重划等复杂运营规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19952 2026-08-18 math.ST cs.LG stat.ML stat.TH 版本更新

On Stopping Times of Power-one Sequential Tests: Tight Lower and Upper Bounds

Shubhada Agrawal, Ashwin Ram, Aaditya Ramdas

机构 * Indian Institute of Science(印度科学研究所) Carnegie Mellon University(卡内基梅隆大学)

Comments 57 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31722 2026-08-17 cs.CL 版本更新

Adapting Foundation ASR Models to Dysarthric Speech: A Case Study

将基础ASR模型适应于构音障碍语音:案例研究

Christian Huber, Laura Kernahan, Alexander Waibel

机构 * Interactive Systems Lab(交互系统实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 通过个性化微调基础ASR模型,针对构音障碍语音将词错误率降至9.7%,验证了适应方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06452 2026-08-17 cs.CL 版本更新

Learning to Interrupt in Language-based Multi-agent Communication

语言基多智能体通信中的中断学习

Danqing Wang, Da Yin, Ruta Desai, Lei Li, Asli Celikyilmaz, Ansong Ni

机构 * CMU(卡内基梅隆大学) Meta FAIR

AI总结 本文提出一种可中断的通信框架,通过学习预测合适的中断点,减少通信成本,提升多智能体任务性能。

Comments Accepted in CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13805 2026-08-17 cs.CY cs.CL 版本更新

Investigating individual writing style as a contributor to gender gaps in science and technology

探究个人写作风格对科技领域性别差距的影响

Kara Kedrick, Ekaterina Levitskaya, Russell J. Funk

机构 * Carnegie Mellon University(卡内基梅隆大学) Coleridge Initiative(科尔里奇倡议) University of Minnesota(明尼苏达大学)

AI总结 该研究发现科技领域女性写作风格比男性更具参与性,这种性别化的写作风格差异会影响论文的引用情况,揭示了评价偏见持续存在的微妙渠道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13212 2026-08-14 cs.LG cs.SI 新提交

TANGCO: Learning Topology-Aware Capacity Allocation for Overload-driven Cascading Failures

TANGCO:学习应对过载驱动级联故障的拓扑感知容量分配

Orkun Irsoy, Leman Akoglu, Osman Yagan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 TANGCO是一种拓扑感知神经图引导的容量优化模型,可应对过载驱动的级联故障,在人工与真实网络上均优于手动启发式方法,具备良好迁移性,部署成本低且训练效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12321 2026-08-14 cs.CL cs.AI 新提交

LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning

大型语言模型(LLMs)知道约束但不使用它:语用约束推理中的激活瓶颈

Yubo Li, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究揭示LLMs虽编码了语用约束知识,但存在激活传递瓶颈,导致约束推理失败,激活修补可部分修复,且缓解干预未解决该传递问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11143 2026-08-14 cs.RO 版本更新

APEX: Learning Adaptive High-Platform Traversal for Humanoid Robots

APEX: 为双足机器人学习适应性高平台穿越

Yikai Wang, Tingxuan Leng, Changyi Lin, Shiqi Liu, Shir Simon, Bingqing Chen, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

AI总结 APEX通过感知和攀爬行为实现双足机器人高平台穿越,结合地形适应和安全正则化,实现高效探索与稳健适应。

Comments Project Website: https://apex-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15076 2026-08-14 cs.LG cs.DM cs.DS 版本更新

Online Correlation Clustering: Simultaneously Optimizing All $\ell_p$-norms

Sami Davies, Benjamin Moseley, Heather Newman

机构 * Department of EECS at UC Berkeley(伯克利大学电子工程与计算机科学系) RelationalAI Tepper School of Business, Carnegie Mellon University(卡内基梅隆大学泰珀商学院) Carnegie Mellon University(卡内基梅隆大学) Department of Computer Science, Vassar College(瓦萨学院计算机科学系)

Comments 67 pages, appeared in ICALP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12269 2026-08-13 cs.CL 新提交

A Cascaded Unsupervised-Supervised NLP Pipeline for Detecting Accusatory Language in Public Procurement

一种用于检测公共采购中指控性语言的级联无监督-监督NLP流水线

Bryan Torres, Daniel Riofrío, José Vega-Sánchez, Nathaly Orozco, Carla Parra, Karen Rosero, Felipe Grijalva

机构 * Universidad San Francisco de Quito(基多圣弗朗西斯科大学) Universidad de Las Américas(美洲大学) Escuela Politécnica Nacional(国家理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对公共采购中指控性语言检测问题,提出级联无监督-监督NLP流水线,结合Word2Vec、GMM和随机森林模型,可在类别不平衡下高效识别违规风险,提升采购透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11528 2026-08-13 cs.CL 新提交

Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment

群体对齐诱导的谄媚性:可引导的多元对齐的双向评估

Haokai Zhao, Yunze Xiao, Weihao Xuan, Flora Salim, Benjamin Tag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学) Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

AI总结 该研究提出GAS指标,评估3种方法、4个模型在13个人口统计群体上的对齐效果,发现群体对齐的观点收益和谄媚性变化存在群体异质性,建议采用双向多维度报告方式。

Comments 9 pages main text, 23 pages in total, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11519 2026-08-13 cs.LG 新提交

FLARE++: Low-rank attention with dynamic attention routing

FLARE++:带动态注意力路由的低秩注意力机制

Vedant Puri, Yongjie Jessica Zhang, Levent Burak Kara

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 FLARE++是带动态注意力路由的低秩注意力架构,通过复用FLARE编码器生成输入条件查询,保留低秩分解与线性复杂度,在PDE代理基准平均提升24%,Long Range Arena平均准确率提升2.3点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11390 2026-08-13 cs.LG 新提交

Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes

生成式引擎的机制设计:从利用到双赢结果

Chen Xu, Zitian Guo, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 针对生成式引擎引用竞争引发的引用战争问题,本文将供给方与平台互动建模为重复斯塔克尔伯格博弈,提出VCR机制,实验显示其防御效用优于基线且能实现双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12406 2026-08-13 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新

FACTR 2: Learning External Force Sensing for Commodity Robot Arms Improves Policy Learning

FACTR 2: 学习商用机器人手臂的外部力感知提升策略学习

Steven Oh, Jason Jingzhou Liu, Tony Tao, Philip Han, Kenneth Shaw, Satoshi Funabashi, Ruslan Salakhutdinov, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Waseda University(早稻田大学)

AI总结 提出无需专用力传感器的数据驱动方法NEXT,可在1分钟内从10分钟自由运动数据中训练,实现与专用关节力矩传感器相当的估计,并结合FIRST采样策略提升策略学习性能。

Comments Website at https://jasonjzliu.com/factr2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22753 2026-08-13 cs.LG 版本更新

Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection

少花钱,多适配:通过主动实验选择实现预算高效的缩放定律拟合

Sijie Li, Shanda Li, Haowei Lin, Weiwei Sun, Ameet Talwalkar, Yiming Yang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Datadog

AI总结 本文提出一种预算感知的序列实验设计方法,通过主动选择实验来提高缩放定律拟合的准确性,实验结果显示其在多种缩放定律任务中优于传统方法,仅用10%的预算即可达到全集拟合效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10484 2026-08-12 cs.RO cs.AI cs.CL 新提交

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

在重建中迷失:将视觉-语言-动作模型中的动作表示与语言对齐

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对视觉-语言-动作模型中动作表示与语言脱节的问题,提出SALT语义对齐动作标记器,在SimplerEnv中使策略平均成功率达71.9%,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10471 2026-08-12 cs.AI 新提交

RLMOpt: Adaptive Prompt Optimization via Recursive Language Models

RLMOpt:基于递归语言模型的自适应提示优化器

Subhash Bangalore Satheesha, Nirvik Pande, Deepthi Duddempudi, Bharath Dandala

机构 * Autonomize AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10420 2026-08-12 cs.AI 新提交

Reasoning Shortcuts and Value Symmetries: What Symmetry Permits, Architecture Realizes, and Optimization Selects

推理捷径与价值对称性:对称性允许什么、架构实现什么以及优化选择什么

Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 该研究分析神经符号系统的推理捷径,发现现有框架的关键定义不适用于其评估的基准,重新测量揭示无法解释的对比例与可证明结构相关,还明确了对称性惰性、自同构存在性等问题的计算复杂度,区分了对称性允许与优化选择的内容。

Comments 55 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏