arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-09-01 至 2026-09-01 共收录 13
2608.30107 2026-09-01 cs.CL cs.AI cs.CY 新提交

AtlasNLP: A Country-Aware Atlas of Dataset Representation in NLP

AtlasNLP:NLP中数据集表示的国家感知图集

Joan Nwatu, Tsedeniya Solomon Amare, Longju Bai, Bontu Fufa Balcha, Zayd Bashir, Angana Borah, Zara Burzo, Yubin Choi, Naihao Deng, Samika Gupta, Michel Faloughi, Claude Kwizera, Ziqiao Ma, Cynthia Yacel Fuertes Panizo, Ellie Seehorn, Hui Shen, Jiayi Tang, Zesen Zhao, Boyuan Zheng, Rada Mihalcea

机构 * University of Michigan(密歇根大学) Addis Ababa University(亚的斯亚贝巴大学) San Jose State University(圣何塞州立大学) Skyline High School(斯凯莱恩高中) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究推出AtlasNLP国家感知图集,含13000余条NLP数据集记录及两个子数据集,发现各国各任务数据集覆盖不均等问题,推动NLP评估补充地理元数据。

Comments Proceedings of the 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29967 2026-09-01 cs.RO cs.AI 新提交

Training-Free Action Correction for VLA Model Failures via Language Feedback

无需训练的、基于语言反馈的VLA模型错误动作校正方法

Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究提出CorrectVLA框架,利用任务级自然语言反馈在不重训的情况下校正VLA模型的执行错位错误,在仿真与真实机器人实验中均实现了良好的泛化校正效果,明确了推理阶段动作校正的适用边界。

Comments 8 pages, 6 figures. Project page: https://correctvla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28677 2026-09-01 cs.RO 新提交

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

面向未知物理环境地面机器人的认知基础型端侧运行时学习

Yihao Cai, Yanbing Mao, Christian Lebiere

机构 * Wayne State University(韦恩州立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出CogRun框架,使地面机器人可在边缘AI设备上实现认知基础型运行时学习,经实验验证该框架能让机器人在未知环境中安全高效交互以提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28620 2026-09-01 cs.AI cs.LG 新提交

Preference Elicitation for Policy Optimization and Application to Aligning Heart Transplantation with Human Values

用于策略优化的偏好 elicitation 及其在心脏移植与人类价值观对齐中的应用

Itai Zilberstein, Ioannis Anagnostides, Zachary W Sollie, Arman Kilic, Tuomas Sandholm

机构 * Carnegie Mellon University(卡内基梅隆大学) Medical University of South Carolina(南卡罗来纳医科大学) Strategy Robot, Inc.(策略机器人公司) Strategic Machine, Inc.(战略机器公司) Optimized Markets, Inc.(优化市场公司)

AI总结 本文提出一种用于策略优化的线性效用偏好 elicitation 算法,将其应用于心脏移植分配,通过用户研究学习社区对齐的效用函数,所优化策略的竞争比达0.95,显著优于现状策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28607 2026-09-01 cs.AI cs.CL 新提交

RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences

RegDivergence-101:用于生命科学领域跨司法管辖区监管矛盾检测的大语言模型基准

Chuchu Wu, Zhiyin Zhou, Jingzhuo Hu, Liang You

机构 * Carnegie Mellon University(卡内基梅隆大学) Pratt Institute(普拉特学院) University of Pennsylvania(宾夕法尼亚大学) University of Pittsburgh(匹兹堡大学)

AI总结 本文发布RegDivergence-101基准,提出跨司法管辖区监管分歧检测任务,对比四类方法性能,发现未提及类的检测特性,为大规模检测指明架构方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21727 2026-09-01 cs.LG cs.AI 版本更新

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

基于良性事实的强化学习会放大模型对已记忆私人数据的泄露

Renfei Zhang, Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-09-01 cs.RO 版本更新

SCOPE: Field-of-View-Aware Path Planning in Unknown Space via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-09-01 cs.CL 版本更新

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

Journal ref EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-09-01 cs.AI 版本更新

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-09-01 cs.CL cs.LG 版本更新

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏