arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-09-01 至 2026-09-01 共收录 7
2608.21727 2026-09-01 cs.LG cs.AI 版本更新

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

基于良性事实的强化学习会放大模型对已记忆私人数据的泄露

Renfei Zhang, Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-09-01 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-09-01 cs.RO 版本更新

SCOPE: Field-of-View-Aware Path Planning in Unknown Space via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-09-01 cs.CL 版本更新

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

Journal ref EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08336 2026-09-01 cs.CL cs.CV 版本更新

UReason: Benchmarking Reasoning-to-Generation Alignment in Unified Multimodal Models

从推理到像素:统一多模态模型中对齐差距的基准测试

Cheng Yang, Chufan Shi, Bo Shui, Yaokang Wu, Muzi Tao, Huijuan Wang, Ivan Yee Lee, Yong Liu, Xuezhe Ma, Taylor Berg-Kirkpatrick

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of Southern California(南加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。

Comments Project page: https://ureason.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-09-01 cs.AI 版本更新

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-09-01 cs.CL cs.LG 版本更新

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏