Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data
基于良性事实的强化学习会放大模型对已记忆私人数据的泄露
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。
高校专区
基于良性事实的强化学习会放大模型对已记忆私人数据的泄露
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。
SPADE:自适应合成可执行环境中的自博弈
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; National University of Singapore(新加坡国立大学) ; Seoul National University(首尔大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; University of Chicago(芝加哥大学)
AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。
Comments Work in progress. Project page: https://spade-rl.github.io ; Code: https://github.com/spade-rl/spade
SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Brigham Young University(杨百翰大学)
AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。
Comments Project website: https://yuanjunbin.github.io/scope-planner/
给自己的笔记:大语言模型能从经验抽象中受益吗?
机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)
AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。
Journal ref EMNLP 2026 Findings
从推理到像素:统一多模态模型中对齐差距的基准测试
机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) ; University of Southern California(南加利福尼亚大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过UReason基准测试,探讨统一多模态模型中模态对齐问题,发现去上下文生成在图像生成任务中表现更优,揭示了文本推理与生成图像之间存在对齐差距。
Comments Project page: https://ureason.github.io
HumanStudy-Bench: 向参与者模拟的AI代理设计迈进
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Independent Researcher(独立研究者)
AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。
Social Caption: 评估多模态模型的社会理解能力
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。
Comments Accepted to Findings of EMNLP 2026. 26 pages, 10 figures