How Well Does Agent Development Reflect Real-World Work?
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
高校专区
代理开发是否能反映现实世界的工作?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。
SAHOO:递归自我改进中高阶优化目标的安全保障
机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) ; AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) ; Google, USA(谷歌) ; Stanford University(斯坦福大学) ; Northeastern University, Seattle, WA, USA(东北大学)
AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。
Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures
潜在转移攻击:通过生成性潜在空间进行对抗示例
机构 * Independent Researcher(独立研究者) ; Tel-Aviv University(特拉维夫大学) ; Stanford University(斯坦福大学) ; Bar Ilan University(巴伊兰大学) ; NVIDIA Research(NVIDIA研究) ; New York University(纽约大学)
AI总结 LTA通过生成性潜在空间优化对抗扰动,提升跨架构转移效果,生成低频、连贯的扰动,增强鲁棒性评估与生成先验的结合。
从人机交互中学习下一步动作预测器
机构 * Stanford University(斯坦福大学) ; Hasso Plattner Institute(哈索普拉特纳研究所) ; New York University(纽约大学)
AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。
Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap
EmboAlign:通过组合约束对齐视频生成以实现零样本操控
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学)
AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。
即时目标:一种专门化人工智能交互的一般方法
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出即时目标方法,通过动态目标诱导提升AI交互的专门化性能,实验表明其在任务处理和质量评估上优于常规LLM。
Comments Accepted at CHI 2026
Phys2Real: 融合视觉语言模型先验与交互在线适应以实现不确定性感知的仿真到现实操控
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 Phys2Real通过融合视觉语言模型先验与交互适应,提升仿真到现实操控的不确定性感知与任务成功率。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026
通过系统级DPO对复合AI系统进行对齐
机构 * Stanford University(斯坦福大学) ; University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Mila Quebec AI Institute(魁北克AI研究院)
AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。
Comments NeurIPS 2025