arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-25 至 2026-08-25 共收录 10
2608.19197 2026-08-25 cs.CL cs.AI 版本更新

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-08-25 cs.CL cs.CR 版本更新

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23262 2026-08-25 cs.AI 版本更新

Designing Benchmarks for Knowledge Work

知识工作的设计与报告基准

Yining Hua, Hongbin Na, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) University of Technology Sydney(悉尼科技大学) Stanford University(斯坦福大学) Raycaster AI

AI总结 针对当前知识工作评估基准与真实部署脱节的问题,提出三步法(定义工作活动、指定测试设置、评分工作产品)来明确基准任务与工作主张的对应关系,并通过三个案例分析展示设计选择如何影响可支持的工作主张。

Comments 18 pages. This replacement updates the title and revises the contribution from a three-step reporting approach to a four-field work-centered benchmark representation (represented activity, tested setting, required work product, and evaluated result). Author affiliations now include Agent Evaluation Science, Inc., New York, NY 10001

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03058 2026-08-25 cs.CL cs.AI cs.CY 版本更新

Verbalizing LLMs' assumptions to explain and control sycophancy

使LLM的假设 verbal化以解释和控制谄媚行为

Myra Cheng, Isabel Sieh, Humishka Zope, Sunny Yu, Lujain Ibrahim, Aryaman Arora, Jared Moore, Desmond Ong, Dan Jurafsky, Diyi Yang

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出Verbalized Assumptions框架,通过揭示LLM对用户的错误假设来解释和控制其谄媚行为,发现LLM在面对用户提问时倾向于提供验证而非客观信息,进而提出可解释的细粒度控制方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24289 2026-08-25 cs.CV cs.LG 版本更新

Mode Seeking meets Mean Seeking for Fast Long Video Generation

模式寻求与均值寻求的结合用于快速长视频生成

Shengqu Cai, Weili Nie, Chao Liu, Julius Berner, Lvmin Zhang, Nanye Ma, Hansheng Chen, Maneesh Agrawala, Leonidas Guibas, Gordon Wetzstein, Arash Vahdat

机构 * Stanford University, California, USA(斯坦福大学) NVIDIA Research, California, USA(NVIDIA研究)

AI总结 本文提出一种结合模式寻求与均值寻求的解耦扩散变换器,通过监督学习生成快速长视频,提升长距离连贯性和局部真实感。

Comments Project website: this https URL (https://primecai.github.io/mmm/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-08-25 cs.CV 版本更新

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22024 2026-08-25 cs.LG cs.NE 版本更新

Finite-Nudge Equilibrium Propagation in Thermal Ensembles

无限制的平衡传播

Elon Litman

机构 * Stanford University(斯坦福大学)

AI总结 该研究提出了一种无需微小近似或凸性的广义平衡传播算法,通过有限扰动基础实现了精确的梯度估计,提升了学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18845 2026-08-25 cs.RO eess.SY 版本更新

MADR: MPC-guided Adversarial DeepReach

MADR:MPC引导的对抗性深度可达性分析

Ryan Teoh, Sander Tonkens, William Sharpless, Aijia Yang, Zeyuan Feng, Somil Bansal, Sylvia Herbert

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学)

AI总结 本研究提出MADR框架,用于鲁棒近似两人零和微分博弈值函数,通过结合MPC引导与对抗性深度可达性分析,在高维机器人仿真及硬件测试中优于现有基线方法。

Comments 8 pages, IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15873 2026-08-25 cs.AI cs.CY 版本更新

Practical Principles for AI Cost and Compute Accounting

AI成本与计算核算的实用原则

Stephen Casper, Luke Bailey, Tim Schreier

机构 * MIT CSAIL Stanford University(斯坦福大学) Future of Life Institute(未来生命研究所)

AI总结 针对AI成本与计算核算存在的技术模糊性漏洞,提出七条原则以减少策略性博弈、避免抑制风险缓解并实现跨主体的一致实施,保障相关监管的有效性。

Comments Accepted to the ICML 2025 TAIG Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏