arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Diyi Yang

Natural Language Processing

至 收录 197
2603.01203 2026-03-09 cs.AI

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

URL PDF HTML 收藏
2510.14591 2026-03-09 cs.HC cs.AI cs.CL

Just-In-Time Objectives: A General Approach for Specialized AI Interactions

即时目标:一种专门化人工智能交互的一般方法

Michelle S. Lam, Omar Shaikh, Hallie Xu, Alice Guo, Diyi Yang, Jeffrey Heer, James A. Landay, Michael S. Bernstein

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 本文提出即时目标方法,通过动态目标诱导提升AI交互的专门化性能,实验表明其在任务处理和质量评估上优于常规LLM。

Comments Accepted at CHI 2026

URL PDF HTML 收藏
2603.03303 2026-03-05 cs.CL cs.AI

HumanLM: Simulating Users with State Alignment Beats Response Imitation

HumanLM: 通过状态对齐模拟用户优于响应模仿

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, James Zou

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。

Comments 27 pages, 17 figures, 9 tables

URL PDF HTML 收藏
2603.02983 2026-03-04 cs.CR cs.AI cs.CL

Contextualized Privacy Defense for LLM Agents

上下文化隐私防御用于大语言模型代理

Yule Wen, Yanzhe Zhang, Jianxun Lian, Xiaoyuan Yi, Xing Xie, Diyi Yang

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学) Microsoft(微软)

AI总结 本文提出上下文化防御指导(CDI),通过强化学习优化框架,在大语言模型代理执行中主动塑造隐私保护与有用性之间的平衡。

Comments 25 pages

URL PDF HTML 收藏
2510.01051 2026-03-03 cs.LG cs.AI cs.CL

GEM: A Gym for Agentic LLMs

GEM:代理大语言模型的训练环境

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(海智实验室) NUS(国立大学新加坡) Oxford(牛津大学) SMU(南卫理安大学) Stanford(斯坦福大学) Northeastern(东北大学) OpenRLHF(开放强化学习基金会) ROLL RL2 absolute AI(绝对人工智能)

AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。

URL PDF HTML 收藏
2602.21136 2026-02-25 cs.HC cs.AI cs.CY

SparkMe: Adaptive Semi-Structured Interviewing for Qualitative Insight Discovery

SparkMe: 适应性半结构化访谈用于定性洞察发现

David Anugraha, Vishakh Padmakumar, Diyi Yang

AI总结 SparkMe通过多智能体LLM实现适应性半结构化访谈,提升访谈效用并挖掘更丰富的职业特定洞察。

URL PDF HTML 收藏
2602.16687 2026-02-19 cs.SD cs.CL eess.AS

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

通过交错语义、音频和文本标记扩展开放离散音频基础模型

Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Cambridge(剑桥大学)

AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。

URL PDF HTML 收藏
2507.03041 2026-02-10 cs.LG cs.AI

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

Optimas: 通过全局对齐的局部奖励优化复合AI系统

Shirley Wu, Parth Sarthi, Shiyu Zhao, Aaron Lee, Herumb Shandilya, Adrian Mladenic Grobelnik, Nurendra Choudhary, Eddie Huang, Karthik Subbian, Linjun Zhang, Diyi Yang, James Zou, Jure Leskovec

机构 * Stanford University(斯坦福大学) Amazon(亚马逊) Jožef Stefan Institute(乔泽夫·斯蒂芬研究所) Rutgers University(罗格斯大学)

AI总结 Optimas通过全局对齐的局部奖励优化复合AI系统,有效提升复合系统的性能。

Comments Accepted to ICLR 2026. 22 pages

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

URL PDF HTML 收藏
2506.06576 2026-02-03 cs.CY cs.AI cs.CL cs.HC cs.LG

Future of Work with AI Agents: Auditing Automation and Augmentation Potential across the U.S. Workforce

人工智能代理的未来工作:跨美国劳动力市场的自动化与增强潜力审计

Yijia Shao, Humishka Zope, Yucheng Jiang, Jiaxin Pei, David Nguyen, Erik Brynjolfsson, Diyi Yang

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种审计框架,评估职业任务中人工智能代理的自动化与增强潜力,揭示人类自主性需求与技术能力的匹配情况,为AI代理发展提供关键洞察。

Comments Preprint, data available at https://futureofwork.saltlab.stanford.edu/

URL PDF HTML 收藏
2601.13295 2026-01-27 cs.LG cs.AI cs.CL cs.MA cs.SI

CooperBench: Why Coding Agents Cannot be Your Teammates Yet

CooperBench:为何编码代理还不能成为你的队友

Arpandeep Khatua, Hao Zhu, Peter Tran, Arya Prabhudesai, Frederic Sadrieh, Johann K. Lieberwirth, Xinkai Yu, Yicheng Fu, Michael J. Ryan, Jiaxin Pei, Diyi Yang

机构 * Stanford University(斯坦福大学) SAP Labs US(SAP美国实验室)

AI总结 CooperBench通过大规模协作编码任务测试,发现AI代理在团队协作中表现不佳,揭示了沟通障碍、承诺偏离和期望错误等关键问题,呼吁发展社交智能。

Comments https://cooperbench.com First two authors contribute equally. The 3th - 6th authors contribute equally

URL PDF HTML 收藏
2601.14525 2026-01-22 cs.CL cs.AI cs.LG

Towards Execution-Grounded Automated AI Research

面向执行导向的自动化AI研究

Chenglei Si, Zitong Yang, Yejin Choi, Emmanuel Candès, Diyi Yang, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

AI总结 本研究提出自动化执行器,通过执行反馈学习改进LLM预训练和后训练方法,验证了进化搜索在样本效率上的优势,但强化学习存在模式崩溃问题。

URL PDF HTML 收藏
2510.24626 2026-01-16 cs.CL

Relative Scaling Laws for LLMs

大语言模型的相对扩展定律

William Held, David Hall, Percy Liang, Diyi Yang

机构 * Stanford University(斯坦福大学) OpenAthena(开放阿塔纳) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究提出相对扩展定律,通过分析不同测试分布在规模变化下的性能差异,揭示大语言模型在扩展过程中并非普遍均衡器,强调了鲁棒性挑战的重要性。

URL PDF HTML 收藏
2506.12605 2026-01-01 cs.HC

The Rise of AI Companions: How Human-Chatbot Relationships Influence Well-Being

AI伴侣的崛起:人类与聊天机器人关系如何影响幸福感

Yutong Zhang, Dora Zhao, Jeffrey T. Hancock, Robert Kraut, Diyi Yang

AI总结 研究探讨了AI伴侣对幸福感的影响,发现依赖聊天机器人寻求陪伴的人群幸福感较低,尤其在高互动和高自我披露情况下,且无法完全替代人类社交。

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

URL PDF HTML 收藏
2510.24591 2025-11-25 cs.CL astro-ph.IM

ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?

ReplicationBench: 人工智能代理能否复制天体物理学研究论文?

Christine Ye, Sihan Yuan, Suchetha Cooray, Steven Dillmann, Ian L. V. Roque, Dalya Baron, Philipp Frank, Sergio Martin-Alvarez, Nolan Koblischke, Frank J Qu, Diyi Yang, Risa Wechsler, Ioana Ciuca

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学)

AI总结 ReplicationBench旨在评估人工智能代理复制天体物理学研究论文的能力,通过测试代理在实验设置、推导、数据分析和代码库等任务上的表现,揭示代理在科学研究中的可靠性及挑战。

URL PDF HTML 收藏
2505.11770 2025-11-12 cs.LG cs.AI cs.CL stat.ML

Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors

Jing Huang, Junyi Tao, Thomas Icard, Diyi Yang, Christopher Potts

机构 * stanford(斯坦福大学)

Comments ICML 2025

URL PDF HTML 收藏
2511.04898 2025-11-10 cs.AI

Real-Time Reasoning Agents in Evolving Environments

Yule Wen, Yixin Ye, Yanzhe Zhang, Diyi Yang, Hao Zhu

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

Comments 30 pages

URL PDF HTML 收藏
2510.22780 2025-11-10 cs.AI cs.CL cs.HC

How Do AI Agents Do Human Work? Comparing AI and Human Workflows Across Diverse Occupations

Zora Zhiruo Wang, Yijia Shao, Omar Shaikh, Daniel Fried, Graham Neubig, Diyi Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

URL PDF HTML 收藏
2510.27672 2025-11-03 cs.CL

Culture Cartography: Mapping the Landscape of Cultural Knowledge

Caleb Ziems, William Held, Jane Yu, Amir Goldberg, David Grusky, Diyi Yang

Comments EMNLP 2025

URL PDF HTML 收藏
2505.02820 2025-10-31 cs.AI cs.CL cs.LG

AutoLibra: Agent Metric Induction from Open-Ended Human Feedback

Hao Zhu, Phil Cuvin, Xinkai Yu, Charlotte Ka Yee Yan, Jason Zhang, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Pennsylvania(宾夕法尼亚大学)

Comments https://github.com/Open-Social-World/autolibra

URL PDF HTML 收藏
2510.19796 2025-10-23 cs.LG cs.CL

Blackbox Model Provenance via Palimpsestic Membership Inference

Rohith Kuditipudi, Jing Huang, Sally Zhu, Diyi Yang, Christopher Potts, Percy Liang

机构 * Stanford University(斯坦福大学)

URL PDF HTML 收藏
2508.09123 2025-10-07 cs.AI cs.CV

OpenCUA: Open Foundations for Computer-Use Agents

Xinyuan Wang, Bowen Wang, Dunjie Lu, Junlin Yang, Tianbao Xie, Junli Wang, Jiaqi Deng, Xiaole Guo, Yiheng Xu, Chen Henry Wu, Zhennan Shen, Zhuokai Li, Ryan Li, Xiaochuan Li, Junda Chen, Boyuan Zheng, Peihang Li, Fangyu Lei, Ruisheng Cao, Yeqiao Fu, Dongchan Shin, Martin Shin, Jiarui Hu, Yuyan Wang, Jixuan Chen, Yuxiao Ye, Danyang Zhang, Dikang Du, Hao Hu, Huarong Chen, Zaida Zhou, Haotian Yao, Ziwei Chen, Qizheng Gu, Yipu Wang, Heng Wang, Diyi Yang, Victor Zhong, Flood Sung, Y. Charles, Zhilin Yang, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(香港大学XLANG实验室) Moonshot AI Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学)

Comments Updata author list, modify first page format, correct typos

URL PDF HTML 收藏
2506.10150 2025-10-06 cs.CL cs.HC

When Large Language Models are Reliable for Judging Empathic Communication

Aakriti Kumar, Nalin Poungpeth, Diyi Yang, Erina Farrell, Bruce Lambert, Matthew Groh

机构 * Kellogg School of Management(凯洛格管理学院) Northwestern University(西北大学) Northwestern Institute for Complex Systems(西北复杂系统研究所) Stanford University(斯坦福大学) Pennsylvania State University(宾夕法尼亚州立大学)

URL PDF HTML 收藏
2506.14159 2025-09-30 cs.HC cs.AI cs.MA

StorySage: Conversational Autobiography Writing Powered by a Multi-Agent Framework

Shayan Talaei, Meijin Li, Kanu Grover, James Kent Hippler, Diyi Yang, Amin Saberi

机构 * Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学) Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

URL PDF HTML 收藏
2406.09264 2025-09-30 cs.HC cs.AI cs.CL

Position: Towards Bidirectional Human-AI Alignment

Hua Shen, Tiffany Knearem, Reshmi Ghosh, Kenan Alkiek, Kundan Krishna, Yachuan Liu, Ziqiao Ma, Savvas Petridis, Yi-Hao Peng, Li Qiwei, Sushrita Rakshit, Chenglei Si, Yutong Xie, Jeffrey P. Bigham, Frank Bentley, Joyce Chai, Zachary Lipton, Qiaozhu Mei, Rada Mihalcea, Michael Terry, Diyi Yang, Meredith Ringel Morris, Paul Resnick, David Jurgens

机构 * NYU Shanghai, New York University(纽约大学上海研究院,纽约大学) MBZUAI(穆桑大学人工智能研究所) Microsoft(微软公司) University of Michigan(密歇根大学) Apple(苹果公司) Google(谷歌公司) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

Comments NeurIPS 2025 Position Paper

URL PDF HTML 收藏
2505.10831 2025-09-23 cs.HC cs.AI cs.CL

Creating General User Models from Computer Use

Omar Shaikh, Shardul Sapkota, Shan Rizvi, Eric Horvitz, Joon Sung Park, Diyi Yang, Michael S. Bernstein

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

Comments 23 pages, 6 figures, 2 tables; see https://generalusermodels.github.io/

URL PDF HTML 收藏
2502.12466 2025-09-23 cs.LG cs.AI cs.CL cs.PL cs.SE

EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking

Anjiang Wei, Jiannan Cao, Ran Li, Hongyu Chen, Yuhui Zhang, Ziheng Wang, Yuan Liu, Thiago S. F. X. Teixeira, Diyi Yang, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Google(谷歌) Nanjing University(南京大学) Intel(英特尔)

URL PDF HTML 收藏
2505.19335 2025-09-19 cs.HC

Knoll: Creating a Knowledge Ecosystem for Large Language Models

Dora Zhao, Diyi Yang, Michael S. Bernstein

Comments 21 pages, 8 figures, 7 tables; see https://stanfordhci.github.io/knoll/

Journal ref UIST 2025

URL PDF HTML 收藏