arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Stanford University(斯坦福大学)

2026-04-14 至 2026-04-14 共收录 16
2604.11462 2026-04-14 cs.AI

Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning

突破上下文瓶颈:通过强化学习实现LLM代理的主动上下文精修

Xiaozhe Li, Tianyi Lyu, Yizhao Yang, Liang Shan, Siyi Yang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu, Yang Li

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI 研究院)

AI总结 本文提出一种解耦上下文管理和任务执行的框架,通过强化学习训练轻量级策略模型ContextCurator,有效减少工作内存中的信息熵,提升LLM在长周期任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19691 2026-04-14 cs.AI stat.AP

Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight

可扩展的LLM辅助临床基准的 stewardship 与医生监督

Junze Ye, Daniel Tawfik, Alex J. Goodell, Nikhil V. Kotha, Mark K. Buyyounouski, Mohsen Bayati

机构 * Department of Operations, Information and Technology, Stanford Graduate School of Business, Stanford, CA, USA(斯坦福大学商学院运营、信息与技术系) Department of Pediatrics, Division of Critical Care Medicine, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院儿科系重症监护医学部) Department of Anesthesiology, Perioperative and Pain Medicine, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院麻醉学、围手术期与疼痛医学系) Department of Radiation Oncology, Stanford University School of Medicine, Stanford, CA, USA(斯坦福大学医学院放射肿瘤学系) Department of Electrical Engineering, Stanford University School of Engineering, Stanford, CA, USA(斯坦福大学工程学院电气工程系)

AI总结 研究通过医生监督流程重新评估LLM辅助生成的临床基准标签,发现其可靠性不足,且影响模型性能。

Comments Github codebase: https://github.com/junzeye/validate-medcalc-labels

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17516 2026-04-14 cs.CL cs.AI cs.CY cs.LG

SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors

SimBench:大型语言模型模拟人类行为能力的基准测试

Tiancheng Hu, Joachim Baumann, Lorenzo Lupo, Nigel Collier, Dirk Hovy, Paul Röttger

机构 * University of Cambridge(剑桥大学) Stanford University(斯坦福大学) Bocconi University(博科尼大学) University of Oxford(牛津大学)

AI总结 SimBench通过统一20个多样化的数据集,评估大型语言模型模拟人类行为的 fidelity,发现模型性能与模型大小呈对数线性关系,但与计算资源无关,且存在指令微调与模拟准确性之间的权衡。

Comments Accepted at ICLR 2026. Project Website: http://simbench.tiancheng.hu/ Data: https://huggingface.co/datasets/pitehu/SimBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09389 2026-04-14 cs.LG cs.AI

Design Principles for Sequence Models via Coefficient Dynamics

通过系数动力学设计序列模型的原则

Jerome Sieber, Antonio Orvieto, Melanie N. Zeilinger, Carmen Amo Alonso

机构 * ETH Zurich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Stanford University(斯坦福大学)

AI总结 本文通过系数动力学框架系统比较了序列模型,揭示了不同架构间的数学共同主题,并提出了设计原则以平衡表达能力、效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11035 2026-04-14 cs.AI

Introspective Diffusion Language Models

反思式扩散语言模型

Yifan Yu, Yuqing Jian, Junxiong Wang, Zhongzhu Zhou, Donglin Zhuang, Xinyu Fang, Sri Yanamandra, Xiaoxia Wu, Qingyang Wu, Shuaiwen Leon Song, Tri Dao, Ben Athiwaratkun, James Zou, Fan Lai, Chenfeng Xu

机构 * Together AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学)

AI总结 本文提出反思式扩散语言模型,通过引入反思性解码算法,在保持并行解码的同时继承自回归训练的反思一致性,实现了与同规模自回归模型相当的质量并优于先前扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10717 2026-04-14 cs.CR cs.AI cs.CL

Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game

通过双路径运行时完整性游戏检测RAG提取攻击

Yuanbo Xie, Yingjie Zhang, Yulin Li, Shouyou Song, Xiaokun Chen, Zhihan Liu, Liya Su, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Beijing University of Post and Telecommunications(北京邮电大学) Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) AI Sec Lab, Beijing Chaitin Technology Co.,Ltd(北京长亭科技有限公司AI安全实验室)

AI总结 本文提出CanaryRAG,一种基于栈canary的运行时防御机制,通过双路径完整性游戏实时检测RAG知识库泄露,有效降低攻击成功率,不影响任务性能和延迟。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02460 2026-04-14 cs.CL cs.MA

Single-Agent LLMs Outperform Multi-Agent Systems on Multi-Hop Reasoning Under Equal Thinking Token Budgets

单代理LLM在多跳推理中优于多代理系统(在相等的思考令牌预算下)

Dat Tran, Douwe Kiela

机构 * Stanford University(斯坦福大学)

AI总结 在相等的思考令牌预算下,单代理系统在多跳推理任务中表现优于多代理系统,研究通过信息论论证指出单代理系统在信息效率上更具优势,并揭示了多代理系统在计算和上下文利用下降时的竞争性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24503 2026-04-14 cs.LG cs.AI

Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice

小规模训练能否可靠地指导数据整理?重新审视代理模型实践

Jiachen T. Wang, Tong Wu, Kaifeng Lyu, James Zou, Dawn Song, Ruoxi Jia, Prateek Mittal

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20147 2026-04-14 cs.GT cs.LG cs.MA cs.SY eess.SY

Choose Your Battles: Distributed Learning Over Multiple Tug of War Games

选择你的战役:多个拔河游戏的分布式学习

Siddharth Chandak, Ilai Bistritz, Nicholas Bambos

机构 * Stanford University(斯坦福大学) Tel Aviv University(特拉维夫大学)

AI总结 本文提出一种分布式算法,用于多个拔河游戏的均衡问题,通过简单随机近似算法更新动作,并利用稀疏1位通信决定切换游戏,确保满足服务质量奖励向量。

Comments Accepted for publication at IEEE Transactions on Automatic Control (TAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06416 2026-04-14 cs.LG cs.AI cs.HC

Influencing Humans to Conform to Preference Models for RLHF

影响人类以符合偏好模型的强化学习从人类反馈

Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Sony AI(索尼AI)

AI总结 本文通过三项人类研究,探讨如何通过干预使人类偏好更符合预期模型,提升RLHF奖励函数对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09942 2026-04-14 cs.CV cs.AI

I Walk the Line: Examining the Role of Gestalt Continuity in Object Binding for Vision Transformers

我行走在线上:检验格式化连续性在视觉转换器中物体绑定中的作用

Alexa R. Tartaglini, Michael A. Lepori

机构 * Stanford University(斯坦福大学) Brown University(布朗大学)

AI总结 本文研究视觉转换器中物体绑定是否依赖格式化连续性原理,通过合成数据集验证了连续性在绑定中的重要性,并通过注意力头分析展示了其在跨数据集中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09937 2026-04-14 cs.AI

HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks

HealthAdminBench: 评估基于计算机使用的代理在医疗管理任务上的性能

Suhana Bedi, Ryan Welch, Ethan Steinberg, Michael Wornow, Taeil Matthew Kim, Haroun Ahmed, Peter Sterling, Bravim Purohit, Qurat Akram, Angelic Acosta, Esther Nubla, Pritika Sharma, Michael A. Pfeffer, Sanmi Koyejo, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Kinetic Systems Stanford Health Care(斯坦福医疗保健)

AI总结 本文提出HealthAdminBench,通过四个真实GUI环境和135个专家定义任务,评估CUA在医疗行政流程中的性能,发现端到端可靠性较低,最佳代理仅达成36.3%的任务成功率。

Comments 24 pages, 5 figures, 5 tables. Benchmark paper introducing 4 simulated environments, 135 tasks, and 1,698 evaluation points for healthcare administrative computer-use agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09905 2026-04-14 cs.LG

Improving Pediatric Emergency Department Triage with Modality Dropout in Late Fusion Multimodal EHR Models

通过晚期融合多模态EHR模型中的模态脱落改进儿科急诊分诊

Tyler Yang, Romal Mitr

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种晚期融合多模态架构,结合XGBoost和Bio_ClinicalBERT处理结构化数据和非结构化文本,通过逻辑回归元分类器预测急诊严重程度指数,通过模态脱落提升模型在儿科群体中的泛化能力。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09887 2026-04-14 cs.LG

SemEnrich: Self-Supervised Semantic Enrichment of Radiology Reports for Vision-Language Learning

SemEnrich:用于视觉-语言学习的医学报告语义增强

Halil Ibrahim Gulluk, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford Center For Biomedical Informatics Research(斯坦福生物医学信息学研究中心)

AI总结 本文提出一种自监督的医学报告语义增强方法,通过句子语义聚类来丰富训练集中的阳性/中性发现,从而提升视觉-语言学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09793 2026-04-14 cs.CL cs.AI

GIANTS: Generative Insight Anticipation from Scientific Literature

GIANTS:从科学文献生成洞察预判

Joy He-Yueya, Anikait Singh, Ge Gao, Michael Y. Li, Sherry Yang, Chelsea Finn, Emma Brunskill, Noah D. Goodman

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

AI总结 本文提出GIANTS任务,通过生成模型预测下游论文的核心洞察,开发了包含17000个示例的GIantsBench基准,展示了GIANTS-4B模型在多个领域中的优越性能,其生成的洞察在概念清晰度和引用潜力上均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏