arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-27 至 2026-08-27 共收录 17
2608.26070 2026-08-27 cs.CL cs.AI cs.LG 新提交

Prefix Sliding for efficient test-time scaling

用于高效测试时缩放的前缀滑动

Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis

机构 * Stanford University(斯坦福大学) University of California at Santa Barbara(加州大学圣巴巴拉分校) Prime Intellect University of Washington(华盛顿大学)

AI总结 针对测试时推理内存成本过高问题,提出Prefix Sliding方法,通过丢弃非关键标记限制内存,无需训练可提速3倍,结合强化学习训练后性能更优且优于其他基线

Comments 28 pages (9 main), 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25924 2026-08-27 cs.CV 新提交

Visual General Intelligence: A White Paper

视觉通用智能:白皮书

Hirokatsu Kataoka, Yoshihiro Fukuhara, Yonglong Tian, Shangzhe Wu, Oishi Deb, Ryousuke Yamada, Christian Rupprecht, Jianyuan Wang, Kohsuke Ide, Koichi Namekata, Xianzheng Ma, Yiming Chen, Robert Geirhos, Aditi Raghunathan, Yuki M. Asano, Deva Ramanan, David Fouhey, Andrew J. Davison, Yilun Du, Jiajun Wu, Zhuang Liu

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究所(AIST)) Visual Geometry Group (VGG), University of Oxford(牛津大学视觉几何组(VGG)) CADDi(CADDi公司) OpenAI(OpenAI公司) University of Cambridge(剑桥大学) University of Technology Nuremberg(纽伦堡工业大学) University of Tsukuba(筑波大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Imperial College London(伦敦帝国学院) Harvard University(哈佛大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

AI总结 本文以视觉为中心探讨通用人工智能(AGI)路径,提出视觉通用智能(VGI)概念,明确AGI时代计算机视觉的发展原则、模态、基准等关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25399 2026-08-27 cs.AI 新提交

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

你的AI智能体能更便宜吗?探究智能体编码任务中任务规格对token消耗的影响

Jakub Smékal

机构 * Stanford University(斯坦福大学)

AI总结 本文以Kimi K3模型为对象,探究智能体编码任务中任务规格对token消耗的影响,发现简化任务规格会提升token消耗,拟合的预测器可较优地预测token消耗,为评估AI编码工作流成本提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25230 2026-08-27 cs.LG cs.CL 新提交

Trust the Mass: Forced Weights in KV-Cache Eviction

信任海量:KV缓存驱逐中的强制权重

Jack Shi, Jerry Gu

机构 * Stanford University(斯坦福大学)

AI总结 该研究针对KV缓存驱逐规则,通过分析168192个注意力行的最优子集情况,提出无需训练的分配器ContourKV,其在配对比较中表现优于多数现有技术,且与最强基线持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25220 2026-08-27 cs.AI cs.LO math.OC 新提交

FLARE: Verifying MILP Reformulations with LLM-Based Theorem Proving

FLARE:基于大语言模型定理证明的MILP重构验证方法

Henry Robbins, Connor Lawless, Madeleine Udell, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

AI总结 本文提出FLARE方法,结合LLM智能体与Lean证明助手验证MILP重构,在FormulationBench的NP-难子集达100%准确率,还提出无需证书的FLARE-NL,为自动化优化建模提供可靠验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13652 2026-08-27 cs.LG hep-ex hep-ph 版本更新

Contrastive Learning for Interpretable Anomaly Detection at Collider Experiments

对撞机实验中可解释异常检测的对比学习

Haoyi Jia, Sagar Addepalli, Julia Gonski

机构 * Stanford University(斯坦福大学) SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

AI总结 本研究针对对撞机异常检测的可解释性与能量依赖问题,提出ORCA两阶段框架,通过对比学习结合自编码器实现更优的信号灵敏度与可解释性,为对撞机异常搜索提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24267 2026-08-27 cs.CL cs.AI 版本更新

Pigeonholing: how bad prompts hurt models, causing collapse and mistakes

鸽笼效应:不良提示导致模型崩溃和犯错

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

AI总结 研究不良上下文导致大语言模型性能下降和模式崩溃的“鸽笼效应”,发现重复错误答案、收敛于狭窄答案集等问题,并提出RLVR合成错误缓解方法。

Comments EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-08-27 cs.CL cs.CR 版本更新

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01120 2026-08-27 cs.AI math.CO 版本更新

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02585 2026-08-27 cs.AI cs.CL 版本更新

Mitigating LLM biases toward spurious social contexts using direct preference optimization

通过直接偏好优化减轻LLM对虚假社会情境的偏见

Hyunji Nam, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

AI总结 本文研究了LLM对虚假社会情境的鲁棒性,提出Debiasing-DPO方法,通过自监督训练和监督微调减少偏见并提升预测准确性。

Comments COLM 2026, main text 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12364 2026-08-27 hep-ex cs.LG hep-ph physics.data-an 版本更新

Cross-Domain Transfer with Particle Physics Foundation Models: From Jets to Neutrino Interactions

跨领域迁移与粒子物理基础模型:从喷注到中微子相互作用

Gregor Krzmanc, Vinicius Mikuni, Benjamin Nachman, Callum Wilkinson

机构 * Department of Physics, Stanford University(斯坦福大学物理系) Nagoya University, Kobayashi-Maskawa Institute(名古屋大学滨坂-马萨卡瓦研究所) Fundamental Physics Directorate, SLAC National Accelerator Laboratory(SLAC国家加速器实验室基础物理部门) Lawrence Berkeley National Laboratory(伯克利国家实验室)

AI总结 本文探讨了基于粒子物理基础模型的跨领域迁移能力,通过在中微子实验中实现能量回归和分类任务,验证了预训练模型在不同能量尺度和探测器技术下的泛化能力。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10226 2026-08-27 cs.CV cs.RO 版本更新

Latent Chain-of-Thought World Modeling for End-to-End Driving

潜在链式思维世界建模用于端到端驾驶

Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krahenbuhl, Marco Pavone, Boris Ivanovic

机构 * UT Austin(得克萨斯大学奥斯汀分校) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 本文提出Latent-CoT-Drive模型,通过潜在语言整合链式思维推理与决策,提升驾驶性能与安全性,实现更快推理和更优轨迹质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02203 2026-08-27 cs.AI cs.CL 版本更新

Tool Verification for Test-Time Reinforcement Learning

测试时强化学习的工具验证

Ruotong Liao, Nikolai Röhrich, Xiaohan Wang, Yuhui Zhang, Yasaman Samadzadeh, Volker Tresp, Serena Yeung-Levy

机构 * Ludwig-Maximilians-University of Munich(慕尼黑路德维希-马克西米利安大学) Stanford University(斯坦福大学)

AI总结 T^3RL通过引入测试时工具验证机制,提升测试时强化学习在复杂问题上的表现,减少错误模式崩溃风险。

Comments 12 pages, 11 figures; Code: this https URL (https://github.com/mayhugotong/T3RL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-08-27 cs.LG cs.AI 版本更新

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments ICLR 2026; 10 pages for main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02764 2026-08-27 cs.IR cs.AI 版本更新

Netflix Artwork Personalization via LLM Post-training

通过LLM后训练实现Netflix作品个性化

Hyunji Nam, Sejoon Oh, Emma Kong, Yesu Feng, Moumita Bhattacharya

机构 * Stanford University(斯坦福大学)

AI总结 通过LLM后训练实现Netflix作品个性化推荐,提升用户满意度和参与度。

Comments Pluralistic Alignment @ ICML 2026 Workshop; 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02855 2026-08-27 cs.CL cs.CY 版本更新

IDEAlign: Comparing Ideas of Large Language Models to Domain Expert

IDEAlign:将大语言模型的想法与领域专家进行比较

Hyunji Nam, Lucia Langlois, James Malamut, Mei Tan, Dorottya Demszky

机构 * Stanford University(斯坦福大学)

AI总结 本研究提出IDEAlign方法,通过“挑出异类”任务评估LLM标注与专家标注的想法层面相似性,发现LLM作为评判者表现最佳但仍不及专家,为开放式LLM标注评估提供了可复用的基准测试协议。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05458 2026-08-27 stat.CO cs.LG 版本更新

Generative Modeling: A Review

生成式建模:综述

Maria Nareklishvili, Nick Polson, Vadim Sokolov

机构 * Stanford University, Graduate School of Business(斯坦福大学商学院) Chicago Booth(芝加哥商学院) George Mason University(乔治·马歇尔大学)

AI总结 本综述围绕三类生成器组织生成式建模文献,提出生成式贝叶斯计算方法,在埃博拉传播应用中验证其能低成本恢复准确后验,性能优于同类方法。

Comments arXiv admin note: substantial text overlap with arXiv:2305.14972 (https://arxiv.org/abs/2305.14972)

详情

展开后加载摘要…

URL PDF HTML 收藏