arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

共收录 740
2608.18011 2026-08-19 cs.CL 新提交

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12841 2026-08-19 cs.CL cs.AI 版本更新

AQuA: Recursively Self-Improving Quantitative Trading Research Agents

AQuA:递归自我改进的量化交易研究智能体

Jiacheng Guo, Suozhi Huang, Yunlong Gao, Zihao Li, Jason Ge, Xu Kuang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Ant Group(蚂蚁集团) Stanford University(斯坦福大学)

AI总结 本研究提出AQuA系统,包含符号因子发现与可训练模型开发两个独立研究智能体,实现研究层面的递归自我改进,其构建的量化策略在美股等市场表现优异且连续五年收益为正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06837 2026-08-19 eess.AS cs.LG 版本更新

SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails

SEAM:面向面试防护栏的脚本化与自发语音的快捷方式感知实时检测

Vsevolod (V.) Kovalev, Pranay Manocha

机构 * Symbal AI Princeton University(普林斯顿大学)

AI总结 提出SEAM框架,通过统一预处理、接缝感知采样、非语音增强和紧凑DistilHuBERT骨干,在8秒窗口下实现0.971 ROC-AUC,并揭示快捷方式学习问题。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08525 2026-08-19 cs.AI cs.CL cs.CY 版本更新

Ads in AI Chatbots? An Analysis of How Large Language Models Navigate Conflicts of Interest

AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析

Addison J. Wu, Ryan Liu, Shuyue Stella Li, Yulia Tsvetkov, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学)

AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14556 2026-08-18 cs.LG 新提交

Learning Discrete Riemannian Metrics for Physical Fields with Cochain-Frame Equivarianc

利用上同调框架等变性学习物理场的离散黎曼度量

Dongzhe Zheng, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学)

AI总结 本文提出黎曼霍奇消息传递(RHMP),通过固定拓扑相关的胞腔上边缘算子、学习几何相关的上同调度量,实现上同调框架等变性,在7项物理基准测试中取得最佳整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-18 cs.AI cs.CL cs.CV 版本更新

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20357 2026-08-18 cs.CL 版本更新

Language Models that Think, Chat Better

能思考、对话更出色的语言模型

Adithya Bhaskar, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence(普林斯顿语言与智能研究所) Princeton University(普林斯顿大学)

AI总结 本文提出RLMT方法,将RLVR扩展至开放式任务,使语言模型生成长CoT推理,在多基准测试中优于RLHF,仅用少量提示训练的基础模型性能超多阶段后训练的指令微调模型

Comments COLM 2026; we release our code, data, and artifacts publicly at https://github.com/princeton-pli/RLMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14036 2026-08-17 cs.AI 新提交

Demystifying Agent Skills: Why They Work-Until They Don't

揭秘智能体技能:为何它们有效——直至失效

Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao, Rui Cao, Mengdi Wang, Shilong Liu, Yijiang Li

机构 * Princeton University(普林斯顿大学) UC San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) University of Southern California(南加利福尼亚大学) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究探究 LLM 智能体技能的有效与失效原因,通过对比实验与轨迹分析揭示技能的作用机制,发现其主要靠程序锚定稳定动作,还指出检索瓶颈等问题,为智能体评估与优化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-17 cs.CL 版本更新

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

Comments COLM 2026. Code is available at https://github.com/princeton-pli/AggAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12387 2026-08-14 cs.CL cs.AI 新提交

Query Timing Produces Opposite Positional Biases Between LLMs and Humans

查询时机在大型语言模型(LLMs)与人类之间产生相反的位置偏差

Jasin Cekinmez, Addison J. Wu, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

AI总结 该研究探究查询时机对LLMs和人类位置偏差的影响,发现二者存在差异,且新LLMs的位置偏差比前代更显著。

Comments Entropic Award (Top 3 Paper), ICBINB @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22699 2026-08-14 cs.AI cs.CL 版本更新

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

一路相似:大语言模型中的多语言泛化依赖于语言层面的相似性结构

Supantho Rakshit, Adele Goldberg, Henry Conklin

机构 * Princeton University(普林斯顿大学)

AI总结 研究大语言模型多语言泛化能力,通过借鉴认知科学,探究其对不同语言层次相似性结构的捕捉,发现潜在表示能恢复印欧语系语言家族树结构,且模型反映语言相似性程度与XNLI表现相关,扩展了相似性驱动泛化工作。

Comments Accepted for oral presentation at CogSci 2026 (48th Annual Meeting of the Cognitive Science Society), Rio de Janeiro. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11612 2026-08-13 cs.LG cs.AI 新提交

Dion3: Full-Stack Orthogonal Updates

Dion3:全栈正交更新

Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen, Tri Dao, John Langford

机构 * Microsoft Research(微软研究院) New York University(纽约大学) Princeton University(普林斯顿大学) NVIDIA(英伟达) Yale University(耶鲁大学)

AI总结 Dion3是针对Muon优化器开销的改进版本,通过全栈优化降低了正交化、通信等开销,步长时间最多降6倍,可作为Muon的即插即用替代方案。

Comments 37 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17598 2026-08-13 cs.RO cs.CV 版本更新

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08467 2026-08-13 cs.HC cs.AI cs.GR cs.PL 版本更新

Empowering Children to Create AI-Enabled Augmented Reality Experiences

赋能儿童创建AI增强现实体验

Lei Zhang, Shuyao Zhou, Amna Liaqat, Tinney Mak, Brian Berengard, Emily Qian, Andrés Monroy-Hernández

机构 * New Jersey Institute of Technology \& Princeton University Newark NJ USA Princeton University Princeton NJ USA New Jersey Institute of Technology \& Princeton University Princeton University

AI总结 该研究推出AR与AI驱动的可视化编程环境Capybara,支持儿童创建编程虚拟角色与现实物体交互的AR体验,经20名儿童测试,可赋能儿童创作个性化虚实融合AR内容。

Comments Accepted to ACM UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08020 2026-08-12 cs.AI 版本更新

Thought-Level Beam Search for Reasoning

用于推理的思维级束搜索

Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Meta AI

AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。

Comments Add the author Jiawei Zhao in Meta Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09277 2026-08-11 cs.AI cs.PL 新提交

P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation

P³:用于验证代码生成的程序与证明联合规划

Zenan Li, Ziran Yang, Peiyang Song, Zhaoyu Li, Kaiyu Yang

机构 * Apodex Princeton University(普林斯顿大学) Caltech(加州理工学院) University of Toronto(多伦多大学)

AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08888 2026-08-11 cs.AI 新提交

Full-bandwidth transformer

全带宽Transformer

Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Princeton University(普林斯顿大学) Microsoft(微软公司)

AI总结 该研究提出全带宽Transformer,通过潜在反馈拓宽解码步骤间的垂直反馈通道,经训练验证其在多项任务上性能提升,且解码开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04273 2026-08-11 cs.AI 版本更新

Human agency in initial human-AI proof formalization workflows

表征初始人机交互的证明形式化工作流

Katherine M. Collins, Simon Frieder, Jonas Bayer, Jacob Loader, Jeck Lim, Peiyang Song, Fabian Zaiser, Lexin Zhou, Shanda Li, Sam Looi, Joshua B. Tenenbaum, Umang Bhatt, Adrian Weller, Jose Hernandez-Orallo, Cameron E. Freer, Valerie Chen, Ilia Sucholutsky

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学) Caltech(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Universitat Politècnica de València(瓦伦西亚理工大学) New York University(纽约大学)

AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。

Comments Updated working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23268 2026-08-11 stat.ML cs.LG 版本更新

Coupled Training with Privileged Information and Unlabeled Data

基于特权信息与未标记数据的联合训练

Jiahao Shi, Omar Hagrass, Jason M. Klusowski

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电子与计算机工程系) Department of Operations Research and Financial Engineering, Princeton University(普林斯顿大学运筹学与金融工程系)

AI总结 提出一种联合训练方法,同时学习利用训练时特权信息和测试时可用输入的模型,避免两阶段方法中弱噪声信息误导部署模型,并通过理论保证和实验验证其鲁棒性优于标准两阶段基线。

Comments 37 pages, 6 figures. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00884 2026-08-11 cs.LG 版本更新

Test-time Generalization for Physics through Neural Operator Splitting

通过神经算子分裂实现物理中的测试时泛化

Louis Serrano, Jiequn Han, Edouard Oyallon, Shirley Ho, Rudy Morel

机构 * Flatiron Institute, New York(Flatiron 机构,纽约) New York University(纽约大学) Princeton University(普林斯顿大学) Sorbonne Université, CNRS, ISIR, Paris(索邦大学,CNRS,ISIR,巴黎)

AI总结 本文提出通过神经算子分裂在测试时增强泛化能力,实现零样本泛化并恢复底层PDE参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07408 2026-08-10 cs.CV cs.LG 新提交

Addressable Memory for Video World Models

视频世界模型的可寻址内存

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of Toronto(多伦多大学) Vector Institute(矢量研究院)

AI总结 针对交互式视频世界模型超出训练时序后内存寻址失效及压缩缓存破坏内存的问题,提出无训练框架 WorldTrace,含两种压缩方法,在新基准 LoopBench 上分别提升时序一致性 15.5%、情景回忆 19.5%。

Comments Project page: https://research.nvidia.com/labs/sil/projects/WorldTrace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13491 2026-08-10 cs.LG cs.AI 版本更新

DeepLoop: Depth Scaling for Looped Transformers

DeepLoop:循环变换器的深度缩放

Shuzhen Li, Yifan Zhang, Jiacheng Guo, Quanquan Gu, Mengdi Wang

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 研究循环变换器中深度缩放问题,提出DeepLoop方法,通过控制访问对齐系数形式化绑定深度效应,保持特定架构并设置参数,在不同规模GPT风格模型上实验,结果显示稳定循环深度需考虑参数访问的残差缩放规则。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23052 2026-08-10 cs.LG 版本更新

Optimization as a Dynamical System: Generative Schedules from Latent ODEs

作为动力系统的优化:来自潜在常微分方程(Latent ODE)的生成式学习率调度

Matt L. Sampson, Peter Melchior

机构 * Princeton University(普林斯顿大学)

AI总结 该研究提出一种基于潜在常微分方程的元学习调度器,可生成梯度下降的最优学习率调度,在图像分类、下一个token预测任务上优于基准,能提升模型泛化能力且计算高效。

Comments Accepted in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05416 2026-08-07 cs.LG 新提交

Spectral Distillation: From Nonlinear Dynamics to Linear State-Space Models

谱蒸馏:从非线性动力学到线性状态空间模型

Liane Galanti, Devan Shah, Shlomo Fortgang, Elad Hazan

机构 * Princeton University(普林斯顿大学)

AI总结 该研究提出一种可证明的端到端流程,通过观测谱滤波(OSF)的凸学习结合谱到LDS的蒸馏,从非线性动力学系统中提取事后最优线性状态空间模型,实验验证其性能优于或匹配直接训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏