arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-09-01 至 2026-09-01 共收录 13
2608.30964 2026-09-01 cs.CV 新提交

Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment

视觉模型通过有限的神经对齐预测城市场景评价

Kaizhen Tan, Yuantao Deng

机构 * New York University(纽约大学)

AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30390 2026-09-01 cs.LG 新提交

Uncertainty of Vision Medical Foundation Models

视觉医学基础模型的不确定性

Haoxu Huang, Narges Razavian

机构 * Center for Data Science, New York University(纽约大学数据科学中心) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)

AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30068 2026-09-01 cs.CV 新提交

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

TAKE 85:基于85小时电影时长的电影创作者意图测试基准

Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant, Xi Wang, Dimitris Samaras, Vicky Kalogeiton

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) New York University(纽约大学) Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) Stony Brook University(石溪大学)

AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30005 2026-09-01 cs.CL 新提交

Small Language Models as Judges for Rubric-Based Reinforcement Learning

小型语言模型作为基于 rubric 的强化学习的评判者

Fengyu Xie, Yilun Zhao, Bingsen Chen, Arman Cohan, Chen Zhao

机构 * New York University(纽约大学) Yale University(耶鲁大学)

AI总结 该研究构建了两个基于 rubric 的评估数据集,对比三种提取标准级评判的方法,发现 Qwen3-1.7B 探针评判者表现最优,用作 GRPO 奖励模型时训练效率优于 8B 生成式评判者基线。

Comments 9 pages, 1 figure; EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29988 2026-09-01 cs.AI 新提交

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制

Hanjun Luo, Qiushi Liu, Jingya Zhang, Haihong Pang, Jiaheng Wen, Yifei Ma, Yu Yao, Chengxi Zhang, Hanrong Zhang, Yankai Chen, Hanan Salam

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) University of Washington Seattle(华盛顿大学西雅图分校) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29887 2026-09-01 cs.CL 新提交

Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

查看计分板:多项选择题评估的计分方案分析

Nishant Balepur, Paiheng Xu, Wei Ai, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29530 2026-09-01 cs.CL cs.AI 新提交

The Emergent Symbolic Structure of Artificial Neural Networks

人工神经网络的涌现符号结构

R. Thomas McCoy, Paul Soulos, Tal Linzen, Paul Smolensky

机构 * Yale University(耶鲁大学) Johns Hopkins University(约翰斯·霍普金斯大学) New York University(纽约大学) Microsoft Research(微软研究院)

AI总结 该研究发现神经网络内部表征隐含符号结构,可通过符号结构近似其向量表征,还能精准干预修改大型语言模型行为,为调和智能的符号概念与现代AI的向量本质提供了新途径。

Comments 30 pages, plus 29 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29480 2026-09-01 cs.SD cs.IR 新提交

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

你在听什么?面向音频-文本大语言模型的时序音乐定位

Kun Fang, Ziyu Wang, Ichiro Fujinaga

机构 * Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院) CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)) Courant Institute, New York University(纽约大学柯朗研究所) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))

AI总结 本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29387 2026-09-01 cs.AI cs.SE 新提交

EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants

EvoGenUI-Bench:评估大型语言模型作为多轮生成式UI助手的性能

Yue Peng, Lanke Xia, Zihan Wang, Jiahao Ye, Ke Ning, Hongyi Wen

机构 * New York University Shanghai(上海纽约大学)

AI总结 本文提出EvoGenUI-Bench多轮生成式UI评估基准,发现现有8个大型语言模型在该基准上轮次通过率最高74.9%、五轮回合完成率仅37.3%,且工具接地任务的跨轮次保留率更低,揭示生成式UI需关注多轮状态同步问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29356 2026-09-01 cs.AI 新提交

Plant-Inspired AI: Plants as Inspiration for Novel Problem Formulations, and Two Case Studies

植物启发的AI:以植物为灵感的新型问题表述及两个案例研究

Deepayan Sanyal, Joel Michelson, Carla E. Cao, Adam B. Roddy, Maithilee Kunda

机构 * New York University(纽约大学) Universidad de Murcia(穆尔西亚大学) University of Edinburgh(爱丁堡大学)

AI总结 本文以植物复杂行为为灵感,提出构建涵盖现有AI框架未关注问题的新型AI框架,并通过叶拟态、根-茎协调生长两个案例提炼计算原理,确定未解决问题,为AI发展提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28974 2026-09-01 cs.AI 新提交

From Analytics to Tumor Boards: An Evidence-Linked Multi-Agent Workflow for Oncology Feature Extraction

从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流

Daniel Kang, Michelle Hu, Soorya Ram Shimgekar, Shayan Vassef, Yufan Wang, Anit Kumar Sahu, Munmun De Choudhury, Vedant Das Swain, Christian Poellabauer, Li Yan Khor, Koustuv Saha, Robert Wojciechowski, Elliot Kidd, Piyum Zonooz, Navin Kumar

机构 * Nimblemind School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) Florida International University(佛罗里达国际大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) Singapore General Hospital(新加坡中央医院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) OncoLens

AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏