Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment
视觉模型通过有限的神经对齐预测城市场景评价
机构 * New York University(纽约大学)
AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。
高校专区
视觉模型通过有限的神经对齐预测城市场景评价
机构 * New York University(纽约大学)
AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。
视觉医学基础模型的不确定性
机构 * Center for Data Science, New York University(纽约大学数据科学中心) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)
AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。
TAKE 85:基于85小时电影时长的电影创作者意图测试基准
机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) ; New York University(纽约大学) ; Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) ; Stony Brook University(石溪大学)
AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。
小型语言模型作为基于 rubric 的强化学习的评判者
机构 * New York University(纽约大学) ; Yale University(耶鲁大学)
AI总结 该研究构建了两个基于 rubric 的评估数据集,对比三种提取标准级评判的方法,发现 Qwen3-1.7B 探针评判者表现最优,用作 GRPO 奖励模型时训练效率优于 8B 生成式评判者基线。
Comments 9 pages, 1 figure; EMNLP 2026 Findings
AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制
机构 * New York University(纽约大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校) ; University of Washington Seattle(华盛顿大学西雅图分校) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。
Comments EMNLP 2026 Findings
VibeJam:用于智能体辅助Web开发的用户研究平台
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。
Comments EMNLP 2026 (Demo)
查看计分板:多项选择题评估的计分方案分析
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Nanyang Technological University(南洋理工大学)
AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。
Comments EMNLP 2026
人工神经网络的涌现符号结构
机构 * Yale University(耶鲁大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; New York University(纽约大学) ; Microsoft Research(微软研究院)
AI总结 该研究发现神经网络内部表征隐含符号结构,可通过符号结构近似其向量表征,还能精准干预修改大型语言模型行为,为调和智能的符号概念与现代AI的向量本质提供了新途径。
Comments 30 pages, plus 29 pages of references and appendices
你在听什么?面向音频-文本大语言模型的时序音乐定位
机构 * Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院) ; CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)) ; Courant Institute, New York University(纽约大学柯朗研究所) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))
AI总结 本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。
面向潜在语言模型技能的引导与优化:一项实证研究
机构 * New York University(纽约大学) ; Adobe Research(奥多比研究院) ; UC San Diego(加州大学圣迭戈分校)
AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。
EvoGenUI-Bench:评估大型语言模型作为多轮生成式UI助手的性能
机构 * New York University Shanghai(上海纽约大学)
AI总结 本文提出EvoGenUI-Bench多轮生成式UI评估基准,发现现有8个大型语言模型在该基准上轮次通过率最高74.9%、五轮回合完成率仅37.3%,且工具接地任务的跨轮次保留率更低,揭示生成式UI需关注多轮状态同步问题。
植物启发的AI:以植物为灵感的新型问题表述及两个案例研究
机构 * New York University(纽约大学) ; Universidad de Murcia(穆尔西亚大学) ; University of Edinburgh(爱丁堡大学)
AI总结 本文以植物复杂行为为灵感,提出构建涵盖现有AI框架未关注问题的新型AI框架,并通过叶拟态、根-茎协调生长两个案例提炼计算原理,确定未解决问题,为AI发展提供新方向。
从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流
机构 * Nimblemind ; School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) ; NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) ; Florida International University(佛罗里达国际大学) ; Duke-NUS Medical School(杜克-新加坡国立大学医学院) ; Singapore General Hospital(新加坡中央医院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; OncoLens
AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。