Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment
视觉模型通过有限的神经对齐预测城市场景评价
机构 * New York University(纽约大学)
AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。
高校专区
视觉模型通过有限的神经对齐预测城市场景评价
机构 * New York University(纽约大学)
AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。
视觉医学基础模型的不确定性
机构 * Center for Data Science, New York University(纽约大学数据科学中心) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)
AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。
TAKE 85:基于85小时电影时长的电影创作者意图测试基准
机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) ; New York University(纽约大学) ; Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) ; Stony Brook University(石溪大学)
AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。
小型语言模型作为基于 rubric 的强化学习的评判者
机构 * New York University(纽约大学) ; Yale University(耶鲁大学)
AI总结 该研究构建了两个基于 rubric 的评估数据集,对比三种提取标准级评判的方法,发现 Qwen3-1.7B 探针评判者表现最优,用作 GRPO 奖励模型时训练效率优于 8B 生成式评判者基线。
Comments 9 pages, 1 figure; EMNLP 2026 Findings
AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制
机构 * New York University(纽约大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校) ; University of Washington Seattle(华盛顿大学西雅图分校) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。
Comments EMNLP 2026 Findings
VibeJam:用于智能体辅助Web开发的用户研究平台
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。
Comments EMNLP 2026 (Demo)
查看计分板:多项选择题评估的计分方案分析
机构 * University of Maryland(马里兰大学) ; New York University(纽约大学) ; Nanyang Technological University(南洋理工大学)
AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。
Comments EMNLP 2026
人工神经网络的涌现符号结构
机构 * Yale University(耶鲁大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; New York University(纽约大学) ; Microsoft Research(微软研究院)
AI总结 该研究发现神经网络内部表征隐含符号结构,可通过符号结构近似其向量表征,还能精准干预修改大型语言模型行为,为调和智能的符号概念与现代AI的向量本质提供了新途径。
Comments 30 pages, plus 29 pages of references and appendices
你在听什么?面向音频-文本大语言模型的时序音乐定位
机构 * Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院) ; CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)) ; Courant Institute, New York University(纽约大学柯朗研究所) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))
AI总结 本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。
面向潜在语言模型技能的引导与优化:一项实证研究
机构 * New York University(纽约大学) ; Adobe Research(奥多比研究院) ; UC San Diego(加州大学圣迭戈分校)
AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。
EvoGenUI-Bench:评估大型语言模型作为多轮生成式UI助手的性能
机构 * New York University Shanghai(上海纽约大学)
AI总结 本文提出EvoGenUI-Bench多轮生成式UI评估基准,发现现有8个大型语言模型在该基准上轮次通过率最高74.9%、五轮回合完成率仅37.3%,且工具接地任务的跨轮次保留率更低,揭示生成式UI需关注多轮状态同步问题。
植物启发的AI:以植物为灵感的新型问题表述及两个案例研究
机构 * New York University(纽约大学) ; Universidad de Murcia(穆尔西亚大学) ; University of Edinburgh(爱丁堡大学)
AI总结 本文以植物复杂行为为灵感,提出构建涵盖现有AI框架未关注问题的新型AI框架,并通过叶拟态、根-茎协调生长两个案例提炼计算原理,确定未解决问题,为AI发展提供新方向。
从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流
机构 * Nimblemind ; School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) ; NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) ; Florida International University(佛罗里达国际大学) ; Duke-NUS Medical School(杜克-新加坡国立大学医学院) ; Singapore General Hospital(新加坡中央医院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; OncoLens
AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。
BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。
Comments Submitted to IEEE Access for review
教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益
机构 * Stanford University(斯坦福大学) ; New York University(纽约大学)
AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。
Comments 8/28 update: added funding acknowledgements
随机化 YaRN 提升长上下文推理的长度泛化能力
机构 * New York University(纽约大学)
AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。
Comments EMNLP 2026 Findings
跨体裁与标点条件下的阿拉伯语句子分割
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) ; New York University Abu Dhabi(纽约大学阿布扎比分校)
AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。
Comments Accepted to EMNLP Findings 2026
通过地标加速向量扩散图
机构 * Department of Mathematics, National Taiwan University, Taipei, 106, Taiwan(台湾大学数学系) ; National Center for Theoretical Sciences, Mathematics Division, Taipei, 106, Taiwan(理论科学国家中心数学组) ; Courant Institute of Mathematical Sciences, New York University, New York, NY, 10012 USA(纽约大学数学科学学院) ; Data Science Degree Program, National Taiwan University(台湾大学数据科学学士学位计划)
AI总结 本文提出LA-VDM算法,通过两阶段归一化加速基于图连接拉普拉斯的向量扩散图框架,有效处理数据和地标集的非均匀采样密度,通过流形模型恢复平行运输,提升连接拉普拉斯的收敛性。
不同的人口统计线索导致对LLM个性化和偏见的结论不一致
机构 * World Bank(世界银行) ; University of Oxford(牛津大学) ; New York University(纽约大学) ; University of Pennsylvania(宾夕法尼亚大学) ; LMU Munich(慕尼黑大学) ; Allen Institute for AI(人工智能研究院)
AI总结 研究通过1480万个提示测试了人口统计线索对LLM响应的影响,发现同一群体的不同线索导致响应变化不一致,偏见结论不稳定,揭示了身份线索与语言信号的关系。
Comments Accepted to EMNLP 2026 (Main Conference)
EquiReg:等变正则化扩散用于逆问题
机构 * University of Alberta(阿尔伯塔大学) ; Alberta Machine, Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) ; Neuroscience and Mental Health Institute, University of Alberta(阿尔伯塔大学神经科学与心理健康研究所) ; New York University(纽约大学) ; California Institute of Technology(加州理工学院) ; University of Oxford(牛津大学)
AI总结 EquiReg通过正则化扩散模型提升逆问题求解,有效引导采样向保持对称性的区域,提升图像修复和偏微分方程求解质量。