arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 2541
2609.04174 2026-09-04 cs.CV 新提交

Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations

基于3D基础模型场景表示的零样本新视角深度合成

Denis M. Akola, David F. Fouhey

机构 * New York University(纽约大学) Tandon School of Engineering(坦登工程学院) Courant Institute of Mathematical Sciences(柯朗数学科学研究所)

AI总结 该研究提出基于3D基础模型的Z3D方法,通过对其内部表示做潜在扩散,实现零样本下多数据集新视角真实感深度图的预测。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://akola-mbey-denis.github.io/Z3D-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04134 2026-09-04 cs.LG cs.NE q-bio.NC 新提交

Prospective Coding Improves Learning in Deep Continuous-Time Recurrent Networks

前瞻性编码改善深度连续时间循环网络的学习效果

Shivang Rawat, Mirko Morello, Flaviano Morone, David J. Heeger

机构 * Telepath New York University(纽约大学)

AI总结 该研究开发递归正交滤波器(RQFs)并提出前瞻性输入编码修正,缓解深度连续时间循环网络的梯度衰减,在语音命令等任务上取得优异性能,验证了其参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04127 2026-09-04 cs.AI 新提交

Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable

LLM推荐的认知保证:当真实值不可用时表征依赖的基础

Shai Vardi, João Sedoc

机构 * University of South Florida(南佛罗里达大学) Muma College of Business(马玛商学院) New York University(纽约大学)

AI总结 针对LLM推荐缺乏可靠依赖依据的问题,引入认知保证构造并通过四级依赖证书实现,经验证其能有效表征LLM推荐的依赖基础,与置信度、决策难度无关。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04108 2026-09-04 cs.CL cs.AI cs.LG 新提交

Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

顺序式优于联合式:论在线蒸馏与可验证奖励强化学习的相互作用

Boyan Li, Bingsen Chen, Chenghao Yang, Ping Nie, Chen Zhao, Xi Ye

机构 * New York University(纽约大学) University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学) NYU Shanghai(纽约大学上海分校) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

AI总结 该研究提出OPD-then-RL的两阶段方案,在逻辑与数学推理基准上优于纯OPD、纯RLVR及联合基线,为结合两种后训练方法提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03800 2026-09-04 cs.AI cs.HC 新提交

Govern the Model, Not Only the Data: Storage, Circulation, and Learning in Creative AI

管控模型,而非仅管控数据:创意人工智能中的存储、流通与学习

Phoenix Perry, George Simms, Elizabeth Wilson, Yasmine Boudiaf, Nick Bryan-Kinns, Tega Brain, R. Luke DuBois, Alix Rule, Rachel Meade Smith, Kelani Nichole, Atharva Pravin Pawar, Rebecca Fiebrink

机构 * University of the Arts London(伦敦艺术大学) New York University(纽约大学)

AI总结 该研究指出联邦学习未解决创意AI的管控问题,提出创意数据公地的四项设计原则,以实现对模型及联邦的管控而非仅对数据的管控。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03630 2026-09-04 cs.RO 新提交

Local Path Planning and Obstacle Avoidance for an Omnicopter Platform

全向多旋翼无人机(omnicopter)平台的局部路径规划与避障

Mikolaj Helinski, Spilios Theodoulis, Mahmoud Hamandi, Abdullah Mohamed Ali, Anthony Tzes, Marija Popovic

机构 * Faculty of Aerospace Engineering, Delft University of Technology(代尔夫特理工大学航空航天工程学院) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Center for Artificial Intelligence and Robotics, New York University Abu Dhabi(纽约大学阿布扎比分校人工智能与机器人中心)

AI总结 本文针对全向多旋翼无人机,将动态窗口法扩展为6D-DWA并引入敏捷模式,实现了实时局部规划与避障,仿真验证其路径跟踪精度及避障性能良好。

Comments 8 pages, accepted paper at ICUAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03148 2026-09-04 cs.CL 新提交

Large Language Models in Resolving Contextual Knowledge Conflicts

大语言模型在解决上下文知识冲突中的应用

Xinye Yang, Zhenyang Liu, Ruisi Li, Yuanyuan Lei

机构 * Northwestern University(西北大学) New York University(纽约大学) University of Florida(佛罗里达大学)

AI总结 该研究针对上下文知识内部的冲突,构建了ContextConflict数据集,分析9种LLM的冲突处理能力,揭示其偏向早期证据的偏差,并提出无训练无标签的引导方法提升冲突解决效果。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30068 2026-09-04 cs.CV 版本更新

TAKE 85: Testing Audiovisual filmmaKer's intEnt across 85 Hours of Film

TAKE 85:基于85小时电影时长的电影创作者意图测试基准

Kaishuu Shinozaki-Conefrey, Olivier Pascaud, Robin Courant, Xi Wang, Dimitris Samaras, Vicky Kalogeiton

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎综合理工学院LIX实验室、巴黎IP大学) New York University(纽约大学) Ecole nationale supérieure Louis-Lumière(路易卢米耶高等国家学院) Stony Brook University(石溪大学)

AI总结 本文推出首个导演意图理解基准TAKE 85,通过实验发现当前顶尖MLLMs在感知识别与意图理解间存在显著差距,最强模型仅得58分,单一模态无法支撑意图理解。

Comments Accepted at the ECCV 2026 2nd Workshop on Benchmarking Evidence-Aligned Multimodal Reasoning. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_take85_shinozaki/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28974 2026-09-04 cs.AI 版本更新

From Analytics to Tumor Boards: An Evidence-Linked Multi-Agent Workflow for Oncology Feature Extraction

从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流

Daniel Kang, Michelle Hu, Soorya Ram Shimgekar, Shayan Vassef, Yufan Wang, Anit Kumar Sahu, Munmun De Choudhury, Vedant Das Swain, Christian Poellabauer, Li Yan Khor, Koustuv Saha, Robert Wojciechowski, Elliot Kidd, Piyum Zonooz, Navin Kumar

机构 * Nimblemind School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) Florida International University(佛罗里达国际大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) Singapore General Hospital(新加坡中央医院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) OncoLens

AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16718 2026-09-04 cs.CL 版本更新

Arabic Morphosyntactic Tagging and Dependency Parsing with Large Language Models

阿拉伯词法句法标注与依赖解析中的大语言模型

Mohamed Adel, Bashar Alhafni, Nizar Habash

机构 * Computational Approaches to Modeling Language Lab(语言建模方法计算实验室) New York University Abu Dhabi(纽约大学阿布扎克分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文评估了大语言模型在阿拉伯语词法句法标注和依赖解析任务中的表现,发现提示设计和示例选择对性能影响显著,专有模型在特征层面标注接近监督基线,且在依赖解析中具有竞争力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02864 2026-09-03 cs.CV 新提交

Thinking in Pictures: A Systematic Benchmark for Reasoning-driven Image Generation

图像中的思考:推理驱动图像生成的系统基准

Yutong Liu, Nan Huang, Xu Cao, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

AI总结 该研究针对现有生成模型存在的推理-生成差距问题,提出包含2000个样本的RIG-BENCH基准,评估四类认知任务下的推理驱动图像生成,为下一代逻辑型生成模型开发提供诊断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01625 2026-09-03 cs.SI cs.CL cs.CY 新提交

Whose Judgments Count? Representation Gaps in Crowdsourced Content Moderation Produce Unequal Protection from Perceived Toxicity

谁的判断算数?众包内容审核中的代表性差距导致对感知毒性的保护不平等

Zhaodi Chen, Byungkyu Lee

机构 * University of South Carolina(南卡罗来纳大学) New York University(纽约大学)

AI总结 该研究结合大规模判断数据与反事实模拟,发现众包内容审核存在同群体保护模式,审核员人口构成会导致对感知毒性的保护不平等,黑人及LGB群体需远超其人口占比的代表才能获平等保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02746 2026-09-03 physics.chem-ph cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 新提交

HiPoly: a hierarchical polymer-native AI framework for property prediction and generative design

HiPoly:用于性能预测与生成式设计的聚合物原生分层AI框架

Ge Sun, Gervasio Zaldivar, Yuan Tian, Gustavo Perez Lemus, Juhae Park, Dasha Safarian, Ming Han, Juan J. de Pablo

机构 * New York University(纽约大学) University of Chicago(芝加哥大学) Peking University(北京大学)

AI总结 HiPoly是基于G2RINS的分层聚合物原生AI框架,可处理完整聚合物描述,实现从配方数据到性能预测、生成式设计及物理验证的端到端工作流,在多组分聚合物热性能预测中达最优精度,能加速可持续聚合物替代物发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19128 2026-09-03 cs.LG 版本更新

One Model, Many Graphs: Learning over Attributed Graphs across Heterogeneous Modalities with Vision-Language Models

一个模型,多种图:使用视觉语言模型在异构模态的属性图上进行学习

Jiayi Yang, Yifang Chen, Yuanfu Sun, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(纽约大学上海分校) New York University(纽约大学)

AI总结 研究利用视觉语言模型解决属性图模态异质性问题,提出OMG-VLM框架,以预训练VLM为共享主干,引入结构感知图适配器,在节点分类和链接预测等任务中表现出色,优于现有基线且泛化能力强。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12406 2026-09-03 cs.AI 版本更新

Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions

隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南政法大学)

AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30930 2026-09-03 cs.HC cs.AI cs.CL cs.CY 版本更新

TUX: Measuring Human--AI Tacit Understanding

TUX:衡量人机默契理解

Yueshen Li, Hanyi Min, Vedant Das Swain, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University(纽约大学)

AI总结 通过光谱放置任务和TUX指数,量化人类与LLM之间的默契理解,发现人格特征影响对齐程度。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24497 2026-09-03 cs.AI cs.LG cs.RO stat.ML 版本更新

What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?

在联合嵌入预测世界模型中成功因素是什么?

Basile Terver, Tsung-Yen Yang, Jean Ponce, Adrien Bardes, Yann LeCun

机构 * Meta FAIR Inria Paris(巴黎理工院) Ecole normale supérieure / PSL(巴黎高等师范学院 / PSL) New York University(纽约大学)

AI总结 本文研究了在物理规划中使用联合嵌入预测世界模型(JEPA-WMs)的成功因素,通过分析模型架构、训练目标和规划算法对规划成功的影响,提出了一种在导航和操作任务中优于现有基线方法的模型。

Comments V2 of the article: - Added AdaLN-zero - Added table comparing JEPA-WMs with baselines with std translating per-seed variability only, no variability across epochs - Reordered figures in main body of the paper V3: added data scaling experiments, theoretical appendix section on autoregressive rollout, acceptance at TMLR V4: Added funding acknowledgements for Jean Ponce

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00658 2026-09-02 cs.CV 新提交

Teaching Vision-Language Models to Use the Scale They Are Given: Label-Free Equivariance Training for Metric Physical Reasoning

教视觉-语言模型使用给定的尺度:用于度量物理推理的无标签等变训练

Kaizhen Tan, Yang Feng, Heqing Du, Siru Tao, Xin Xu, Hanzhe Hong

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究针对视觉-语言模型在度量物理推理中利用尺度信息不足的问题,提出无标签等变训练方法EquiSD,通过利用物理对称性实现无监督微调,提升了模型的度量接地能力与跨尺度泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00649 2026-09-02 cs.CV 新提交

You Cannot Photograph the Same Street Twice: Reliability Limits in Vision-Language Measurement of Urban Change

你无法两次拍摄同一条街道:城市变化的视觉-语言测量中的可靠性极限

Kaizhen Tan

机构 * New York University(纽约大学)

AI总结 该研究揭示用视觉-语言模型测量城市变化时,同一条街道重拍会使感知分数平均变0.80分,单个样本点不可靠但数百对观测聚合后可得到可靠重建信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00207 2026-09-02 cs.CL 版本更新

Bridging the English-Arabic Medical Knowledge Gap: Targeted Low-Rank Adaptation via Causal Layer Selection

缩小英阿医学知识鸿沟:通过因果层选择实现针对性低秩适配

Chaimae Abouzahir, Musa Khan, Hala Ali-Hassan, Congbo Ma, Khaled Saleh, Yousra Sadqi, Jihad Mallat, Walid Al-Eisawi, Nizar Habash, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Cleveland Clinic Abu Dhabi(克利夫兰诊所阿布扎比分校)

AI总结 该研究针对阿拉伯语医学LLMs性能弱于英文的问题,提出TLoRA方法并构建阿拉伯医学对话基准,通过机制诊断实现针对性适配,提升了阿拉伯语医学任务性能。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19719 2026-09-02 cs.IR cs.CL cs.LG 版本更新

Closing the Operational Gap in Semantic Caching

缩小语义缓存中的校准差距

Aditeya Baral, Radoslav Ralev, Iliya Sotirov Zhechev, Srijith Rajamohan, Jen Agarwal

机构 * New York University(纽约大学) Redis(Redis公司)

AI总结 针对语义缓存系统中离线指标与部署性能的差距,提出P-CHR AUC和CRR指标,发现校准差距由训练目标主导,模型选择本质是校准问题。

Comments 24 pages, 2 figures. Source code: https://github.com/aditeyabaral/operational-gap-semantic-caching. Models and Datasets: https://huggingface.co/redis. Accepted at EMNLP 2026, Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26087 2026-09-02 stat.ML cs.LG 版本更新

DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking

DiscoverPhysics: 基准测试LLMs的即用型科学思维

Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro

机构 * Princeton University(普林斯顿大学) Boston University(波士顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所) Institute for Advanced Studies(高级研究研究所)

AI总结 提出DiscoverPhysics交互式基准,通过让LLM代理探索物理定律偏离现实的模拟世界,评估其设计实验、修正假设和发现物理规律的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16792 2026-09-02 cs.CV cs.AI 版本更新

V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising

V-Co:通过去噪更深入地审视视觉表示对齐

Han Lin, Xichen Pan, Zun Wang, Yue Zhang, Chu Wang, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NYU(纽约大学) Meta AI2(人工智能研究院)

AI总结 本文通过统一的JiT框架系统研究视觉去噪,揭示了四个关键要素:双流架构、结构化无条件预测、感知漂移混合损失和特征重缩放,从而在ImageNet-256上实现更高效的生成模型。

Comments Accepted by ECCV 2026. code: https://github.com/HL-hanlin/V-Co

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01480 2026-09-02 stat.ML cs.LG stat.AP 版本更新

Modeling Information Blackouts in Missing Not-At-Random Time Series Data

缺失非随机时间序列数据中的信息黑区建模

Aman Sunesh, Allan Ma, Siddarth Nilol

机构 * New York University(纽约大学)

AI总结 本文提出了一种基于潜在状态空间框架的建模方法,用于处理缺失非随机时间序列数据中的信息黑区问题,通过联合建模交通动态和传感器停机,提高了交通预测的准确性。

Comments 16 pages, 5 figures, 9 tables. Revised and substantially expanded version for AALTD 2026 (ECML-PKDD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30964 2026-09-01 cs.CV 新提交

Vision Models Predict Urban Scene Appraisal with Limited Neural Alignment

视觉模型通过有限的神经对齐预测城市场景评价

Kaizhen Tan, Yuantao Deng

机构 * New York University(纽约大学)

AI总结 该研究通过脑电数据测试视觉模型预测城市场景评价的能力,发现预测评价与神经表征对应性弱,为评估视觉模型的场景表征一致性提供了仅需55张图像嵌入的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30390 2026-09-01 cs.LG 新提交

Uncertainty of Vision Medical Foundation Models

视觉医学基础模型的不确定性

Haoxu Huang, Narges Razavian

机构 * Center for Data Science, New York University(纽约大学数据科学中心) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Department of Population Health, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院人口健康系)

AI总结 本研究对比特定领域与通用领域视觉基础模型,探究预训练方式等对不确定性量化的影响,发现特定领域预训练结合自监督学习可提升校准效果,特定领域模型能实现更高效共形预测,强调需整合点与区域预测以增强医疗AI可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30005 2026-09-01 cs.CL 新提交

Small Language Models as Judges for Rubric-Based Reinforcement Learning

小型语言模型作为基于 rubric 的强化学习的评判者

Fengyu Xie, Yilun Zhao, Bingsen Chen, Arman Cohan, Chen Zhao

机构 * New York University(纽约大学) Yale University(耶鲁大学)

AI总结 该研究构建了两个基于 rubric 的评估数据集,对比三种提取标准级评判的方法,发现 Qwen3-1.7B 探针评判者表现最优,用作 GRPO 奖励模型时训练效率优于 8B 生成式评判者基线。

Comments 9 pages, 1 figure; EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29988 2026-09-01 cs.AI 新提交

AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning

AutoCRAT:针对大语言模型推理的轨迹内随机性与计算量联合控制

Hanjun Luo, Qiushi Liu, Jingya Zhang, Haihong Pang, Jiaheng Wen, Yifei Ma, Yu Yao, Chengxi Zhang, Hanrong Zhang, Yankai Chen, Hanan Salam

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) University of Washington Seattle(华盛顿大学西雅图分校) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 AutoCRAT是针对大语言模型推理的轨迹内随机性与计算量联合控制方法,仅在语义边界更新决策,在6个基准上减少推理令牌并提升准确率,且跨主干迁移性强。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29887 2026-09-01 cs.CL 新提交

Check The Scoreboard: An Analysis of Scoring Schemes on Multiple-Choice Evaluation

查看计分板:多项选择题评估的计分方案分析

Nishant Balepur, Paiheng Xu, Wei Ai, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究分析6种教育启发式计分方案对MCQA评估的影响,发现其可改变31个LLM的排名、更准确预测用户偏好,并揭示不同模型能力,还探讨了方案向其他任务的扩展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏