arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 170 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 170 篇

2608.23179 2026-08-25 cs.NI cs.AI 新提交 92%

NetConfArena: An Executable Benchmark for LLM Agents in Closed-Loop Network Configuration

NetConfArena:面向闭环网络配置的LLM智能体可执行基准

Chang Liu, Xiaohui Xie, Xinyi Chen, Yong Cui

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出NetConfArena基准,在仿真多设备网络中评估LLM智能体的闭环网络配置能力,发现其失败不限于命令错误,还存在规范遵守等缺陷,为相关研究指明改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23058 2026-08-25 cs.AI 新提交 92%

LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications

基于大语言模型(LLM)的预测与决策智能体:方法、训练、评估及应用

Xiaogang Xu, Jiaqi Tang, Jianmin Chen, Yingying Yan, Zhenchao Tang, Xiangxin Zhou, Xiaobin Hu, Wei Wei, Jinfeng Wu, Qifeng Chen, Lu Zhou, Jiafei Wu, Zhe Liu, Jianwei Yin, Weimin Zheng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述基于LLM的预测智能体的架构、训练与评估方法,分析其局限并介绍多领域应用,指出未来需解决分布偏移校准等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21880 2026-08-25 cs.CL cs.CR 新提交 92%

BanglaVeilGuard: Cross-Script Safety Benchmarking and Lightweight Guardrails for Bangla Large Language Models

BanglaVeilGuard:孟加拉语大语言模型的跨脚本安全基准测试与轻量安全防护措施

Md. Rakibul Hassan, Muhammad Iqbal Hossain

机构 * BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对孟加拉语LLM跨脚本安全评估难题,本文提出BanglaVeilGuard基准与轻量提示防护,可降低攻击成功率,提升不安全请求召回率,但存在方言及带噪良性提示过度拒绝的问题。

Comments Accepted at the 4th International Conference on Computing Advancements (ICCA 2026). 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18492 2026-08-25 cs.DB cs.AI cs.CL cs.SE 版本更新 92%

Vibe Coding on Trial: Operating Characteristics of Unanimous LLM Juries

Vibe Coding on Trial: Unanimous LLM Juries的运行特性

Muhammad Aziz Ullah, Abdul Serwadda

机构 * Texas Tech University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了使用多数LLM陪审团在代码审查中减少假接受的同时保持高准确率的方法,通过基准测试和实验验证了委员会大小和组成对安全性的影响。

Comments Submitted to IEEE International Conference on Semantic Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22529 2026-08-25 cs.SE 新提交 92%

Benchmarking the Titans: A Multi-Dimensional Empirical Evaluation of LLM Code Generation Quality in the.NET Ecosystem

巨头基准测试:.NET生态系统中LLM代码生成质量的多维度实证评估

Seyed Mohammad Mahdi Ghalandarian, Majid Bazargani, Masoumeh Taromirad

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文提出自动化多维度评估框架,针对C#代码生成评估GPT等四个LLM,发现Pass@k排名无法反映LLM在软件工程场景的完整性能概况,还明确了GPT的双峰失败行为。

Comments 12 pages, 8 figures. Accepted at the Second Workshop on Large Language Models for Generative Software Engineering (LLM4SE 2026), co-located with STAF 2026, Rennes, France, June 29 - July 3, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21962 2026-08-25 cs.AR cs.AI 新提交 92%

NoTB: Oracle-Free Triage of LLM-Generated RTL via Cross-Model Formal Consensus

NoTB:基于跨模型形式共识的无需预言机的LLM生成RTL分类

Elisavet Lydia Alvanaki, Je Yang, Biruk Seyoum, Luca P. Carloni

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NoTB是一种无需预言机的LLM生成RTL分类框架,通过多独立LLM族的顺序等价性检查实现跨模型形式共识,在78项CVDP任务上取得高精度,为设计人员提供可调接受规则。

Comments MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10749 2026-08-25 cs.CR cs.AI 版本更新 92%

Toward Secure LLM Agents: Threat Surfaces, Attacks, Defenses, and Evaluation

迈向安全的LLM智能体:威胁面、攻击、防御与评估

Yuchen Ling, Shengcheng Yu, Zhenyu Chen, Chunrong Fang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过生命周期、系统导向的框架,综合247篇论文,围绕信息流、委托权限和持久状态,系统梳理了LLM智能体的威胁面、攻击、防御与评估,指出提示注入和工具控制流劫持仍是主要威胁,持久状态损坏和多智能体传播成为新兴关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22887 2026-08-25 cs.AI cs.CL cs.CY 新提交 91%

Proxy reliance in large language model decisions is uncalibrated to predictive evidence

大语言模型决策中的代理依赖未与预测证据校准

Zengqing Wu, Chuan Xiao

机构 * University of Osaka(大阪大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM决策中代理依赖未与预测证据校准的问题,通过临床排序任务测量四种LLM的因果代理效应,发现依赖程度跟不上证据、社会标签抑制脆弱,且准确率评估无法检测这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23118 2026-08-25 cs.SE 新提交 90%

From Metrics to Improvement: A Lifecycle-Aware LLM Feedback Framework for Research Software Quality

从指标到改进:面向研究软件质量的生命周期感知大语言模型反馈框架

Nafis Tanveer Islam, Nafiseh Soveizi, Yutong Li, Zhiming Zhao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对研究软件质量问题,本文提出生命周期感知的LLM反馈框架,结合定量质量评估与迭代式LLM代码优化,实验验证其可改善代码重复等质量属性,同时揭示相关质量维度间的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22295 2026-08-25 cs.CL cs.AI cs.LG 新提交 90%

LLM Evaluation on Unseen Questions: Contextual Multidimensional IRT Model

针对未见问题的大语言模型评估:上下文多维项目反应理论模型

Ergan Shang, Weijing Tang, Yinqiu He

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Madison(麦迪逊大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出结合多维项目反应理论模型与问题上下文的LLM评估框架,可预测模型在未见问题上的表现,场景内评估效果优于无模型基线,但跨场景泛化仍为核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12295 2026-08-25 cs.CL cs.AI cs.LG 版本更新 90%

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

Text-ADBench:基于大语言模型嵌入的文本异常检测基准

Feng Xiao, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08846 2026-08-25 cs.CY cs.AI cs.CL cs.LG 版本更新 90%

AI University: An LLM-Powered Learning Assistant for Engineering---A Finite Element Method Case Study

AI University:一款面向工程领域的大语言模型驱动学习助手——以有限元法案例研究为例

Mostafa Faghih Shojaei, Rahul Gulati, Benjamin A. Jasperson, Shangshang Wang, Simone Cimolato, Manas Vardhan, Dangli Cao, Willie Neiswanger, Krishna Garikipati

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出AI-U框架,结合微调LLM、RAG与推理合成模型,以FEM课程为案例开发学习助手,经多维度评估其对齐度优于基础模型,可推广至STEM领域。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04806 2026-08-25 cs.LG cs.AI cs.CL 版本更新 90%

NeST: Neighborhood-aware semantic alignment and temporal modulation for LLM based time series forecasting

NeST:面向基于大语言模型的时间序列预测的邻域感知语义对齐与时间调制

Jayanie Bogahawatte, Sachith Seneviratne, Maneesha Perera, Saman Halgamuge

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeST框架通过邻域感知语义对齐与时间调制构建文本整合提示词微调LLM,在8个基准及9个真实光伏数据集的时间序列预测中,MSE、R²等指标优于现有方法,泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21423 2026-08-25 cs.CL cs.AI cs.CR cs.MA 新提交 90%

Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing

智能体安全:LLM驱动渗透测试的工具、失效模式与设计法则体系化研究

Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) BRAC University(BRAC大学) North South University(北南大学) Missouri State University(密苏里州立大学) Multimedia University(多媒体大学) American International University-Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究对LLM驱动渗透测试的智能体安全相关工具、失效模式等体系化,推导定量规律与设计法则,实现Inspectra平台验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 90%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23395 2026-08-25 cs.MA cs.AI cs.SE 新提交 90%

Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep

增值税判定(VAT Determination)中大型语言模型智能体(LLM-Agent)分解的规模适配:一项试点控制扫描研究

Pedro Santos

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本试点研究在带反向收费的跨境增值税判定场景中,对比不同LLM智能体分解配置,发现中间配置准确率领先但未达标准,提出分解规模适配启发式方法并发布相关资源。

Comments 29 pages, 4 figures. Code, data, and traces: this https URL (https://github.com/pedro-santos-eng/Right-sizing-LLM-agent-decomposition-in-VAT-determination)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21531 2026-08-25 cs.SE 新提交 90%

Large Language Models for Requirements Engineering: A Cross-Task Empirical Evaluation

用于需求工程的大语言模型:跨任务实证评估

Jacek Dąbrowski, Manjeshwar Aniruddh Mallya, Alessio Ferrari, Mohammad Amin Zadenoori, Yijun Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过两项互补实证研究,开展首个涵盖五项需求工程相关活动的大语言模型跨任务实证评估,明确其性能高度依赖任务,为LLMs在RE中的实际应用提供复现材料与能力认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-08-25 cs.LG cs.AI cs.CL stat.ML 版本更新 90%

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 26 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21559 2026-08-25 cs.CL 新提交 90%

Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline

受控退化下的证据状态可靠性:多阶段大语言模型(LLM)流水线中的解析器有效性偏差

Naimur Rahman

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对多阶段LLM流水线提出证据状态可靠性评估框架,发现受控退化下结构符合性可改善但证据敏感的阶段成功会恶化,且退化证据的检测与恢复存在偏差。

Comments 32 pages, 4 figures, 6 tables. Code and reproducibility materials: this https URL (https://github.com/NaimurRahmanR/evidence-state-reliability)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-25 cs.AI cs.CL cs.IR q-bio.QM 版本更新 90%

Framework for Grounding Healthcare LLMs in a Causal Knowledge Graph: A Cardiovascular Example Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23282 2026-08-25 cs.SE 新提交 89%

From Natural Language Policies to Executable Obligations: A Verification Harness for Dependable In-Car LLM Agents

从自然语言策略到可执行义务:面向可靠车载大语言模型智能体的验证工具

Radouane Bouchekir, Damir Safin, Tomas Bueno Momcilovic

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出AgentGuardUtil工具,将车载LLM智能体纳入验证-修正循环,通过运行时策略编译器和25个确定性门等机制,保障智能体满足车载操作策略,提升任务可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22459 2026-08-25 cs.HC 新提交 89%

"I want to be pushed, I want to grow": Enabling social workers to design evaluations of LLM augmentation in their work

“我想要被推动,我想要成长”:让社会工作者能够设计工作中大型语言模型(LLM)增强的评估方案

Anna Kawakami, Chloe Qianhui Zhao, Renee Shelby, Fernando Diaz, Haiyi Zhu, Kenneth Holstein

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究提出工作者驱动的AI测量方法,通过与19名校社工作者开展8场研讨会,设计LLM评估基准,验证其可区分6种先进LLM性能,该方法可作为自上而下AI评估的补充。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-08-25 cs.SE cs.CR 版本更新 89%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22068 2026-08-25 cs.AI cs.CE 新提交 89%

Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays

面向地热井阵列的大型语言模型决策支持与建模

Edwin Ouko, Emmanuel Lujan, Alan Edelman, Robert Metcalfe

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT等前沿LLMs在地热领域的应用潜力,提出用NotebookLM加速生成地热基准,分析地热井阵列等技术的机遇,还展示了LLMs助力地热数值模型自动并行化的案例。

Comments 10 pages, 8 figures. Presented at the 50th Workshop on Geothermal Reservoir Engineering, Stanford University, February 10-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05346 2026-08-25 cs.AI 版本更新 89%

Beyond Benchmarking: Scenario-Based Evaluation of Large Language Models for Personalized Learning

超越基准测试:面向个性化学习的大语言模型场景化评估

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出场景化评估框架,以Gemini为外部评估器结合Bradley-Terry模型等,发现不同LLMs在个性化学习场景中教学行为存在差异,为AI增强教育提供有意义的模型行为信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22432 2026-08-25 cs.CL cs.AI 新提交 89%

Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator

多语言大语言模型评判器中的排名反转:一种无标签双中心化校准器

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

专题命中 评测与基准 :LLM(title,summary_cn);language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言LLM评判器因提示语言导致排名反转的问题,提出无标签共识校准法(CBC),可提升排名一致性及与人工偏好的契合度,验证了其下游实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22335 2026-08-25 cs.CL cs.AI 新提交 89%

Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms

寄存器偏移破坏大语言模型安全:具有文化相关危害的孟加拉语基准测试

Naymul Islam, Nusrat Jahan Lia, Shubhashis Roy Dipta, Sabik Bin Sultan, Abdullah Khan Zehady

机构 * Institute of Information Technology, University of Dhaka(达卡大学信息技术学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bangladesh Air Force Shaheen College Kurmitola(孟加拉国空军库尔米托拉沙欣学院) Ciroos Inc.(Ciroos公司)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉语LLM安全评估的英语中心偏差问题,构建含879个提示的BanglaSafe基准,发现写作风格对有害请求成功率的影响最大,且现有安全分类器难以评估孟加拉语内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23005 2026-08-25 cs.CY 新提交 89%

Large language models simulate intersectional synthetic identities with a budget of one to two dimensions

大型语言模型以1至2个维度的预算模拟交叉合成身份

Virgile Rennard, Christos Xypolopoulos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 该研究针对皮尤美国趋势调查面板数据,发现大型语言模型模拟交叉身份时,其响应未呈现真实身份的加总特性,且会系统性舍弃种族、宗教等关键驱动因素,仅能单次代表单一身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21504 2026-08-25 cs.LG 新提交 89%

ChemDIRT: A Diversified Instruction, Representation, and Task Benchmark for Robust Chemistry-LLM Evaluation

ChemDIRT:面向稳健化学大语言模型评估的多样化指令、表示与任务基准

Eric Inae, Tim Gunn, Chris Bond, Meng Jiang

机构 * University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对现有化学LLM评估基准的局限性,提出ChemDIRT基准,涵盖八大类化学任务,评估模型在指令和分子表示变化下的准确性与一致性,测试发现LLM存在提示敏感性、表示依赖及任务间性能不均问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21382 2026-08-25 cs.AI 新提交 89%

There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items

不存在中立的评估框架:现代大语言模型排行榜由对配置敏感的项目生成

V.S. Raghu Parupudi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出敏感性网格,发现评估框架的配置差异使LLM分数呈区间变化,配置敏感项目承载模型间大部分分数差,且框架可决定排行榜排名,压缩方法保留此类项目。

Comments 25 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏