arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2605.24719 2026-05-26 cs.CL cs.AI 87%

World-State Transformations for Neuro-symbolic Interactive Storytelling

世界状态转换用于神经符号交互式故事讲述

Santiago Góngora, Luis Chiruzzo, Gonzalo Méndez, Pablo Gervás

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探索在神经符号架构中利用LLM预测规则系统中的世界状态转换,以解决纯LLM方法的故事连贯性问题,并通过实验表明该方法能保持世界状态一致性并促进玩家创造性输入。

Comments To be presented at the 17th International Conference on Computational Creativity (ICCC'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24211 2026-05-26 cs.CL cs.AI 87%

Teaching Through Analogies: A Modular Pipeline for Educational Analogy Generation

通过类比教学:教育类比生成的模块化流水线

Mariam Barakat, Ekaterina Kochmar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个模块化流水线,将教育类比生成分解为四个阶段,基于结构映射理论,评估12个LLM在两个数据集上的表现,发现子概念显著提升解释质量和封闭检索精度,并引入LLM作为评判的评估方法。

Comments 36 pages, 25 figures. To appear in Proceedings of the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21132 2026-05-22 cs.CR cs.AI cs.LG cs.PL 87%

AutoBaxBuilder: Bootstrapping Code Security Benchmarking

AutoBaxBuilder: 通过代码安全基准测试进行代码安全性评估

Tobias von Arx, Niels Mündler, Mark Vero, Maximilian Baader, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·奥赫里德斯基")

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoBaxBuilder,一种自动化生成代码安全基准测试任务的流水线,通过结合LLM的代码理解能力与可靠性检查,构建功能测试和端到端的安全性探测利用,从而提高代码安全性的评估效率和准确性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19815 2026-05-20 cs.CL cs.AI 87%

LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

LP-Eval: 用于衡量法律命题生成质量的评估标准和数据集

Shanshan Xu, Johan Lindholm, Amogh Raina, Henrik Palmer Olsen, Daniel Hershcovich

机构 * University of Copenhagen(哥本哈根大学) Umeå University(乌梅拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LP-Eval,一种与法律专家共同设计的三步评估标准,用于评估法律命题的质量,通过专家标注的100个LLM生成的法律命题数据集,展示了LLM生成的命题质量较高,但专家评估发现基于经典案例的命题质量更高,同时发现基于评估标准的LLM判断更接近专家评估,但缺乏对细粒度区别的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10102 2026-05-19 cs.IR cs.AI cs.CL 87%

Trustworthiness in Retrieval-Augmented Generation Systems: A Survey

检索增强生成系统中的可信度:综述

Yujia Zhou, Wenbo Zhang, Jingying Shao, Yan Liu, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Zheng Liu, Chaozhuo Li, Jason Chen Zhang, Zhicheng Dou, Philip S. Yu, Jiaxin Mao

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Hong Kong Polytechnic University(香港理工大学) Microsoft Research Asia(微软亚洲研究院) University of Illinois(伊利诺伊大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了检索增强生成系统中可信度的关键维度,提出Trust-RAG Compass框架,评估事实性、鲁棒性等六个方面,并建立评估基准,揭示不同LLM在可信度方面的性能差异,指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16052 2026-05-18 cs.AI cs.CL 87%

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

理由者还是翻译者?面向污染的评估与税法中的神经符号鲁棒性

Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri, Leslie Barrett, Enrico Santus

机构 * Bloomberg(彭博社) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了税法推理中LLM性能受数据污染影响的问题,提出神经符号框架提升法律AI的可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07147 2026-05-14 cs.LO cs.AI cs.LG 87%

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

MathlibPR: 用于正式数学库的拉取请求合并准备性基准

Zixuan Xie, Xinyu Liu, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MathlibPR基准,通过真实Mathlib4 PR历史评估LLM在审查合并准备性PR中的能力,揭示LLM在区分有效PR与需修订PR中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 87%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17283 2026-05-12 cs.CL cs.AI 87%

Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective

迈向跨语言价值判断:一种共识多元主义视角

Yukun Chen, Xinyu Zhang, Boyi Deng, Jialong Tang, Yu Wan, Fei Huang, Yuxi Zhou, Baosong Yang, Yiming Li

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出X-Value基准,用于评估LLM跨语言判断内容深层价值的能力,通过两阶段人机协作标注框架解决文化多样性和学科复杂性挑战,涵盖14种语言7大全球议题类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09514 2026-05-12 cs.CL cs.AI 87%

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

EcoGym:评估基于LLM的长周期计划与执行能力于交互经济中

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou

机构 * OPPO-PersonalAI(OPPO-个人AI)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 EcoGym提出一个通用基准,用于评估LLM在交互经济中的长周期计划与执行能力,通过三个环境展示不同策略和行动的优化挑战。

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 87%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01630 2026-05-05 cs.CL cs.AI 87%

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

Prosa:基于评分标准的LLM在巴西葡萄牙语真实用户聊天中的评估

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Prosa基准,通过多判官过滤的二元评分标准减少LLM评分偏差,提升评估的判别能力,验证了评分标准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27924 2026-05-05 cs.CL cs.AI 87%

Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future

人工智能能成为良好的同行评审者吗?同行评审流程、评估与未来的调查

Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了同行评审流程中的生成、 rebuttals 和 meta-review 等任务,以及评估方法,探讨了 LLM 在整个同行评审流程中的应用与未来方向。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 87%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00113 2026-05-04 cs.CL cs.AI cs.HC 87%

How Frontier LLMs Adapt to Neurodivergence Context: A Measurement Framework for Surface vs. Structural Change in System-Prompted Responses

前沿大语言模型如何适应神经多样性上下文:一种测量框架,用于系统提示响应中的表面变化与结构变化

Ishan Gupta, Pavlo Buryi

机构 * Harrisburg University of Science and Technology(哈里斯堡科学与技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NDBench基准,通过不同系统提示类型和神经多样性配置,研究前沿LLM在神经多样性上下文下的适应性变化,发现结构变化显著,但单一神经多样性角色声明无法有效抑制潜在有害倾向。

Comments 15 pages, 3 figures, 2 tables. Benchmark, code, and data available at https://github.com/ishansgupta/ndbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23424 2026-04-28 cs.LG cs.CL 87%

Evolve: A Persistent Knowledge Lifecycle for Small Language Models

Evolve:为小型语言模型设计的持久知识生命周期

Dikran Hovagimian

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.LG

AI总结 Evolve通过持久知识库与小型模型结合,提升准确率并降低教师模型调用成本,采用语义连贯的段落存储方式,实现知识的自动合并与刷新,有效提升任务性能。

Comments 35 pages, 1 figure. Code and evaluation data: https://gitlab.com/dikran.hovagimian/evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18566 2026-04-22 cs.AI cs.HC cs.LG 87%

Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion

对系统动力学AI助手的基准测试:云与本地LLM在CLD提取与讨论中的比较

Terry Leitch

机构 * Ruxton AI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了云和本地LLM在系统动力学AI助手中的表现,发现本地模型在CLD提取和讨论任务中表现不一,且后端选择对性能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 87%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17920 2026-04-21 cs.CV cs.AI cs.LG 87%

Prompting Foundation Models for Zero-Shot Ship Instance Segmentation in SAR Imagery

通过提示基础模型实现SAR图像中的零样本船舶实例分割

Islam Mansour, Francescopaolo Sica, Michael Schmitt

机构 * University of the Bundeswehr Munich(联邦国防军 Munich 大学)

专题命中 评测与基准 :foundation model(title,abstract);prompting(title);分类 cs.AI、cs.LG

AI总结 本文提出利用通用视觉基础模型实现SAR图像中零样本船舶实例分割,通过训练YOLOv11检测器并提示SAM2生成实例掩码,有效缓解光学-SAR领域差距,实验表明方法在SSDD基准上达到高IoU和检测率。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15329 2026-04-20 cs.HC cs.AI cs.CL 87%

Evaluating LLMs as Human Surrogates in Controlled Experiments

评估LLMs在受控实验中作为人类替代品的效用

Adnan Hoq, Tim Weninger

机构 * University of Notre Dame(诺特达姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较LLM生成数据与人类数据,探讨在准确性感知实验中LLM能否作为人类替代品,发现LLM能复现部分人类效应,但效果大小和调节模式因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18646 2026-04-15 cs.SE cs.AI cs.CL 87%

SEW: Self-Evolving Agentic Workflows for Automated Code Generation

SEW:自演化代理工作流用于自动化代码生成

Siwei Liu, Jinyuan Fang, Han Zhou, Yingxu Wang, Zaiqiao Meng

机构 * University of Aberdeen(阿伯丁大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEW框架,通过自演化方法自动设计和优化多代理工作流,提升代码生成任务的性能,实验表明在LiveCodeBench上比仅使用基础LLM提升12%。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02617 2026-04-06 cs.AI cs.CR cs.IR cs.LG cs.SI 87%

AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models

AutoVerifier:基于大语言模型的代理自动化验证框架

Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoVerifier框架,利用大语言模型自动化验证技术性声明,通过构建知识图谱实现六层递进验证,展示其在量子计算领域的应用效果。

Comments Winner of 2025-2026 Radiance Technologies Innovation Bowl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 87%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19281 2026-03-23 cs.CL cs.AI cs.IR 87%

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

URAG:一种用于检索增强大型语言模型不确定性量化的基准

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang

机构 * Uppsala University(乌普萨拉大学) University of Science, VNU-HCM(VNU-HCM大学) Indiana University(印第安纳大学) FPT Software, AI Center(FPT软件人工智能中心) The Pennsylvania State University(宾夕法尼亚州立大学) VNU University of Engineering(VNU工程大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 URAG通过构建多选问答任务评估RAG系统在医疗、编程、科学、数学等领域的不确定性,揭示准确性与不确定性的关系及不同RAG方法的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 87%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19966 2026-03-02 cs.CL cs.AI 87%

Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation

Dhati+: 针对阿拉伯语主观性评估的微调大型语言模型

Slimane Bellaouar, Attia Nehar, Soumia Souffi, Mounia Bouameur

机构 * Dept. of Mathematics and Computer Science(数学与计算机科学系) Lab. des Mathématiques et Sciences Appliquées (LMSA)(应用数学与科学实验室(LMSA)) Exact Sciences and Computer Science Faculty(精确科学与计算机科学系) Lab. d’Informatique et Mathématiques (LIM)(计算机与数学实验室(LIM))

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对阿拉伯语主观性评估的微调大型语言模型方法,通过构建AraDhati+数据集并结合集成决策方法,实现了97.79%的高准确率。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 87%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15532 2026-02-18 cs.AI cs.LG 87%

Quantifying construct validity in large language model evaluations

在大型语言模型评估中量化构念效度

Ryan Othniel Kearns

机构 * University of Oxford(牛津大学) St Catherine’s College(圣凯瑟琳学院) Oxford Internet Institute(牛津互联网研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构能力模型,通过结合缩放定律和潜在因子模型,提升LLM评估中构念效度的量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07238 2026-02-10 cs.AI cs.LG econ.GN q-fin.EC 87%

Is there "Secret Sauce'' in Large Language Model Development?

大型语言模型开发中是否存在'秘密配方'?

Matthias Mertens, Natalia Fischl-Lanzoni, Neil Thompson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大型语言模型的前沿进展主要由计算量驱动,而非专有技术,但非前沿领域中专有技术可显著降低计算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19585 2026-02-09 cs.CL cs.AI cs.CV cs.DL 87%

Detecting Latin in Historical Books with Large Language Models: A Multimodal Benchmark

利用大语言模型检测历史书籍中的拉丁文:一个多模态基准测试

Yu Wu, Ke Shu, Jonas Fischer, Lidia Pivovarova, David Rosson, Eetu Mäkelä, Mikko Tolonen

机构 * University of Helsinki(赫尔辛基大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型检测历史文献中的拉丁文片段,并通过多模态数据集评估模型性能,揭示了零样本模型在拉丁文识别中的有效性及局限性。

Comments Accepted by the EACL 2026 main conference. Code and data available at https://github.com/COMHIS/EACL26-detect-latin

详情

展开后加载摘要…

URL PDF HTML 收藏