arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2311.09184 2024-07-15 cs.CL cs.LG 90%

Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization

Yixin Liu, Alexander R. Fabbri, Jiawen Chen, Yilun Zhao, Simeng Han, Shafiq Joty, Pengfei Liu, Dragomir Radev, Chien-Sheng Wu, Arman Cohan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.LG

Comments NAACL 2024 Findings, GitHub Repo: https://github.com/yale-nlp/InstruSum, LLM-evaluators Leaderboard: https://huggingface.co/spaces/yale-nlp/InstruSumEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03109 2024-01-01 cs.CL cs.AI 90%

A Survey on Evaluation of Large Language Models

Yupeng Chang, Xu Wang, Jindong Wang, Yuan Wu, Linyi Yang, Kaijie Zhu, Hao Chen, Xiaoyuan Yi, Cunxiang Wang, Yidong Wang, Wei Ye, Yue Zhang, Yi Chang, Philip S. Yu, Qiang Yang, Xing Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments Accepted by ACM Transactions on Intelligent Systems and Technology (TIST); 45 pages; More recent works; https://llm-eval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09093 2023-06-16 cs.CL cs.AI cs.CV 90%

Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration

Chenyang Lyu, Minghao Wu, Longyue Wang, Xinting Huang, Bingshuai Liu, Zefeng Du, Shuming Shi, Zhaopeng Tu

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Longyue Wang is the corresponding author. Our project page is at https://github.com/lyuchenyang/Macaw-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21559 2026-08-25 cs.CL 新提交 90%

Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline

受控退化下的证据状态可靠性:多阶段大语言模型(LLM)流水线中的解析器有效性偏差

Naimur Rahman

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对多阶段LLM流水线提出证据状态可靠性评估框架,发现受控退化下结构符合性可改善但证据敏感的阶段成功会恶化,且退化证据的检测与恢复存在偏差。

Comments 32 pages, 4 figures, 6 tables. Code and reproducibility materials: https://github.com/NaimurRahmanR/evidence-state-reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21317 2026-08-24 cs.AI 新提交 90%

From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry

从法规到实施:对工业中大型语言模型(LLM)辅助法规合规性的批判性评估

Adriana Watson, Marco Bücheler, Grant Richards

机构 * School of Engineering Technology, Purdue University(普渡大学工程技术学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对工业中LLM辅助法规合规性的研究缺口,探索数据提取指令和法规模糊性对LLM生成合规文档质量与一致性的影响,发现不同严格程度的法规指南对LLM输出的一致性和幻觉情况有不同影响。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21101 2026-08-24 cs.CR cs.AI 新提交 90%

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器

Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。

Comments 35 pages, 14 figures. Code: https://github.com/Elroyper/ClawSentry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 90%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20918 2026-08-24 cs.AI 新提交 90%

UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists

UpgradeBench:面向微调LLM专用模型升级的决策导向基准

Ye Chen, Weining Zhang

机构 * Alibaba Group(阿里巴巴集团) Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究提出UpgradeBench基准,针对LLM专用模型升级的决策问题,在多模型序列与任务上验证了适配器迁移等策略的效果,实现低成本高效升级。

Comments 23 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20554 2026-08-24 cs.CR cs.LG 新提交 90%

aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy

aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估

Fatih Deniz, Yazan Boshmaf, Dorde Popovic, Issa Khalil

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08881 2026-08-24 cs.CY cs.AI 版本更新 90%

Can We Trust AI Agents? A Case Study of an LLM-Based Multi-Agent System for Ethical AI

我们能信任智能体吗?基于大语言模型的多智能体系统用于伦理AI的案例研究

José Antonio Siqueira de Cerqueira, Mamia Agbese, Rebekah Rousi, Nannan Xi, Juho Hamari, Pekka Abrahamsson

机构 * Tampere University(塔尔皮奥大学) University of Jyväskylä(耶夫斯克耶拉大学) University of Vaasa(瓦萨大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过设计LLM-MAS多智能体原型,评估其在处理AI伦理问题时的代码生成能力,发现其能生成大量相关代码,但存在源代码集成等实际挑战。

Journal ref CEUR Workshop Proceedings, Vol. 4237 (TETHICS 2025), pp. 68-82

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19802 2026-08-21 cs.CL 新提交 90%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19689 2026-08-21 cs.AI 新提交 90%

Rethinking the Evaluation and Optimization of LLM-Based Social Simulation

重新思考基于大语言模型(LLM)的社会模拟的评估与优化

Pei Wang, Xu Chen, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM社会模拟中基于准确率的评估与硬标签训练的缺陷,提出主观性自适应软标签训练(SALT),构建SUBJSIM基准并验证其在现实场景下的可行性与优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01034 2026-08-21 cs.CL stat.ME 版本更新 90%

A Finite-Calibration Regime Map for LLM Judge Panels

有限校准机制图:LLM评审团面板

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究在有限人工标注预算下,低维堆叠器与联合输出表对LLM评审团面板的校准权衡,提出有限校准面板选择方法,实验表明多数评审输出可加或冗余。

Comments 33 pages, 11 figures, 40 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18768 2026-08-20 cs.CL 新提交 90%

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

可读、忠实、可用:语言模型中人口统计身份的三个可分离属性

Fathin Difa Robbani

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究探究LLM中人口统计身份的三个可分离属性,通过对Mistral-7B等模型的分析,发现可读、忠实、可用三者分离,为LLM模拟人群的相关辩论提供了新视角。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17270 2026-08-19 cs.AI 新提交 90%

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

大型语言模型(LLMs)能否判断优质假说?基于logit的能量评分在科学假说排序上优于提示式LLM评判器

Swati Rajwal, Sanjay Das, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对科学假说评估难题,提出基于logit的能量评分方法,在12学科1323篇论文的基准测试中,该方法的Hit@1显著优于提示式LLM评判器,展现出模型内在置信度的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13341 2026-08-18 cs.LG stat.ML 版本更新 90%

Limits to scalable evaluation at the frontier: LLM as Judge won't beat twice the data

可扩展评估的极限:LLM作为裁判无法超越两倍数据

Florian E. Dorner, Vivian Y. Nastl, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) Tübingen AI Center(图宾根人工智能中心) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文研究了使用LLM作为裁判进行模型评估的局限性,发现当裁判准确性不足时,去偏方法无法显著减少所需的真实标签数量。

Comments ICLR 2025; 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14425 2026-08-17 cs.AI 新提交 90%

Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

何时停止:LLM评估的贝叶斯最优停止

Toby D. Pilditch

机构 * UK AI Security Institute(英国人工智能安全研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出optstop框架,将LLM评估视为序贯测量问题,基于分层贝叶斯推理实现自适应停止,可减少评估试验量且不影响结论,为LLM评估计算资源分配提供新方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14380 2026-08-17 cs.AI 新提交 90%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架

Yu Zhuang, Kefei Chen, Yitong Duan, Shuxin Zheng, Jian Li, Xu-Yao Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 90%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04463 2026-08-14 cs.CL 版本更新 90%

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性

Alicia Guerra, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 90%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 90%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11008 2026-08-13 cs.CL cs.CY 版本更新 90%

Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance

模板化还是完全合成?提示构造是测量LLM政治立场的混淆因素——超越写作辅助的视角

Ilias Chalkidis

机构 * The National Center for AI in Society (CAISA), University of Copenhagen(哥本哈根大学社会人工智能国家中心(CAISA))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对LLM政治立场检测中模板化提示的混淆问题,扩展IssueBench框架,提出用LLM生成的完全合成提示,验证其在立场测量中更具生态效度,可减少估计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10698 2026-08-12 cs.CL 新提交 90%

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

面向NLPCC 2026共享任务6的EVIL-Detect:大语言模型生成文本检测

Hongrui Bao, Hangyu Rong, Zhuoshang Wang, Yubing Ren, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对中文场景下LLM生成文本检测需求,提出带冲突感知融合的多信号集成框架EVIL-Detect,整合多类信号并校准决策边界,在NLPCC 2026共享任务6中获宏F1 0.8888且排名第一。

Comments Accepted by NLPCC 2026 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交 90%

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08265 2026-08-11 cs.LG 新提交 90%

Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing

机遇并非可实现性:多大型语言模型(LLM)路由的选择有效诊断方法

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 该研究针对多LLM路由的神谕路由诊断缺陷,提出选择有效置信区间方法,通过实验发现可部署路由器仅能恢复部分神谕机遇,且最佳策略的增益下限可能为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07544 2026-08-11 cs.NE cs.AI 新提交 90%

MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-based Automated Heuristic Design

MOSAIC:针对基于大语言模型的自动启发式设计的专用启发式算法与问题实例的对抗性协同进化

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MOSAIC框架,通过对抗性协同进化组合优化问题的专用启发式算法与问题实例,构建区域专用启发式算法池,所提取的组合在各类基准测试中均优于现有最先进的基于LLM的自动启发式设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27204 2026-08-11 cs.CL cs.IR 版本更新 90%

GraphReview: Scientific Paper Evaluation via LLM-based Graph Evidence Expansion

GraphReview: 基于LLM的图消息传递的科学论文评估

Pujun Zheng, Wanying Ren, Jiacheng Yao, Guoxiu He, Star X. Zhao

机构 * School of Economics and Management, East China Normal University(东华师范大学经济管理学院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出GraphReview框架,通过图消息传递整合论文内在质量、同期关联和历时关联,利用LLM生成节点先验和边比较证据,结合个性化PageRank进行质量排序、决策预测和审稿生成,在决策和排序指标上平均提升29.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07437 2026-08-10 cs.AI 新提交 90%

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06949 2026-08-10 cs.AI 新提交 90%

Does Splitting a Triage Decision Across Agents Hide Bias or Help Catch It? A Multi-Agent Simulation Study of LLM-Based Resource Allocation Under Audit Capacity Constraints

在智能体间拆分分诊决策是隐藏偏差还是有助于发现偏差?审计能力约束下基于大语言模型的资源分配多智能体模拟研究

Paul-Peter Arslan

机构 * Institute for Future Technologies(未来技术研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过多智能体模拟发现,在LLM资源分配中拆分决策为多智能体流程未显著改变偏差发生率,但审计能力影响偏差发现率,风险排序审核可提升覆盖范围。

Comments 6 pages, 2 figures, 3 tables. Code and data available at https://github.com/Polpii/policy-town

详情

展开后加载摘要…

URL PDF HTML 收藏