arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 114 篇

2608.23705 2026-08-28 cs.CL cs.AI cs.CY 版本更新 93%

The Limits of Automatic Evaluation of Creativity in Large Language Models

大型语言模型创造力自动评估的局限性

Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,当前自动评估方法及LLM作为评判者的评估方式,与人类对LLM生成文本创造力的判断存在显著不一致,无法有效捕捉创造力的关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-28 cs.CL cs.AI 新提交 92%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 22 pages, 9 figures (4 main body, 5 appendix), 11 tables (1 main body, 10 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26885 2026-08-28 cs.AI cs.HC cs.SE 新提交 92%

Evaluating human and LLM screening workflows in a conceptually complex scoping review: Recall--workload trade-offs and run-to-run consistency

在概念复杂的范围综述中评估人工与大语言模型(LLM)筛选工作流:召回率-工作量权衡与运行间一致性

Nikol Figalová, Lynn Huestegge, Anne Böckler-Raettig

机构 * Julius-Maximilians-Universität Würzburg(维尔茨堡大学) Institute of Psychology(心理学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究对比人工与LLM筛选工作流,发现LLM筛选性能依赖工作流,Gemini 3.1文件批处理召回率最高,GPT-5.4文件批处理运行间存在差异,高召回率任务中LLM更适合人工监督工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26306 2026-08-28 cs.AI 新提交 92%

Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems

批准过迟:LLM防护的自适应系统中的裁决陈旧性

Ilai Shraga, Roei Eshel, Lior Gorelik

机构 * University of Cambridge(剑桥大学) Maccabim-Re’ut High School(马卡比姆-鲁特高中) The Open University of Israel(以色列开放大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM防护的自适应系统存在的裁决陈旧性问题,提出新鲜度受限防护(FBS)方法,可显著降低批准过期率,同时制定新鲜度契约规范批准的有效性。

Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26109 2026-08-28 cs.AI 新提交 92%

Standalone LLM and a Pre-specified Agentic Pipeline for Explaining ICU Mortality Predictions: a Feasibility Study on the eICU Demo Dataset

独立大型语言模型(LLM)与预定义智能体管道用于解释ICU死亡率预测:基于eICU演示数据集的可行性研究

Di Zhu, Chen Xie, Haoyun Zhang, Zihan Wei, Ziwei Wang, Jiazhao Shi, Ziyu Wang, Qiyang Xie

机构 * Santa Clara University(圣克拉拉大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Wake Forest University(维克森林大学) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究基于eICU演示数据集对比独立LLM与四步智能体管道解释ICU死亡率预测,发现智能体管道在指南依据性等方面更优,但需搭配归因核查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08143 2026-08-28 cs.HC cs.AI 版本更新 92%

Communication styles and reader preferences of LLM- and human-authored COVID-19 information explanations: a case study

由大语言模型(LLM)与人类撰写的新冠疫情信息解释的沟通风格及读者偏好:一项案例研究

Jiawei Zhou, Kritika Venkatachalam, Minje Choi, Koustuv Saha, Munmun De Choudhury

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) Amazon(亚马逊) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以健康事实核查为场景,对比LLM与人类新冠信息解释的沟通风格,发现LLM内容在说服性等质量指标上较弱但受读者偏好,揭示LLM在健康领域的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26327 2026-08-28 cs.CL cs.AI 新提交 91%

How Unlikely Is "Unlikely"? Assessing Verbal Probability Perception Across Large Language Models

“不太可能”到底有多“不可能”?评估大型语言模型的言语概率感知

Christos Petridis, Konstantinos Pelechrinis, Zoran Obradovic

机构 * Temple University(天普大学) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究通过跨19个LLM的词-数映射等测试,发现LLM能追踪人类言语概率认知结构但负向表达存在偏差,为人机概率语言交互提供了参考。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26372 2026-08-28 cs.CL cs.AI 新提交 91%

Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives

利益冲突情境下LLM智能体中经知识验证的涌现式欺骗

Zheyuan Liu, Weiliang Zhao, Xiangchi Yuan, Ningshan Ma, Yue Huang, Meng Jiang

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对利益冲突下LLM智能体的诚实性问题,构建KnownLieBench基准并开展实验,发现不同模型的涌现式欺骗存在差异,诚实导向微调可减少激励下的欺骗。

Comments A benchmark for knowledge-verified emergent deception in LLM agents under conflicting incentives

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23749 2026-08-28 cs.SE 版本更新 90%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27309 2026-08-28 cs.CL cs.AI cs.CY 新提交 90%

Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit

删失评分量表上的双重差分可制造效应:来自预注册的LLM评判审计的证据

Shuyi Fan, Boyuan Deng, Mengyu Xu, Xinhong Xie, Chenyang Li, Hongyang Zhang

机构 * Columbia University(哥伦比亚大学) Johns Hopkins University(约翰斯·霍普金斯大学) The University of Chicago(芝加哥大学) The Pennsylvania State University(宾夕法尼亚州立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究指出,删失评分量表上的双重差分法会制造虚假效应,通过预注册的LLM评判审计案例,发现名义显著的交互作用实为删失导致的偏差,推导了机制且其贡献可测量。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27260 2026-08-28 cs.AI cs.CL 新提交 90%

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

什么构成优质的智能体数据?LLM智能体数据生成的ACE视角

Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Northwestern University(西北大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究针对LLM智能体数据生成领域提出两级框架与ACE视角,明确核心挑战是为演化的智能体与环境分配有效、非冗余的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26137 2026-08-28 cs.CL cs.LG cs.SD 新提交 90%

Interpretable, Fairly Evaluated Automated L2 Speaking Assessment that Beats the Single-Human Ceiling and Why Pause Encoding Does Not Change LLM Fluency Scores

可解释、经公平评估且超越单人类天花板的L2口语自动评估模型——以及为何停顿编码不改变LLM流利度评分

Eichi Uehara

机构 * Aflo Technologies Inc.(Aflo科技公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 该研究构建了可解释的特征+LLM混合L2口语评估模型,其评分超越81%的人类评分者,还证实停顿编码不影响LLM流利度评分,且通过多维度方法验证了模型的公平性与可靠性。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27182 2026-08-28 cs.LG 新提交 90%

TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution

TraceBench:用于时间序列根因归因的LLM智能体受控评估框架

Tommaso Bendinelli, Artur Dox, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院) CSEM SA(CSEM公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 研究针对LLM智能体时间序列根因归因性能缺乏受控评估的问题,推出TraceBench框架,评估了四个LLM智能体的表现并揭示其分析规律,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26982 2026-08-28 cs.CL 新提交 90%

JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols

JudgeStealer:跨评估协议提取大语言模型评判能力

Chen Chen, Yaolin Chen, Xuehan Sun, Juan Lin, Xueluan Gong, Yuhang Zheng, Qian Wang, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 JUDGESTEALER是首个跨评估协议提取LLM评判能力的高效查询框架,通过利用跨协议一致性等技术提升提取效果,在三类评估任务上优于基线且具鲁棒性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26882 2026-08-28 cs.CR cs.AI 新提交 90%

PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact?

PLCBench:自主大语言模型智能体能否将PLC访问转化为持续的物理影响?

Yitian Zhou, Jingyu Zheng, Qiliang Jiang, Linkang Du, Haoming Liu, Lichao Wu, Shiyi Zhao, Mengxiang Liu, Ruilong Deng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员提出首个真实PLC硬件在环框架PLCBench,评估自主LLM智能体将PLC访问转化为持续物理影响的能力,发现31.3%实验达成物理目标,过程观测丰富可提升目标达成率,还发布了相关复现资源。

Comments 36 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26529 2026-08-28 cs.CL 新提交 90%

Multi-Expert Conformal Risk Control for Pairwise LLM Judging in Open-Ended Dialogue

面向开放式对话中Pairwise LLM评判的多专家共形风险控制

Ming Cheng, Yusheng Dai, Qiuhong Ke, Zhaolin Chen, Lizhen Qu

机构 * Monash University(莫纳什大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出多专家共形风险控制算法,针对开放式对话的Pairwise LLM评判问题,设计Score Averaging、Decision Voting及MC3方法,构建Panel基准数据集,提升了同构与异构专家面板的评估性能。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26226 2026-08-28 cs.AI 新提交 90%

LLM Agents for Time-Series: A Survey

面向时间序列的大语言模型(LLM)智能体:一项综述

Yilong Chen, Xiao Qin, Chenghao Liu, Liang Wu, Noelle I. Samia, Kaize Ding

机构 * Northwestern University(西北大学) Datadog AI Research(Datadog人工智能研究院) Nokia(诺基亚)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本综述针对LLM智能体在时间序列问题上设计差异大的问题,采用问题驱动分类法梳理现有系统,分析任务对架构等的影响,对比模型性能,为相关设计提供指南并指出未来缺口。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26171 2026-08-28 cs.CY cs.CL cs.HC 新提交 90%

Mitigating Fabrication in Multi-Stage LLM Pipelines for Hiring: An Empirical Evaluation of Prompt Guardrails and Human-in-the-Loop Checkpoints

缓解招聘领域多阶段大语言模型(LLM)流水线的生成幻觉:对提示护栏与人机交互(HITL)检查点的实证评估

Hiroko Takano

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究针对招聘领域多阶段LLM流水线的造假问题,实证评估了提示护栏与人机交互检查点两种缓解措施,发现二者互补且需结合使用,仅靠模型进展无法解决该问题。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26131 2026-08-28 cs.CL 新提交 90%

Evaluating Language Models in Realistic Conversational Contexts

在真实对话语境中评估语言模型

Ilija Subasic, Andrew Rabinovich, Zhao Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究针对现有对话评估框架的不足,推出UPHELD基准,开发混合评判者框架,提升了对话评估与人类判断的相关性,为LLM对话评估提供了稳健基础。

Comments International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-08-28 cs.CL 版本更新 90%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

Comments Accepted to EMNLP2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26588 2026-08-28 cs.CR cs.SE 新提交 89%

Unsaid, Unsafe? Implicit Security Obligations in LLM-Based RTL Code Generation

未言明即不安全?基于大语言模型的RTL代码生成中的隐式安全义务

Guang Yang, Xing Hu, Xiang Chen, Xin Xia

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM生成RTL代码的隐式安全问题,构建了SECRTL-GEN基准,提出神经符号框架RTL-Obliger,可显著提升LLM生成RTL的安全与功能通过率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26408 2026-08-28 cs.SE 新提交 89%

STILL: Recovering Lowered STL Semantics for LLM-assisted C++ Decompilation

STILL:为LLM辅助的C++反编译恢复被降低的STL语义

Xiaohan Wang, Kevin Leach

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究针对LLM辅助C++反编译在STL函数上表现不佳的问题,提出STILL结构化语义接口,在StlBench与HumanEval实验中显著提升了反编译代码的可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26150 2026-08-28 cs.AI cs.DL cs.IR 新提交 89%

Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models

利用大型语言模型开展疾病传播模型的系统文献综述

Orhan Yagizer Cinar, Timur Emre Ozkose, Emma Von Hoene, Amira Roess, Taylor Anderson, Hamdi Kavak

机构 * George Mason University(乔治梅森大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究开发了一套用于从536篇基于智能体的建模论文中提取模型相关信息的LLMs pipeline,对比了GPT-4.1、GPT-5.0与人工开展的SLR结果,为prompt开发提供了见解,凸显了LLMs用于全规模SLR的潜力与局限性。

Comments To be published in the Winter Simulation Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26222 2026-08-28 cs.LG cs.AI cs.CR cs.SE 新提交 89%

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz:面向大语言模型安全评估的安全神经元引导模糊测试

Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

机构 * University of Bristol(布里斯托尔大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 NeuronFuzz是一种安全神经元引导的LLM安全评估白盒模糊测试框架,通过利用安全神经元激活值生成反馈,在21个模型上实现了高越狱发现率和零样本迁移能力,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27268 2026-08-28 cs.AI cs.CL cs.HC 新提交 88%

BrailleBench: Investigating Multi-Criteria Braille Comprehension in Large Language Models

BrailleBench:探究大型语言模型的多准则盲文理解能力

Jinghan Zhang, Fengran Mo, Zhiyu Chen, Xiaoyan Han, Kunpeng Liu, Chang-Tien Lu

机构 * Rochester Institute of Technology(罗切斯特理工学院) Amazon.com, Inc.(亚马逊公司) Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出盲文理解基准BrailleBench,评估6款LLMs的盲文处理能力,发现其印刷体英语能力与盲文可及性存在差距,为盲文AI系统开发提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-28 cs.AI cs.CY cs.LG cs.SE 版本更新 88%

FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen (Independent Researcher), Erim Hayretci (Imperial College London)

机构 * Imperial College London(帝国理工学院)

专题命中 评测与基准 :post-training(title,abstract);language model(title);SFT(abstract);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 18 pages, 11 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Adds reward-map sensitivity, selection and metric robustness, held-out Recipe1MSubs substitution validation, and a preregistered controlled reward-transfer study. Code, dataset, and interactive leaderboard links remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26199 2026-08-28 cs.AI cs.SE 新提交 88%

Benchmarking AI Agents for Hardware Design Automation via MCP Tool Calling

通过MCP工具调用对硬件设计自动化的AI智能体进行基准测试

Leonardo Liparulo, Francesco Pierri

机构 * Politecnico di Milano(米兰理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建含MCP服务器的硬件设计自动化基准,评估7种开源AI智能体,发现其可靠性依赖任务结构与配置,为本地LLM智能体部署提供实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26110 2026-08-28 cs.DC cs.AI 新提交 88%

Exploring the Role of LLMs in HPC Programming: A Survey

探索大语言模型(LLM)在高性能计算(HPC)编程中的作用:一项综述

Strahinja Ljaljevic, Josep Jorba, Sergio Iserte

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述梳理了LLM在HPC编程五大类任务中的应用,指出通用LLM在串行等任务表现尚可但分布式范式不足,领域专用模型准确率更高但范围狭窄,LLM短期内无法取代HPC专家,将成为软件开发的强大合作者,二者融合是长期共同演化过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11297 2026-08-28 cs.CL 版本更新 88%

Are Large Language Models Effective Knowledge Graph Constructors?

大型语言模型是高效的知识图谱构建者吗?

Ruirui Chen, Weifeng Jiang, Chengwei Qin, Bo Xiong, Kaiwen Wei, Fiona Liausvia, Pei Fang Tan, Ker Yung Chua, Dongkyu Choi, Mukkesh Kumar, Evelyn C. Law, Dennis Wang, Boon Kiat Quek

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国) Stanford University, United States(斯坦福大学,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出D2A-HKG框架,用7个前沿LLMs在CMW-Lit数据集上基准测试零样本KG构建,发现SOTA LLMs可生成相关三元组但阶段行为有差异,还发布了CMW-Lit及生成KG作为研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09316 2026-08-28 cs.LG cs.CL 版本更新 88%

A Survey of LLM Prompt Datasets: Taxonomy, Linguistic Patterns, and Practical Uses

大语言模型提示数据集:深入分析与洞察

Yuanming Zhang, Yan Lin, Arijit Khan, Huaiyu Wan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science(计算机科学系) Aalborg University(奥尔堡大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 本文深入分析了129个异构LLM提示数据集,通过多层级语言分析揭示提示与一般文本的区别模式,并通过三个下游实验验证了提示过滤、领域分类和提示质量预测的实用性。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏