arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 46 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 46 篇

2602.16926 2026-02-20 cs.CE 91%

BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling

BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试

Yiyuan Jia, Xiaoqin Fu, Liang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11798 2026-02-20 cs.CL cs.AI cs.LG 91%

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

基于人物特征的欧洲议会投票行为模拟研究:利用大语言模型

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibnitz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究利用大语言模型和人物提示技术,模拟欧洲议会成员的投票行为,实现约 0.793 的加权 F1 分数。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16811 2026-02-20 cs.CL cs.AI 91%

Evaluating Monolingual and Multilingual Large Language Models for Greek Question Answering: The DemosQA Benchmark

评估单语和多语大型语言模型用于希腊问答:DemosQA基准

Charalampos Mastrokostas, Nikolaos Giarelis, Nikos Karacapilidis

机构 * Information Systems Lab, MEAD University of Patras, Rio Patras, Greece(信息系统实验室,MEAD帕特拉斯大学,帕特拉斯,希腊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究提出DemosQA数据集和高效评估框架,评估11种LLM在希腊问答任务中的表现,以解决低资源语言的模型有效性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02129 2026-02-20 cs.CE 89%

Benchmarking Large Language Models for Polymer Property Predictions

评估大型语言模型在聚合物性质预测中的表现

Sonakshi Gupta, Akhlak Mahmood, Shivank Shukla, Rampi Ramprasad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了LLM在聚合物性质预测中的表现,发现LLaMA-3在性能上优于GPT-3.5,但整体预测准确性和效率仍低于传统方法,且单任务学习更有效。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02529 2026-02-20 cs.SE cs.AI cs.CL 88%

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

自动化网页应用测试:基于大语言模型和屏幕转换图的端到端测试用例生成

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型和屏幕转换图的自动化网页应用测试系统,用于生成端到端测试用例,提升测试覆盖率和鲁棒性。

Comments Published in the Proceedings of JSAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21193 2026-02-20 cs.CL 88%

Estonian Native Large Language Model Benchmark

爱沙尼亚原生大语言模型基准

Helena Grete Lillepalu, Tanel Alumäe

机构 * Department of Software Science, Tallinn University of Technology, Estonia(软件科学系,塔林技术大学,爱沙尼亚)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出爱沙尼亚语言的大语言模型基准,通过七个多样化的数据集评估不同模型的性能,结合人类和LLM评判方法,验证了高性能模型在爱沙尼亚语言评估中的有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17316 2026-02-20 cs.CL cs.AI 86%

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

相同意义,不同分数:在LLM评估中的词汇与语法敏感性

Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了词汇和语法扰动对LLM性能的影响,发现词汇扰动导致显著性能下降,而语法扰动效果异质,揭示LLM更依赖表层词汇模式而非抽象语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16741 2026-02-20 cs.CR cs.AI cs.LG 86%

Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis

对抗性代码注释能否欺骗AI安全审查员 -- 大规模实证研究:基于注释的攻击与防御对抗大语言模型代码分析

Scott Thornton

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了对抗性代码注释对AI安全审查的影响,发现其对漏洞检测无显著影响,静态分析交叉参考效果最佳。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12915 2026-02-20 cs.CY cs.CL cs.LG 86%

Toward LLM-Supported Automated Assessment of Critical Thinking Subskills

迈向支持性的人工智能自动评估批判性思维子技能

Marisa C. Peczuh, Nischal Ashok Kumar, Ryan Baker, Blair Lehman, Danielle Eisenberg, Caitlin Mills, Payu Wittawatolarn, Kushaan Naskar, Keerthi Chebrolu, Sudhip Nashi, Cadence Young, Brayden Liu, Sherry Lachman, Andrew Lan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了利用大型语言模型评估批判性思维子技能的可行性,通过实验发现微调Llama 3.1 8B在评估具有高度可分离熟练度层级的子技能时表现最佳。

Comments preprint: 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23339 2026-02-20 cs.AI cs.CL cs.HC 86%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16777 2026-02-20 cs.CL 85%

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

DistillNote:一种评估大语言模型生成临床笔记摘要功能性的框架

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam UMC, University of Amsterdam(医学信息学系,阿姆斯特丹大学) Amsterdam Public Health, Methodology(阿姆斯特丹公共健康与方法学) Institute of Mathematics and Statistics, University of São Paulo(数学与统计学研究所,圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DistillNote提出了一种评估大语言模型生成临床摘要功能性的新方法,通过下游任务验证摘要的诊断信号保留,揭示压缩与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 85%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16752 2026-02-20 cs.CR 85%

The Vulnerability of LLM Rankers to Prompt Injection Attacks

大语言模型排序器对提示注入攻击的脆弱性

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了大语言模型排序器对提示注入攻击的脆弱性,通过实验证明不同架构和设置下的攻击效果,并揭示了编码器-解码器架构的抗性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07287 2026-02-20 cs.CR cs.SE 85%

Patch-to-PoC: A Systematic Study of Agentic LLM Systems for Linux Kernel N-Day Reproduction

Patch-to-PoC: 对Linux内核N-day漏洞自动复现的系统研究

Juefei Pu, Xingyu Li, Zhengchuan Liang, Jonathan Cox, Yifan Wu, Kareem Shehada, Arrdya Srivastav, Zhiyun Qian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出K-Repro系统,利用LLM自动复现Linux内核N-day漏洞,实现超过50%的漏洞复现率,为自主安全代理的构建和N-day风险评估提供指导。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24368 2026-02-20 cs.LG cs.AI cs.CR 84%

Watermarking Diffusion Language Models

扩散语言模型水印

Thibaud Gloaguen, Robin Staab, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个针对扩散语言模型的水印技术,通过在期望上下文中应用水印并促进增强水印强度的token,实现高真阳性率和低质量影响的可靠水印。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17623 2026-02-20 cs.CL 79%

Unmasking the Factual-Conceptual Gap in Persian Language Models

揭示波斯语言模型中的事实-概念鸿沟

Alireza Sakhaeirad, Ali Ma'manpoosh, Arshia Hemmat

机构 * EPFL(瑞士联邦理工学院) University of Isfahan(伊斯法罕大学) University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title);pretraining(abstract);分类 cs.CL

AI总结 本文通过DivanBench揭示波斯语言模型在文化常识推理上的不足,发现模型在处理迷信和习俗问题时存在严重偏差,且预训练并未提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17413 2026-02-20 cs.CR cs.CL 79%

DAVE: A Policy-Enforcing LLM Spokesperson for Secure Multi-Document Data Sharing

DAVE:一种强制使用策略的LLM发言人,用于安全的多文档数据共享

René Brinkhege, Prahlad Menon

机构 * Fraunhofer ISST(弗劳恩霍夫研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 DAVE是一种强制使用策略的LLM发言人,通过自然语言接口在不泄露敏感信息的情况下实现安全的多文档数据共享。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17066 2026-02-20 cs.AI 79%

Predictive Batch Scheduling: Accelerating Language Model Training Through Loss-Aware Sample Prioritization

预测批量调度:通过损失感知的样本优先级加速语言模型训练

Sumedh Rasal

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 预测批量调度通过损失感知的样本优先级加速语言模型训练,利用轻量级预测器提升收敛速度,实现高效课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16942 2026-02-20 cs.AI 77%

SourceBench: Can AI Answers Reference Quality Web Sources?

SourceBench: 人工智能答案能否引用高质量的网络来源?

Hexi Jin, Stephen Liu, Yuheng Li, Simran Malik, Yiying Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) GenseeAI Inc.(GenseeAI公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SourceBench通过评估AI引用的网络来源质量,揭示了生成式AI在信息检索中的关键挑战与改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21493 2026-02-20 cs.CE 75%

Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation

Sci2Pol:评估和微调用于科学论文到政策简报生成的LLM

Weimin Wu, Alexander C. Furnas, Eddie Yang, Gefei Liu, Akhil Pandey Akella, Xuefeng Song, Dashun Wang, Han Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Sci2Pol通过构建首个政策简报生成评估基准和训练数据集,评估并微调了多个LLM,提升了科学与政策之间的转化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17264 2026-02-20 cs.IR 75%

On the Reliability of User-Centric Evaluation of Conversational Recommender Systems

对话推荐系统用户导向评估的可靠性研究

Michael Müller, Amir Reza Mohammadi, Andreas Peintner, Beatriz Barroso Gstrein, Günther Specht, Eva Zangerle

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了对话推荐系统用户导向评估的可靠性,发现部分维度在聚合下具有中等可靠性,而社会构念如人性和融洽度则不可靠,揭示了第三方判断中的晕轮效应。

Comments 5 pages, 2 figures. Submitted to UMAP 2026. Code available at https://github.com/michael-mue/reliable-crs-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04220 2026-02-20 cs.CL cs.AI 73%

BEADs: Bias Evaluation Across Domains

BEADs: 跨领域偏差评估

Shaina Raza, Mizanur Rahman, Michael R. Zhang

机构 * Vector Institute(向量研究所) Royal Bank of Canada(皇家银行) University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16979 2026-02-20 cs.CV cs.CL cs.LG 73%

Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling

基于监督潜在变量建模的模态预测影响分析

Divyam Madaan, Sumit Chopra, Kyunghyun Cho

机构 * New York University(纽约大学) Grossman School of Medicine(格罗斯曼医学院) Genentech(基因泰克) CIFAR(加拿大弗雷德里克·班克特研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PRIMO是一种监督潜在变量插补模型,用于量化多模态学习中缺失模态的预测影响,通过方差度量评估模态对预测的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16832 2026-02-20 cs.AI cs.CL 73%

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

IndicJR:一种无裁判的南亚语言对抗鲁棒性基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。

Comments Accepted in EACL Industry Track Oral, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16805 2026-02-20 cs.AI cs.LG 73%

Simple Baselines are Competitive with Code Evolution

简单基线在代码进化中具有竞争力

Yonatan Gideoni, Sebastian Risi, Yarin Gal

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现简单基线在代码进化任务中表现优异,指出搜索空间设计和评估方法改进是未来研究重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17425 2026-02-20 cs.CL 70%

Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics

评估极低资源机器翻译:ChrF++和BLEU指标的比较研究

Sanjeev Kumar, Preethi Jyothi, Pushpak Bhattacharyya

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了BLEU和ChrF++在极低资源语言机器翻译评估中的表现,发现BLEU在提供词汇精确度见解方面具有补充作用。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17111 2026-02-20 cs.AI 70%

Instructor-Aligned Knowledge Graphs for Personalized Learning

面向个性化学习的教师对齐知识图谱

Abdulrahman AlRabah, Priyanka Kargupta, Jiawei Han, Abdussalam Alawini

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 InstructKG通过自动构建教师对齐的知识图谱,捕捉课程预期的学习进程,以支持个性化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 70%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17084 2026-02-20 cs.AI cs.SE 70%

How AI Coding Agents Communicate: A Study of Pull Request Description Characteristics and Human Review Responses

AI 编程代理如何交流:对拉取请求描述特征和人类审查响应的研究

Kan Watanabe, Rikuto Tsuchida, Takahiro Monno, Bin Huang, Kazuma Yamasaki, Youmei Fan, Kazumasa Shimari, Kenichi Matsumoto

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了AI编程代理在拉取请求描述风格上的差异及其对人类审查员响应的影响,揭示了人机协作开发中的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17558 2026-02-20 cs.CV 67%

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏