arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2505.00853 2025-05-05 cs.CY 91%

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11070 2024-12-17 cs.CV 91%

HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation

Tengfei Liu, Jiapu Wang, Yongli Hu, Mingjie Li, Junfei Yi, Xiaojun Chang, Junbin Gao, Baocai Yin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13596 2024-12-02 cs.CV 91%

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

Wei Zhang, Miaoxin Cai, Tong Zhang, Jun Li, Yin Zhuang, Xuerui Mao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04987 2024-09-10 cs.HC 91%

How to Align Large Language Models for Teaching English? Designing and Developing LLM based-Chatbot for Teaching English Conversation in EFL, Findings and Limitations

Jaekwon Park, Jiyoung Bae, Unggi Lee, Taekyung Ahn, Sookbun Lee, Dohee Kim, Aram Choi, Yeil Jeong, Jewoong Moon, Hyeoncheol Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21593 2024-08-01 cs.HC 91%

LLM-for-X: Application-agnostic Integration of Large Language Models to Support Personal Writing Workflows

Lukas Teufelberger, Xintong Liu, Zhipeng Li, Max Moebus, Christian Holz

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11007 2024-06-18 cs.CR cs.SE 91%

Threat Modelling and Risk Analysis for Large Language Model (LLM)-Powered Applications

Stephen Burabari Tete

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05469 2024-05-10 cs.CR 91%

PLLM-CS: Pre-trained Large Language Model (LLM) for Cyber Threat Detection in Satellite Networks

Mohammed Hassanin, Marwa Keshk, Sara Salim, Majid Alsubaie, Dharmendra Sharma

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12785 2023-11-22 cs.SE 91%

Prompting Frameworks for Large Language Models: A Survey

Xiaoxia Liu, Jingyi Wang, Jun Sun, Xiaohan Yuan, Guoliang Dong, Peng Di, Wenhai Wang, Dongxia Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11515 2023-07-26 cs.SE 91%

Large Language Models are Few-shot Testers: Exploring LLM-based General Bug Reproduction

Sungmin Kang, Juyeon Yoon, Shin Yoo

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted to IEEE/ACM International Conference on Software Engineering 2023 (ICSE 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07281 2023-04-28 cs.CL cs.AI cs.LG 91%

GrIPS: Gradient-free, Edit-based Instruction Search for Prompting Large Language Models

Archiki Prasad, Peter Hase, Xiang Zhou, Mohit Bansal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG

Comments EACL 2023 (20 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16712 2026-06-23 cs.CL cs.AI 版本更新 91%

The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models

LLM的变色龙本质:量化搜索增强语言模型中的多轮立场不稳定性

Shivam Ratnakar, Sanjay Raghavendra

机构 * University of Southern California(美国南加州大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出变色龙基准数据集和两个度量指标,揭示搜索增强LLM在多轮对话中因知识多样性不足而严重依赖查询框架,导致立场频繁摇摆。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MTI-LLM @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21036 2026-08-24 cs.AI 新提交 91%

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

评估大型语言模型在国际海运危险货物规则合规性上的性能

Alexander Thomas, Hubert P. H. Shum, Darren Nellis, Manli Zhu, Phatpicha Yochum, William Bartle, Daniel Wrightson

机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) Durham University(杜伦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 91%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 91%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08143 2026-08-11 cs.IR cs.CL 新提交 91%

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型

Anthony Miyaguchi, Conor Johnston

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。

Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03983 2026-08-05 cs.PL cs.AI 新提交 91%

Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss?

大语言模型能否恢复编译器遗漏的语义优化机会?

Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei Xia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文探究大语言模型能否恢复编译器遗漏的语义优化机会,推出含多类案例的可执行基准SeGaBench,实验显示最强模型生成的工件可实现较高正确率与加速比,证实LLM可作为编译器的补充语义提议者。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25425 2026-07-29 cs.AI cs.CR cs.CY 新提交 91%

The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play

大语言模型对夺旗赛的颠覆性影响及公平竞赛之路

Michael Macaulay, Harmony Bouabid, Guo Gen Ang, Sasha Shaw

机构 * WMG, University of Warwick(华威大学制造工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究大语言模型对夺旗赛的影响,通过混合方法绘制人机能力边界,发现社区对AI参赛分歧源于竞赛目的不明。为此提出含分层分组、抗LLM挑战设计等的保障框架及决策工具,其适用于网络安全中以结果证能力的场景。

Comments 20 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29520 2026-06-30 cs.SE cs.AI cs.DB 91%

SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

SAKE:大型语言模型的软件架构知识评估基准

Tiziano Santilli, Francesco Daghero, Mayhar Tourchi Moghaddam

机构 * University of Southern Denmark(丹麦南方大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出SAKE基准,包含2154道专家策划的多选题,评估LLM在八个架构类别和四种上下文长度下的架构知识,揭示专业实践中的能力差距。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26541 2026-06-26 cs.LG cs.CY 新提交 91%

Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究

Jerome Marston, Tino Kreutzer, Salomé Garnier, Ella Boone, Phuong N Pham, Patrick Vinck

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。

Comments 34 pages, 4 tables, 3 Annexes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22797 2026-06-23 cs.AI cs.CY cs.GT econ.GN q-fin.EC 新提交 91%

Measuring Behavior Portability in Large Language Models

测量大型语言模型中的行为可移植性

Tianjia Dong, Nadav Kunievsky, James A. Evans

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Data Science Institute Department of Sociology University of Chicago(芝加哥大学数据科学研究所社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出一个形式化框架,通过拟合可解释行为模型并评估其在目标环境中的预测性能,量化LLM在不同支付等价决策环境中的行为可移植性,实验发现显著且系统的可移植性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17702 2026-06-23 cs.CV cs.AI 新提交 91%

SegTME-UNI2: A Foundation Model-Based Framework for Generalisable Multiclass Cell Segmentation and LLM-Driven Tumour Microenvironment Characterisation in Histopathology

SegTME-UNI2: 一种基于基础模型的可泛化多类细胞分割框架及LLM驱动的组织微环境表征在组织病理学中的应用

Wan Siti Halimatul Munirah Wan Ahmad, Faris Syahmi Samidi, Mohammad Badal Ahmmed, Vimal Angela Thiviyanathan, Selvam Thavaraj, Anwar P. P. Abdul Majeed

机构 * Department of Data Science and Artificial Intelligence, School of Computing and Artificial Intelligence, Faculty of Engineering and Technology, Sunway University(双威大学工程与技术学院计算与人工智能学院数据科学与人工智能系) Faculty of Dentistry, Universiti Malaya(马来亚大学牙科学院)

专题命中 评测与基准 :LLM(title,title_cn);foundation model(title,abstract);分类 cs.AI

AI总结 提出SegTME-UNI2框架,结合UNI2-H病理基础模型与双头UperNet解码器实现六类语义分割和核实例分割,通过三阶段伪标签课程学习解决标注不足问题,并利用LLM生成临床可解释的TME报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13104 2026-06-12 cs.LG 新提交 91%

Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models

权威、真实性与引文偏差:研究大语言模型认知易感性的大规模多领域基准

Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 提出AuthorityBench基准,通过2x2因子设计隔离引文权威信号对LLM认知行为的影响,发现引文存在(无论真假)均提高幻觉率,真声明搭配假引文时幻觉率上升3-22个百分点。

Comments 10 pages, 5 figures. Accepted to AI4GOOD and EIML at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16928 2026-06-12 cs.CL 版本更新 91%

ChiKhaPo: A Large-Scale Multilingual Benchmark for Evaluating Lexical Comprehension and Generation in Large Language Models

ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准

Emily Chang, Niyati Bafna

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI 91%

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05427 2026-06-02 cs.AI 91%

The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

拒绝-顺从权衡:大型语言模型的大规模安全行为审计

Alif Al Hasan, Sumon Biswas

机构 * Department of Computer and Data Sciences(计算机与数据科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);post-training(abstract)

AI总结 本研究通过调整组合方法隔离模型敏感性与数据集毒性混淆,审计了21个开源权重LLM在四个安全基准上的拒绝与顺从失败模式,发现模型采用不同校准策略、人口保护不平等以及拒绝与顺从倾向在模型家族内稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24621 2026-06-02 cs.CL 91%

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

大型语言模型在密码分析和侧信道漏洞方面的基准测试

Utsav Maskey, Chencheng Zhu, Usman Naseem

机构 * Macquarie University(麦考瑞大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30481 2026-06-01 cs.CL 91%

When English Rewrites Local Knowledge: Global Narrative Dominance in Large Language Models

当英语重写地方知识:大语言模型中的全球叙事主导

Md Arid Hasan, Ruwad Naswan, Farhan Samir, Sharifa Sultana, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) BUET(巴特利特大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过构建孟加拉语文化数据集CulturalNB,评估大语言模型在低资源文化背景下的跨语言知识一致性,发现英语提问会系统性地增加全球替代和制度框架,减少地方视角覆盖,表明文化失败不仅是知识缺失,更是根基和叙事优先级问题。

Comments Submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28313 2026-05-28 cs.CL 91%

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

基于大语言模型的论证质量评估:一种成对Bradley-Terry方法

Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide Ceolin

机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28037 2026-05-28 cs.CL 91%

Personality, Role, and Expressive Style in Large Language Models: An Interactionist Analysis

大型语言模型中的个性、角色与表达风格:一种互动主义分析

Moe Nagao, Koichiro Terao, Mikio Nakano, Naoto Iwahashi

机构 * Okayama Prefectural University(冈山县立大学) AI & Humans Lab(人工智能与人类实验室) C4A Research Institute(C4A研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究从互动主义视角,通过因子设计实验分析个性特质、对话角色和表达风格如何共同影响大型语言模型生成对话中感知的大五人格特质表达。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18481 2026-05-28 q-fin.TR cs.AI 91%

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试

Wentao Zhang, Mingxuan Zhao, Jincheng Gao, Jieshun You, Huaiyu Jia, Yilei Zhao, Bo An, Shuo Sun

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。

详情

展开后加载摘要…

URL PDF HTML 收藏