arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2798 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.27674 2026-07-31 cs.SE 新提交 94%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19828 2026-06-19 cs.CV 新提交 94%

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

3D-PLOT-LLM: 用于三维大语言模型的部件级对象标记

Jintang Xue, Xinyu Wang, Yixing Wu, Jingwen Chen, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 提出3D-PLOT-LLM,通过重组输入标记流使部件可直接通过LLM词汇寻址,无需分割解码器或边界框,在部件级基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12443 2026-06-12 cs.CY cs.AI cs.CL 新提交 94%

Occupational Prompting Reveals Cultural Bias in Large Language Models

职业提示揭示大型语言模型中的文化偏见

Maksim E. Eren, Andrea Brennen, Ryan C. Barron, Eric Michalak

机构 * U.S. Government(美国政府)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

AI总结 通过职业提示(如会计师、教师)替代国籍提示,研究开源LLM在价值观调查中的响应,发现不同职业导致文化地图内偏移,表明职业角色引发结构化价值模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17183 2026-08-19 cs.AI cs.CR 新提交 93%

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

基准的基准:评估小型语言模型的自动化安全基准

Nyamtulla Shaik, Fengjun Li, Bo Luo

机构 * University of Kansas(堪萨斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 本研究通过评估5个基准套件在26个开源SLMs上的表现,发现现有以LLM为中心的安全基准无法可靠评估SLMs,模糊性会导致模型排名出现显著变化。

Comments This paper is accepted for publication at ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15535 2026-08-18 cs.CL cs.LG 新提交 93%

L3Cube-IndicQuest v2: A Large-Scale Multilingual Benchmark for Evaluating Factual Knowledge of Large Language Models Across Indic Languages

L3Cube-IndicQuest v2:用于评估大型语言模型(LLM)印度诸语言事实知识的大规模多语言基准

Rinit Jain, Tirthraj Mahajan, Advait Joshi, Raviraj Joshi

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) L3Cube Labs(L3Cube实验室) Indian Institute of Technology Madras(马德拉斯印度理工学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究构建了面向印度诸语言的大规模多语言问答基准L3Cube-IndicQuest v2,评估6种LLM的事实知识,发现前沿商业模型表现突出,开放权重模型Gemma4 31B优于Sarvam 30B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09717 2026-08-11 cs.CL cs.AI cs.CY 新提交 93%

How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans

大型语言模型如何评判社交吸引力?来自跨多个LLM与人类的基于理论的人格特质评分的证据

Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探究LLMs能否评估社交吸引力,经三项研究发现,34个LLM评分稳定且与人类排序一致,但LLMs对吸引力与无吸引力档案的评分偏差更大,且两者均无性别呈现的显著整体效应。

Comments 9 pages, 2 figures, 2 tables. Includes technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19183 2026-06-18 cs.CL cs.AI 新提交 93%

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

语言模型作为接口而非预言机:用于小儿阑尾炎的混合LLM-ML系统

Soheyl Bateni, Maryam Abdolali

机构 * K. N. Toosi University of Technology(K.N. Toosi技术大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ClaMPAPP混合系统,利用LLM从自由文本中提取结构化特征,再由XGBoost分类器进行诊断,在两个独立队列中优于端到端LLM,提高了诊断稳定性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00054 2026-08-04 cs.AI cs.SE 新提交 93%

RAG-TESTER: Automated End-to-End Testing of Retrieval-Augmented Large Language Models

RAG-TESTER:检索增强型大语言模型的自动化端到端测试工具

Ange Maiztegi, Jon Ayerdi, Miren Illarramendi, Aitor Arrieta

机构 * Mondragon University(蒙德拉贡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 RagTester是针对RAG系统的自动化端到端测试方法,通过生成测试用例、利用LLM评估结果,在24种配置中20种优于基线,可有效检测RAG的交互故障并支持部署评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07494 2026-08-11 cs.HC cs.AI 新提交 93%

How to Ask the AI: A User Perspective Survey for Large Language Model Prompting

如何向AI提问:大型语言模型提示工程的用户视角调查

Yiqun Zhang, Yunfan Zhang, Mingjie Zhao, Sen Feng, Yiu-ming Cheung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究从用户视角开展大型语言模型提示工程调查,提出提示有效性评估策略、应用工作流并维护开源项目,为用户制定适配场景的有效提示提供可操作指南。

Comments Accepted to TAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29389 2026-08-03 cs.LG cs.SE 新提交 93%

Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies

基于大语言模型的流体系统仿真代码生成:模型与提示策略的基准测试

Jan Marius Stürmer, Jascha Knack, Tobias Koch, Andreas Weinmann

机构 * German Aerospace Centre (DLR)(德国航空航天中心) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施韦因富特应用技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 本研究通过系统比较10种大语言模型与6种提示策略,评估其将流体系统模型图表示转换为WNTR、Modelica代码的能力,为相关设计流程提供指导,同时指出仿真保真度仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17051 2026-08-19 cs.CL cs.AI 新提交 93%

Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss

基于机构特定的大语言模型提示工程恢复去标识化系统及其黄金标准均遗漏的受保护健康信息

Daniel Palacios, Matthew Brady Neeley, Angel Adetomike Otto, Shalini Dhamodharan, John P. Woodhouse, Chi-fan Lin, Mark Zobeck, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(简与丹·邓肯神经学研究所)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出校准良好的上下文学习(ICL)的大语言模型(LLM),可通过机构特定提示恢复去标识化系统遗漏的受保护健康信息(PHI),平衡精确率与召回率,是专用去标识化系统的有效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 93%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交 93%

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19424 2026-07-23 cs.CR cs.AI cs.CL 新提交 93%

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

JailMeter:一种基于证据的大语言模型越狱攻击评估框架

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

专题命中 评测与基准 :SLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);small language model(abstract)

AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14109 2026-07-17 cs.CL cs.AI 新提交 93%

Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation

简单性悖论:揭穿关于大语言模型评估中提示和数据集的神话

Inder Preet, Shuxin Lin, Dhaval Patel

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型评估中提示和数据集相关问题,通过对8种提示技术在10个MCQA数据集上的实证研究,发现基线提示常优于复杂技术,还研究了相关关键现象,表明LLM评估社区或使提示工程过复杂,存在性能差距,为模型改进提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28062 2026-06-29 cs.DB cs.AI cs.CL cs.IR 新提交 93%

Single and Multi Truth Data Fusion using Large Language Models

使用大型语言模型的单真值与多真值数据融合

Hira Beril Kucuk, Norman W Paton, Jiaoyan Chen, Zhenyu Wu

机构 * Department of Computer Science University of Manchester(计算机科学系曼彻斯特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究利用大型语言模型(LLM)解决表格数据的单真值和多真值数据融合问题,通过多种提示策略在三个基准数据集上实验,结果表明LLM方法优于传统无监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27383 2026-06-29 cs.DL cs.AI cs.CL 新提交 93%

CalBrief: A Pilot Diagnostic Benchmark for Evidence-Calibrated Scientific Briefing with Large Language Models

CalBrief:面向大型语言模型证据校准科学简报的试点诊断基准

Yu Fu, Yongqi Kang, Yong Zhao

机构 * Sichuan University(四川大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CalBrief基准,通过16个科学证据包和96个人工验证要点,诊断LLM在证据校准简报中的不足,发现保守性主要源于标签空间扩展而非信号注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17350 2026-06-17 cs.CL cs.AI 新提交 93%

Do Large Language Models Always Tell The Same Stories?

大型语言模型总是讲述相同的故事吗?

Thennal DK, Hans Ole Hatzel

机构 * University of Hamburg(汉堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 通过对比框架和人类故事数据集,研究10种LLM生成故事的叙事相似性,发现LLM故事比人类故事更相似,前沿模型趋向于“平均”通用叙事,且常见缓解策略无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 92%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31307 2026-07-01 cs.CL 新提交 92%

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。

Comments Accepted at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15577 2026-06-16 cs.AI 新提交 92%

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

大型语言模型作为优化器:直接方法与工具增强方法的调查及其性能前沿

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic

机构 * University of Zagreb, Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 综述LLM作为优化器的三种范式(直接优化、工具增强优化、工具创造优化),分析性能前沿与推理差距,探讨直接优化的未来潜力与工具增强优化的可审计性之间的权衡。

Comments 6 pages, 1 figure, 2 tables, accepted at 49th ICT and Electronics Convention, MIPRO - https://mipro.hr; Paper ID: #23463

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26348 2026-07-30 cs.CL cs.AI cs.CY cs.HC 新提交 92%

When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

当合成用户失效时:LLM模拟人类调查回复的跨领域基准测试

Zihan Chen, Di Zhu, Lei Nico Zheng

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建跨领域基准与评估框架,发现LLM模拟人类调查回复存在个体表现逊于基线、过度确定人口统计特征等失效问题,且无法通过更大模型纠正,会误导细分目标决策。

Comments 19 pages, 5 figures, 4 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26130 2026-06-26 cs.CL cs.AI cs.DL 新提交 92%

Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods

像科学家一样思考?LLM生成研究方法的结构性研究

Francesca Carlon, Brecht Verbeken, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(布鲁塞尔自由大学imec-SMIT) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过对比LLM在最小提示下生成的方法建议与论文实际方法,发现LLM在模型选择上存在显著偏差,且方法多样性大幅缩减。

Comments 46 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25782 2026-06-25 cs.CL cs.AI 新提交 92%

Do Encoders Suffice? A Systematic Comparison of Encoder and Decoder Safety Judges for LLM Adversarial Evaluation

编码器足够吗?用于LLM对抗性评估的编码器与解码器安全评判器的系统比较

Han Jeon, Shiv Medler, Joseph Voyles, Matt Wood

机构 * PricewaterhouseCoopers(普华永道)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 系统比较ModernBERT系列编码器分类器与基于LLM的解码器评判器在识别有害LLM输出上的性能,发现编码器可在保持低延迟和低成本的同时接近LLM评判器的效果。

Comments 13 pages, 5 figures, Accepted into ICANN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08247 2026-06-09 eess.AS cs.AI cs.LG eess.SP 新提交 92%

AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

AeroSpectra Sentinel:一种用于从呼吸音和临床信号进行急性哮喘风险评估的可审计LLM提示链决策支持工作流

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉隆梭国际技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出AeroSpectra Sentinel,结合STFT呼吸音分析、轻量ML筛查、临床特征融合和五阶段LLM提示链,实现可审计的急性哮喘风险评估,在公开数据集上验证了音频筛查和LLM工作流的有效性。

Comments 10 pages, 8 figures, 5 tables, 14 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 92%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 92%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17582 2026-06-17 cs.DB 新提交 92%

Collaborative Large and Small Language Models for Accurate and Scalable Data Repair

协作式大小语言模型实现准确且可扩展的数据修复

Qian Chen, Jianwei Wang, Wenjie Zhang

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 提出LasRepair框架,利用大语言模型作为指导者选择全局修复上下文,小语言模型作为校正者高效修复错误数据,并通过EM过程和置信度加权进一步提升修复质量。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24573 2026-07-28 cs.AI 新提交 92%

LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports

LLM - 足球竞技场:在体育领域的现实世界预测中对大语言模型进行基准测试

Jonas Schröder, Jonas Schweisthal, Oliver Müller, Markus Weinmann, Stefan Feuerriegel

机构 * MCML & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) Paderborn University(帕德博恩大学) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究旨在评估大语言模型预测现实世界体育赛事的能力,核心方法是引入LLM - 足球竞技场这一前瞻性实时基准,通过对2026年世界杯的评估,详细分析模型性能各维度表现,为LLMs预测性能提供新证据及开源平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20436 2026-06-19 cs.CR cs.AI 新提交 92%

Multi-View Decompilation for LLM-Based Malware Classification

基于LLM的恶意软件分类的多视角反编译

Bercan Turkmen, Vyas Raina

机构 * Independent Researcher(独立研究员) SPARK

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出多反编译器视角提升LLM恶意软件分类性能,通过Ghidra和RetDec的互补伪C代码提高召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏