arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2509.11708 2026-02-03 cs.SE 89%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20879 2026-01-30 cs.SE 89%

A Survey on Large Language Model Impact on Software Evolvability and Maintainability: the Good, the Bad, the Ugly, and the Remedy

对大型语言模型对软件可变性与可维护性影响的综述:好坏优劣及解决方法

Bruno Claudino Matias, Savio Freire, Juliana Freitas, Felipe Fronchetti, Kostadin Damevski, Rodrigo Spinola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型对软件可变性与可维护性的影响,分析了其带来的积极影响、潜在风险及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20727 2026-01-29 cs.CY 89%

Audit Trails for Accountability in Large Language Models

为大型语言模型问责制设计的审计追踪

Victor Ojewale, Harini Suresh, Suresh Venkatasubramanian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于大型语言模型的审计追踪机制,通过生命周期框架和参考架构,实现持续问责,提供可重用的开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18945 2026-01-28 cs.DL 89%

Large Language Models for Departmental Expert Review Quality Scores

大型语言模型用于部门专家评审质量评分

Liv Langfeldt, Dag W. Aksnes, Henrik Karlstrøm, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 89%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13118 2026-01-21 cs.SE 89%

Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization

为大型语言模型生成代码的指南:实证分析

Alessandro Midolo, Alessandro Giagnorio, Fiorella Zampetti, Rosalia Tufano, Gabriele Bavota, Massimiliano Di Penta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过实证分析提出10条提示优化指南,帮助开发者改进代码生成提示,提升LLM辅助软件开发工具的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 89%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 89%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02533 2026-01-13 cs.SE 89%

Meta-Fair: AI-Assisted Fairness Testing of Large Language Models

Meta-Fair: 大型语言模型的AI辅助公平性测试

Miguel Romero-Arjona, José A. Parejo, Juan C. Alonso, Ana B. Sánchez, Aitor Arrieta, Sergio Segura

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Meta-Fair通过元测试法和LLM能力,实现大型语言模型的自动化公平性测试,揭示偏见并提高评估一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08637 2026-01-12 cs.CL cs.AI cs.LG 89%

An Evaluation on Large Language Model Outputs: Discourse and Memorization

对大型语言模型输出的评估:论述与记忆

Adrian de Wynter, Xun Wang, Alex Sokolov, Qilong Gu, Si-Qing Chen

机构 * Microsoft Corporation(微软公司) University of York(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了大型语言模型输出的质量,发现记忆内容与输出质量相关,并探讨了减少记忆输出的缓解策略。

Comments Final version at Natural Language Processing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16070 2026-01-09 cs.SE 89%

LLM4Perf: Large Language Models Are Effective Samplers for Multi-Objective Performance Modeling

LLM4Perf: 大语言模型在多目标性能建模中的有效性

Xin Wang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLM4Perf通过大语言模型实现多目标性能建模,展现了其在配置空间修剪和反馈优化方面的有效性,提升了性能建模的准确性。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05319 2026-01-08 cs.CV cs.CR 89%

$\mathbf{S^2LM}$: Towards Semantic Steganography via Large Language Models

$S^2LM$:通过大语言模型实现语义隐写术

Huanqi Wu, Huangbiao Xu, Runfeng Xie, Jiaxin Cai, Kaixin Zhang, Xiao Ke

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) College of Computer Science, Beijing University of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 S^2LM通过大语言模型实现语义隐写术,能够将任意句级信息嵌入图像并实现恢复。

Comments 30 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04214 2026-01-06 cs.CR 89%

Can Large Language Models Automate the Refinement of Cellular Network Specifications?

大语言模型能否自动化细胞网络规范的细化?

Jianshuo Dong, Yuanjie Li, Jun Liu, Hewu Li, Han Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大语言模型在自动化细胞网络规范细化中的应用,通过CR-Eval基准测试验证了模型的有效性,并展示了LLM专业化在提升性能方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14716 2026-01-06 cs.LG cs.AI cs.CL 89%

A Systematic Survey on Large Language Models for Algorithm Design

大型语言模型在算法设计中的系统性调研

Fei Liu, Yiming Yao, Ping Guo, Zhiyuan Yang, Zhe Zhao, Xi Lin, Xialiang Tong, Kun Mao, Zhichao Lu, Zhenkun Wang, Mingxuan Yuan, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi'an Jiaotong University(西安交通大学) Huawei Cloud EI Service Product Dept.(华为云EI服务产品部) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统性地综述了大型语言模型在算法设计中的应用,提出分类法分析其角色并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24518 2026-01-01 cs.CV 89%

Using Large Language Models To Translate Machine Results To Human Results

利用大型语言模型将机器结果转换为人类结果

Trishna Niraula, Jonathan Stubblefield

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用YOLOv5和YOLOv8结合大型语言模型生成胸部X光图像的自然语言放射学报告,验证了AI生成报告与人类报告的语义相似性及临床准确性。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24058 2026-01-01 cs.CL cs.AI cs.LG 89%

Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models

超越幻觉:一种衡量开源大语言模型可靠性的综合评分

Rohit Kumar Salla, Manoj Saravanan, Shrikar Reddy Kota

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出综合可靠性评分(CRS)用于评估开源大语言模型的可靠性,通过实验发现最可靠的系统在准确率、鲁棒性和校准不确定性间取得平衡。

Comments 5 pages, 4 tables, accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03297 2025-12-29 cs.HC 89%

"It's the only thing I can trust": Envisioning Large Language Model Use by Autistic Workers for Communication Assistance

只有一件事我可信任:面向自闭症工作者的大型语言模型在沟通辅助中的应用展望

JiWoong Jang, Sanika Moharana, Patrick Carrington, Andrew Begel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨自闭症工作者在工作中使用LLM进行沟通辅助的现象,发现参与者更倾向LLM,但专家对其建议持质疑态度,提出需关注自闭症体验的设计考量。

Comments 19 pages, 6 figure, CHI '24 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 89%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21347 2025-12-29 cs.SE 89%

Understanding the Role of Large Language Models in Software Engineering: Evidence from an Industry Survey

理解大型语言模型在软件工程中的作用:来自行业调查的证据

Vítor Mateus de Brito, Kleinner Farias

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过行业调查揭示大型语言模型在软件工程中的应用现状与影响,探讨其积极效果与潜在风险,提出需批判性使用LLM工具以提升开发效率与安全性。

Comments 4 Figures, 8 Tables, Text in Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17164 2025-12-22 cs.IR 89%

TCDE: Topic-Centric Dual Expansion of Queries and Documents with Large Language Models for Information Retrieval

基于大语言模型的查询与文档主题聚焦双扩展方法用于信息检索

Yu Yang, Feng Tian, Ping Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TCDE通过大语言模型实现查询与文档的主题聚焦双扩展,提升信息检索的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16816 2025-12-19 cs.SE 89%

Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework

迈向大型语言模型系统性反事实公平性评估:CAFFE框架

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Gemma Catolino, Andrea De Lucia, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CAFFE框架通过结构化和意图感知的方法系统评估大型语言模型的反事实公平性,提升了公平性检测的广度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13004 2025-12-16 eess.SY cs.SY 89%

Large Language Models for Power System Applications: A Comprehensive Literature Survey

大语言模型在电力系统应用中的综述:全面的文献调查

Muhammad Sarwar, Muhammad Rizwan, Mubushra Aziz, Abdul Rehman Sudais

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大语言模型在电力系统中的应用,探讨了其在故障诊断、负荷预测等领域的潜力及面临的挑战,提出未来研究方向。

Comments 17 pages, 1 table, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14295 2025-12-10 cs.CL cs.AI cs.LG 89%

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models

AraLingBench:一个用于评估大型语言模型阿拉伯语语言能力的人工标注基准

Mohammad Zbeeb, Hasan Abed Al Kader Hammoud, Sina Mukalled, Nadine Rizk, Fatima Karnib, Issam Lakkis, Ammar Mohanna, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯泰克大学) American University of Beirut (AUB)(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AraLingBench通过150道人工标注的多项选择题评估阿拉伯语LLM的语言能力,揭示模型在语法和句法推理上的不足,强调了记忆与模式识别对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07007 2025-12-10 cs.CV 89%

MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding

MELLM:一种面向微表情理解的流引导大型语言模型

Sirui Zhao, Zhengye Zhang, Shifeng Liu, Xinglong Mao, Shukang Yin, Chaoyou Fu, Tong Xu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MELLM通过结合光学流敏感性与LLM推理能力,首次实现对微表情的全面理解,显著提升微表情识别的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06248 2025-12-09 cs.SE 89%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21371 2025-12-09 eess.SY cs.SY 89%

Evaluation of Large Language Models for Numeric Anomaly Detection in Power Systems

大型语言模型在电力系统中数值异常检测中的评估

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了GPT-OSS-20B在电力系统中用于数值异常检测的性能,采用多种方法并结合三西格玛准则,探讨LLM在电网应用中的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18908 2025-12-08 eess.AS 89%

A Survey on Speech Large Language Models for Understanding

语音大语言模型理解综述

Jing Peng, Yucheng Wang, Bohan Li, Yiwei Guo, Hankun Wang, Yangui Fang, Yu Xi, Haoyu Li, Xu Li, Ke Zhang, Shuai Wang, Kai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了语音大语言模型的理解方法,分析其架构并提出解决指令敏感性和语义推理退化问题的方向。

Comments This paper has been ACCEPTED for publication as a SPECIAL ISSUE paper in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 89%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11059 2025-12-03 cs.SE 89%

Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs

Defects4C:利用C/C++漏洞基准测试大语言模型的修复能力

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Jiongchi Yu, Jiaolong Kong, Yi Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Defects4C通过提供高质量C/C++漏洞基准测试,评估大语言模型在修复C/C++程序中的有效性,揭示当前技术的局限性并推动未来研究。

Comments ASE-2025 main research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01568 2025-12-03 cs.LG cs.AI cs.CL cs.CY 89%

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism

大型语言模型是否言出必行?隐含关联、自我报告与行为利他主义之间的差距测量

Sandro Andric

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在隐含利他主义偏见和自我报告与实际行为之间存在显著差距,建议将校准差距作为衡量标准。

Comments 14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code

详情

展开后加载摘要…

URL PDF HTML 收藏