arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2603.02528 2026-03-04 cs.AI cs.RO 92%

LLM-MLFFN: Multi-Level Autonomous Driving Behavior Feature Fusion via Large Language Model

LLM-MLFFN: 通过大语言模型的多级自动驾驶行为特征融合

Xiangyu Li, Tianyi Wang, Xi Cheng, Rakesh Chowdary Machineni, Zhaomiao Guo, Sikai Chen, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) Systems Engineering Program, Cornell University(康奈尔大学系统工程项目) Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 LLM-MLFFN通过大语言模型的多级特征融合提升自动驾驶行为分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14564 2026-02-17 cs.CL 92%

Assessing Large Language Models for Medical QA: Zero-Shot and LLM-as-a-Judge Evaluation

评估大型语言模型用于医疗问答:零样本和LLM作为评判者评估

Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Tareque Mohmud Chowdhury

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Gazipur, Bangladesh(计算机科学与工程系,伊斯兰技术大学,加兹ipur,孟加拉国) Department of Computer Science(计算机科学系) Engineering, Islamic University of Technology, Gazipur, Bangladesh(工程,伊斯兰技术大学,加兹ipur,孟加拉国)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了多种大型语言模型在医疗问答任务中的性能,发现大模型表现更优,同时指出在实际部署中需权衡效率与避让问题。

Comments Accepted in 28th ICCIT, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01020 2025-12-25 cs.CR cs.LG 92%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击

Aashray Reddy, Andrew Zagula, Nicholas Saban

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。

Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09772 2025-12-15 cs.CL 92%

DeepSeek's WEIRD Behavior: The cultural alignment of Large Language Models and the effects of prompt language and cultural prompting

DeepSeek的WEIRD行为:大型语言模型的文化契合与提示语言和文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 芝加哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在不同文化提示下的对齐行为,发现DeepSeek-V3和GPT-5在美文化下表现突出,而GPT-4在英文化下更接近中国,文化提示可调整这种对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22598 2025-12-01 cs.LG 92%

LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system

LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境

Huanyu Li, Zongyuan Li, Wei Huang, Xian Guo

机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。

Comments 8 pages, 5 figures, ICICN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18966 2025-11-25 cs.AI cs.CR 92%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15216 2025-11-25 cs.CL cs.CY 92%

Assessing Historical Structural Oppression Worldwide via Rule-Guided Prompting of Large Language Models

通过规则引导提示法评估全球历史结构性压迫

Sreejato Chatterjee, Linh Tran, Quoc Duy Nguyen, Roni Kirson, Drue Hamlin, Harvest Aquino, Hanjia Lyu, Jiebo Luo, Timothy Dye

机构 * Goergen Institute for Data Science(数据科学研究所) University of Rochester(罗切斯特大学) Department of Computer Science(计算机科学系) Department of Economics(经济学系) College of Arts and Sciences(文理学院) Rochester Institute of Technology(罗切斯特理工学院) Department of Sociology and Anthropology(社会学与人类学系) Department of Public Health(公共卫生系) University of Rochester School of Medicine(罗切斯特大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型和规则引导提示法,评估全球历史结构性压迫,提供可扩展的跨文化测量工具。

Comments To appear in the 2025 IEEE International Conference on Big Data (IEEE BigData 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10819 2025-11-19 cs.CL 92%

LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation

Grace Byun, Swati Rajwal, Jinho D. Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06479 2025-07-09 cs.AI 92%

ExKG-LLM: Leveraging Large Language Models for Automated Expansion of Cognitive Neuroscience Knowledge Graphs

Ali Sarabadani, Kheirolah Rahsepar Fard, Hamid Dalvand

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19450 2025-05-07 cs.HC cs.AI 92%

Secret Use of Large Language Model (LLM)

Zhiping Zhang, Chenxinran Shen, Bingsheng Yao, Dakuo Wang, Tianshi Li

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 26 pages, 3 figures, and accepted at CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20612 2025-04-30 cs.CR cs.AI cs.ET 92%

The Hidden Risks of LLM-Generated Web Application Code: A Security-Centric Evaluation of Code Generation Capabilities in Large Language Models

Swaroop Dora, Deven Lunkad, Naziya Aslam, S. Venkatesan, Sandeep Kumar Shukla

机构 * Department of IT IIIT Allahabad(信息技术系,印度阿拉哈巴德IIIT) Department of ECE IIIT Allahabad(电子工程系,印度阿拉哈巴德IIIT) Department of CSE IIT Kanpur(计算机科学与工程系,印度坎purIIT)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04601 2025-04-15 cs.CL 92%

ProtoMed-LLM: An Automatic Evaluation Framework for Large Language Models in Medical Protocol Formulation

Seungjun Yi, Jaeyoung Lim, Juyong Yoon

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Oral Presentation at the 2025 Conference on Health IT and Analytics (CHITA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01448 2025-04-03 cs.IR cs.LG 92%

LLM-VPRF: Large Language Model Based Vector Pseudo Relevance Feedback

Hang Li, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15932 2025-02-25 cs.CL cs.CR 92%

CVE-LLM : Ontology-Assisted Automatic Vulnerability Evaluation Using Large Language Models

Rikhiya Ghosh, Hans-Martin von Stockhausen, Martin Schmitt, George Marica Vasile, Sanjeev Kumar Karn, Oladimeji Farri

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments arXiv admin note: substantial text overlap with arXiv:2407.14640

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02289 2025-02-05 cs.CL 92%

Evalita-LLM: Benchmarking Large Language Models on Italian

Bernardo Magnini, Roberto Zanoli, Michele Resta, Martin Cimmino, Paolo Albano, Marco Madeddu, Viviana Patti

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 42 pages, 1 figure, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00294 2024-11-05 cs.CL 92%

LLM-Ref: Enhancing Reference Handling in Technical Writing with Large Language Models

Kazi Ahmed Asif Fuad, Lizhong Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15310 2024-09-25 cs.LG cs.CV 92%

Visual Prompting in Multimodal Large Language Models: A Survey

Junda Wu, Zhehao Zhang, Yu Xia, Xintong Li, Zhaoyang Xia, Aaron Chang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N. Metaxas, Lina Yao, Jingbo Shang, Julian McAuley

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10825 2024-09-17 eess.SY cs.LG cs.SY 92%

Large Language Model (LLM) for Telecommunications: A Comprehensive Survey on Principles, Key Techniques, and Opportunities

Hao Zhou, Chengming Hu, Ye Yuan, Yufei Cui, Yili Jin, Can Chen, Haolun Wu, Dun Yuan, Li Jiang, Di Wu, Xue Liu, Charlie Zhang, Xianbin Wang, Jiangchuan Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12787 2024-09-09 cs.CR cs.AI 92%

LLM-PBE: Assessing Data Privacy in Large Language Models

Qinbin Li, Junyuan Hong, Chulin Xie, Jeffrey Tan, Rachel Xin, Junyi Hou, Xavier Yin, Zhun Wang, Dan Hendrycks, Zhangyang Wang, Bo Li, Bingsheng He, Dawn Song

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02363 2024-07-25 cs.CV cs.CL 92%

LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model

Yulin Luo, Ruichuan An, Bocheng Zou, Yiming Tang, Jiaming Liu, Shanghang Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ECCV24 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13244 2024-07-19 cs.CL cs.DB 92%

PM-LLM-Benchmark: Evaluating Large Language Models on Process Mining Tasks

Alessandro Berti, Humam Kourani, Wil M. P. van der Aalst

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08067 2024-07-12 cs.HC cs.AI 92%

On LLM Wizards: Identifying Large Language Models' Behaviors for Wizard of Oz Experiments

Jingchao Fang, Nikos Arechiga, Keiichi Namaoshi, Nayeli Bravo, Candice Hogan, David A. Shamma

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments To be published in ACM IVA 2024

Journal ref ACM International Conference on Intelligent Virtual Agents (IVA 2024), September 16-19, 2024, Glasgow, United Kingdom. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00702 2024-07-02 cs.CL 92%

Scaling Technology Acceptance Analysis with Large Language Model (LLM) Annotation Systems

Pawel Robert Smolinski, Joseph Januszewicz, Jacek Winiarski

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments This is a preprint of a paper accepted for the 32nd International Conference on Information Systems Development (ISD 2024), Gdansk, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13809 2024-06-06 cs.CL 92%

Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models

Qingyu Lu, Baopu Qiu, Liang Ding, Kanjian Zhang, Tom Kocmi, Dacheng Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06524 2024-05-13 cs.CL 92%

Prompting Large Language Models with Knowledge Graphs for Question Answering Involving Long-tail Facts

Wenyu Huang, Guancheng Zhou, Mirella Lapata, Pavlos Vougiouklis, Sebastien Montella, Jeff Z. Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04909 2024-05-09 cs.CV cs.AI 92%

Traj-LLM: A New Exploration for Empowering Trajectory Prediction with Pre-trained Large Language Models

Zhengxing Lan, Hongbo Li, Lingshan Liu, Bo Fan, Yisheng Lv, Yilong Ren, Zhiyong Cui

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09329 2024-04-23 cs.CL 92%

Large Language Models are as persuasive as humans, but how? About the cognitive effort and moral-emotional language of LLM arguments

Carlos Carrasco-Farre

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16008 2024-03-26 cs.CL 92%

CBT-LLM: A Chinese Large Language Model for Cognitive Behavioral Therapy-based Mental Health Question Answering

Hongbin Na

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07889 2024-02-07 cs.CL 92%

LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models

Adian Liusie, Potsawee Manakul, Mark J. F. Gales

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments To Appear at EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00284 2024-01-02 cs.CL 92%

Evaluation is all you need. Prompting Generative Large Language Models for Annotation Tasks in the Social Sciences. A Primer using Open Models

Maximilian Weber, Merle Reichardt

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏