arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2410.08174 2025-07-01 cs.CL cs.AI cs.LG cs.MM 89%

Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models

Qingni Wang, Tiantian Geng, Zhiyuan Wang, Teng Wang, Bo Fu, Feng Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学) Southern University of Science and Technology(南方科技大学) University of Birmingham(伯明翰大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ICLR 2025 Spotlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11484 2025-06-26 cs.SE 89%

VulStamp: Vulnerability Assessment using Large Language Model

Hao Shen, Ming Hu, Xiaofei Xie, Jiaye Li, Mingsong Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19160 2025-06-25 eess.SY cs.SY 89%

AgenticControl: An Automated Control Design Framework Using Large Language Models

Mohammad Narimani, Seyyed Ali Emami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17647 2025-06-24 cs.SE 89%

Improving Compiler Bug Isolation by Leveraging Large Language Models

Yixian Qi, Jiajun Jiang, Fengjie Li, Bowen Chen, Hongyu Zhang, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17627 2025-06-24 cs.SE 89%

CodeMorph: Mitigating Data Leakage in Large Language Model Assessment

Hongzhou Rao, Yanjie Zhao, Wenjie Zhu, Ling Xiao, Meizhen Wang, Haoyu Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by ICSE 2025 (Industry Challenge Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17330 2025-06-24 cs.SE 89%

Large Language Models for Spreadsheets: Benchmarking Progress and Evaluating Performance with FLARE

Simon Thorne

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 18 Pages, 10 Tables, 1 Colour Figure

Journal ref Proceedings of the EuSpRIG 2025 Conference "Spreadsheet Risk Management", University of Greenwich, London, ISBN: 978-1-905404-60-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11874 2025-06-16 cs.SE 89%

A Short Survey on Formalising Software Requirements using Large Language Models

Arshad Beg, Diarmuid O'Donoghue, Rosemary Monahan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Submitted to SAIV 2025 as extended abstract and received valuable comments improving our draft. This version is the improved one after addressing suggestions from reviewers for improving the draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06227 2025-06-16 cs.PL 89%

CompilerGPT: Leveraging Large Language Models for Analyzing and Acting on Compiler Optimization Reports

Peter Pirkelbauer, Chunhua Liao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments C3PO at ISC HPC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10365 2025-06-13 cs.SE 89%

AutoGEEval++: A Multi-Level and Multi-Geospatial-Modality Automated Evaluation Framework for Large Language Models in Geospatial Code Generation on Google Earth Engine

Shuyang Hou, Zhangxiao Shen, Huayi Wu, Haoyue Jiao, Ziqi Liu, Lutong Xie, Chang Liu, Jianyuan Liang, Yaxian Qing, Xiaopu Zhang, Dehua Peng, Zhipeng Gui, Xuefeng Guan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18843 2025-06-12 cs.SE 89%

Improving the Readability of Automatically Generated Tests using Large Language Models

Matteo Biagiola, Gianluca Ghislotti, Paolo Tonella

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments To be published in: 2025 IEEE Conference on Software Testing, Verification and Validation (ICST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12768 2025-06-12 cs.CL cs.AI cs.LG 89%

CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization

Nay Myat Min, Long H. Pham, Yige Li, Jun Sun

机构 * School of Computing and Information Systems, Singapore Management University, Singapore(计算与信息系统学院,新加坡国立管理大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICML 2025, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16222 2025-06-12 cs.LG cs.AI cs.CL cs.CR 89%

An Interpretable N-gram Perplexity Threat Model for Large Language Model Jailbreaks

Valentyn Boreiko, Alexander Panfilov, Vaclav Voracek, Matthias Hein, Jonas Geiping

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08147 2025-06-11 cs.CL cs.AI cs.LG 89%

Multilingual Hate Speech Detection in Social Media Using Translation-Based Approaches with Large Language Models

Muhammad Usman, Muhammad Ahmad, M. Shahiki Tash, Irina Gelbukh, Rolando Quintero Tellez, Grigori Sidorov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07748 2025-06-10 cs.DL 89%

Research quality evaluation by AI in the era of Large Language Models: Advantages, disadvantages, and systemic effects

Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07978 2025-06-10 cs.CL cs.AI cs.LG 89%

AfroBench: How Good are Large Language Models on African Languages?

Jessica Ojo, Odunayo Ogundepo, Akintunde Oladipo, Kelechi Ogueji, Jimmy Lin, Pontus Stenetorp, David Ifeoluwa Adelani

机构 * Masakhane NLP(Masakhane自然语言处理) Mila - Quebec AI Institute & McGill University(Mila-魁北克人工智能研究所及麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Lelapa AI(Lelapa人工智能) The African Research Collective(非洲研究集体) University of Waterloo(滑铁卢大学) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05637 2025-06-09 cs.IT eess.SP math.IT 89%

Joint User Association and Beamforming Design for ISAC Networks with Large Language Models

Haoyun Li, Ming Xiao, Kezhi Wang, Robert Schober, Dong In Kim, Yong Liang Guan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00894 2025-06-03 cs.SE cs.AI cs.CL cs.LG 89%

CODEMENV: Benchmarking Large Language Models on Code Migration

Keyuan Cheng, Xudong Shen, Yihao Yang, Tengyue Wang, Yang Cao, Muhammad Asif Ali, Hanbin Wang, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明责任人工智能与数据分析实验室) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) Peking University(北京大学) South China University of Technology(华南理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00688 2025-06-03 cs.LG cs.AI cs.CL 89%

Existing Large Language Model Unlearning Evaluations Are Inconclusive

Zhili Feng, Yixuan Even Xu, Alexander Robey, Robert Kirk, Xander Davies, Yarin Gal, Avi Schwarzschild, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学) UK AI Security Institute(英国人工智能安全研究所) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13945 2025-06-03 cs.AI cs.CL cs.LG 89%

CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks

Jie Feng, Jun Zhang, Tianhui Liu, Xin Zhang, Tianjian Ouyang, Junbo Yan, Yuwei Du, Siqi Guo, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院、清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 D&B Track, https://github.com/tsinghua-fib-lab/CityBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23817 2025-06-02 cs.CR 89%

System Prompt Extraction Attacks and Defenses in Large Language Models

Badhan Chandra Das, M. Hadi Amini, Yanzhao Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21931 2025-05-29 eess.SY cs.SY 89%

Large Language Models for Solving Economic Dispatch Problem

Sina Mohammadi, Ali Hassan, Rouzbeh Haghighi, Van-Hai Bui, Wencong Su

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 5 pages, 3 figures, Accepted, 2025 IEEE Energy Conversion Conference and Expo (ECCE 2025), Philadelphia, PA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13398 2025-05-28 cs.LG cs.AI cs.CL physics.chem-ph q-bio.QM 89%

GeLLMO: Generalizing Large Language Models for Multi-property Molecule Optimization

Vishal Dey, Xiao Hu, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学) Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) College of Pharmacy, The Ohio State University, USA(药学院,俄亥俄州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL Main 2025. Vishal Dey and Xiao Hu contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12786 2025-05-28 cs.NI 89%

Forewarned is Forearmed: A Survey on Large Language Model-based Agents in Autonomous Cyberattacks

Minrui Xu, Jiani Fan, Xinyu Huang, Conghao Zhou, Jiawen Kang, Dusit Niyato, Shiwen Mao, Zhu Han, Xuemin, Shen, Kwok-Yan Lam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2025-05-27 cs.CV 89%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18412 2025-05-27 cs.CV cs.HC 89%

Rehabilitation Exercise Quality Assessment and Feedback Generation Using Large Language Models with Prompt Engineering

Jessica Tang, Ali Abedi, Tracey J. F. Colella, Shehroz S. Khan

机构 * KITE Research Institute(KITE研究 institute) Toronto Rehabilitation Institute(多伦多康复研究所) University Health Network(大学健康网络) Faculty of Applied Science and Engineering(应用科学与工程学院) University of Toronto(多伦多大学) College of Engineering and Technology(工程与技术学院) American University of the Middle East(中东美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 16 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17586 2025-05-26 cs.CR 89%

Large Language Models in the IoT Ecosystem -- A Survey on Security Challenges and Applications

Kushal Khatiwada, Jayden Hopper, Joseph Cheatham, Ayan Joshi, Sabur Baidya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15633 2025-05-22 cs.CL cs.AI cs.LG 89%

Listen to the Context: Towards Faithful Large Language Models for Retrieval Augmented Generation on Climate Questions

David Thulke, Jakob Kemmler, Christian Dugast, Hermann Ney

机构 * Machine Learning and Human Language Technology, RWTH Aachen University, Germany(机器学习与人类语言技术,亚琛工业大学,德国) AppTek GmbH, Aachen, Germany(AppTek GmbH,亚琛,德国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at the ClimateNLP 2025 Workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12194 2025-05-20 cs.RO 89%

Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding

Xuefei Sun, Doncey Albin, Cecilia Mauceri, Dusty Woods, Christoffer Heckman

机构 * Autonomous Robotics and Perception Group in the Computer Science Department at the University of Colorado Boulder(科罗拉多大学波德分校计算机科学系自主机器人与感知小组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11200 2025-05-19 cs.SD cs.AI cs.CL cs.HC cs.LG eess.AS 89%

Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese

Xihuai Wang, Ziyi Zhao, Siyu Ren, Shao Zhang, Song Li, Xiaoyu Li, Ziwen Wang, Lin Qiu, Guanglu Wan, Xuezhi Cao, Xunliang Cai, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07360 2025-05-13 cs.SE 89%

BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models

Xiuwei Shang, Guoqiang Chen, Shaoyin Cheng, Benlong Wu, Li Hu, Gangyang Li, Weiming Zhang, Nenghai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 23 pages, 5 figures, to be published in IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏