arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2511.13189 2025-11-18 cs.CV cs.IR 86%

Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework

Diego Ortego, Marlon Rodríguez, Mario Almagro, Kunal Dahiya, David Jiménez, Juan C. SanMiguel

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract)

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18601 2025-10-22 cs.CR cs.SE 86%

Evaluating Large Language Models in detecting Secrets in Android Apps

Marco Alecci, Jordan Samhi, Tegawendé F. Bissyandé, Jacques Klein

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 86%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08569 2025-10-10 cs.CL cs.AI cs.LG 86%

ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation

Qin Liu, Jacob Dineen, Yuxi Huang, Sheng Zhang, Hoifung Poon, Ben Zhou, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04278 2025-09-29 cs.HC 86%

EmoPrefer: Can Large Language Models Understand Human Emotion Preferences?

Zheng Lian, Licai Sun, Lan Chen, Haoyu Chen, Zebang Cheng, Fan Zhang, Ziyu Jia, Ziyang Ma, Fei Ma, Xiaojiang Peng, Jianhua Tao

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09975 2025-09-15 cs.SE 86%

Development of Automated Software Design Document Review Methods Using Large Language Models

Takasaburo Fukuda, Takao Nakagawa, Keisuke Miyazaki, Susumu Tokumoto

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19570 2025-07-29 cs.AR cs.MA 86%

MCP4EDA: LLM-Powered Model Context Protocol RTL-to-GDSII Automation with Backend Aware Synthesis Optimization

Yiting Wang, Wanghao Ye, Yexiao He, Yiran Chen, Gang Qu, Ang Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments)

Comments 7 pages, 5 figures Keywords: Model Context Protocol, Electronic Design Automation, Large Language Models, Synthesis Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06218 2025-06-09 cs.CV 86%

STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving

Christian Fruhwirth-Reisinger, Dušan Malić, Wei Lin, David Schinagl, Samuel Schulter, Horst Possegger

专题命中 评测与基准 :language model(title,abstract);large language model(title)

Comments Dataset: https://huggingface.co/datasets/ivc-lrp/STSBench, Code: https://github.com/LRP-IVC/STSBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12340 2025-06-09 cs.SE 86%

A Large Language Model Approach to Identify Flakiness in C++ Projects

Xin Sun, Daniel Ståhl, Kristian Sandahl

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00678 2025-05-22 cs.LG cs.AI cs.CL 86%

How Contaminated Is Your Benchmark? Quantifying Dataset Leakage in Large Language Models with Kernel Divergence

Hyeong Kyu Choi, Maxim Khanov, Hongxin Wei, Yixuan Li

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11622 2025-04-17 cs.CR cs.SD eess.AS 86%

Making Acoustic Side-Channel Attacks on Noisy Keyboards Viable with LLM-Assisted Spectrograms' "Typo" Correction

Seyyed Ali Ayati, Jin Hyun Park, Yichen Cai, Marcus Botacin

机构 * Texas A&M University(德克萨斯农工大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments)

Comments Length: 13 pages Figures: 5 figures Tables: 7 tables Keywords: Acoustic side-channel attacks, machine learning, Visual Transformers, Large Language Models (LLMs), security Conference: Accepted at the 19th USENIX WOOT Conference on Offensive Technologies (WOOT '25). Licensing: This paper is submitted under the CC BY Creative Commons Attribution license. arXiv admin note: text overlap with arXiv:2502.09782

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17475 2025-04-08 eess.SP cs.AI cs.CL cs.LG 86%

ECG-Expert-QA: A Benchmark for Evaluating Medical Large Language Models in Heart Disease Diagnosis

Xu Wang, Jiaju Kang, Puyu Han, Yubao Zhao, Qian Liu, Liwenfei He, Lingqiong Zhang, Lingyun Dai, Yongcheng Wang, Jie Tao

机构 * Zhejiang University School of Medicine(浙江大学医学院) The First Affiliated Hospital(第一附属医院) Liangzhu Laboratory(良渚实验室) Shandong Jianzhu University(山东建筑大学) FUXI AI Lab(伏羲人工智能实验室) Beijing Normal University(北京师范大学) Southern University of Science and Technology(南方科技大学) China University of Geosciences (Wuhan)(中国地质大学(武汉)) Hangzhou Baorun Biotechnology Co., Ltd.(杭州宝润生物科技有限公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11081 2025-02-14 cs.SE cs.AI cs.CL cs.LG 86%

What can Large Language Models Capture about Code Functional Equivalence?

Nickil Maveli, Antonio Vergari, Shay B. Cohen

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Findings of NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14296 2025-01-27 cs.IR 86%

Multi-stage Large Language Model Pipelines Can Outperform GPT-4o in Relevance Assessment

Julian A. Schnabel, Johanne R. Trippas, Falk Scholer, Danula Hettiachchi

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments WebConf'25, WWW'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18019 2024-11-28 cs.SE 86%

A Real-World Benchmark for Evaluating Fine-Grained Issue Solving Capabilities of Large Language Models

Ruida Hu, Chao Peng, Jingyi Ren, Bo Jiang, Xiangxin Meng, Qinyun Wu, Pengfei Gao, Xinchen Wang, Cuiyun Gao

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19753 2024-11-11 cs.CY 86%

A Comparative Analysis on Ethical Benchmarking in Large Language Models

Kira Sam, Raja Vavekanand

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract)

Comments arXiv admin note: This version has been removed by arXiv administrators due to copyright infringement and inappropriate text reuse from external sources

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06505 2024-11-11 cs.SE 86%

Multilingual Crowd-Based Requirements Engineering Using Large Language Models

Arthur Pilone, Paulo Meirelles, Fabio Kon, Walid Maalej

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments Accepted to the Insightful Ideas and Emerging Results Track of the 38th Brazilian Symposium on Software Engineering (SBES 2024)

Journal ref Proceedings of the 38th Brazilian Symposium on Software Engineering, 2024, 679-685

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01569 2024-10-03 cs.CL cs.AI cs.LG 86%

Evaluating Large Language Models Using Contrast Sets: An Experimental Approach

Manish Sanwal

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Journal ref Article ID: IJAIRD_02_02_007, Volume 2, Issue 2, July-Dec 2024, pp. 90-97

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18984 2024-10-01 cs.CL cs.AI cs.LG 86%

Harnessing Large Language Models: Fine-tuned BERT for Detecting Charismatic Leadership Tactics in Natural Language

Yasser Saeid, Felix Neubürger, Stefanie Krügl, Helena Hüster, Thomas Kopinski, Ralf Lanwehr

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments The 2024 IEEE 3rd Conference on Information Technology and Data Science, CITDS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13989 2024-09-24 cs.CL cs.AI cs.LG physics.chem-ph q-bio.BM 86%

ChemEval: A Comprehensive Multi-Level Chemical Evaluation for Large Language Models

Yuqing Huang, Rongyang Zhang, Xuesong He, Xuyang Zhi, Hao Wang, Xin Li, Feiyang Xu, Deguang Liu, Huadong Liang, Yi Li, Jian Cui, Zimu Liu, Shijin Wang, Guoping Hu, Guiquan Liu, Qi Liu, Defu Lian, Enhong Chen

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14206 2024-09-13 cs.CV 86%

LLM4VG: Large Language Models Evaluation for Video Grounding

Wei Feng, Xin Wang, Hong Chen, Zeyang Zhang, Houlun Chen, Zihan Song, Yuwei Zhou, Yuekui Yang, Haiyang Wu, Wenwu Zhu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07537 2024-08-16 cs.SE 86%

Usefulness of data flow diagrams and large language models for security threat validation: a registered report

Winnie Bahati Mbaka, Katja Tuma

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03411 2024-07-26 cs.CV 86%

Interactive Text-to-Image Retrieval with Large Language Models: A Plug-and-Play Approach

Saehyung Lee, Sangwon Yu, Junsung Park, Jihun Yi, Sungroh Yoon

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments ACL 2024 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07924 2024-07-12 math.OC cs.AI cs.CL cs.LG 86%

Solving General Natural-Language-Description Optimization Problems with Large Language Models

Jihai Zhang, Wei Wang, Siyan Guo, Li Wang, Fangquan Lin, Cheng Yang, Wotao Yin

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04973 2024-07-09 cs.AI cs.CL cs.CV cs.LG 86%

LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts

Yijia Xiao, Edward Sun, Tianyu Liu, Wei Wang

专题命中 评测与基准 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments LogicVista benchmarks the logical reasoning of multimodal large language models in visual tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12430 2024-06-19 cs.CL cs.AI cs.LG 86%

PlanRAG: A Plan-then-Retrieval Augmented Generation for Generative Large Language Models as Decision Makers

Myeonghwa Lee, Seonho An, Min-Soo Kim

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20363 2024-06-03 cs.CV 86%

LLMGeo: Benchmarking Large Language Models on Image Geolocation In-the-wild

Zhiqiang Wang, Dejia Xu, Rana Muhammad Shahroz Khan, Yanbin Lin, Zhiwen Fan, Xingquan Zhu

专题命中 评测与基准 :language model(title,abstract);large language model(title)

Comments 7 pages, 3 figures, 5 tables, CVPR 2024 Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04585 2024-05-09 cs.CL cs.AI cs.LG 86%

PoPE: Legendre Orthogonal Polynomials Based Position Encoding for Large Language Models

Arpit Aggarwal

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09171 2024-02-15 cs.SE 86%

Automated Unit Test Improvement using Large Language Models at Meta

Nadia Alshahwan, Jubin Chheda, Anastasia Finegenova, Beliz Gokkaya, Mark Harman, Inna Harper, Alexandru Marginean, Shubho Sengupta, Eddy Wang

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments 12 pages, 8 figures, 32nd ACM Symposium on the Foundations of Software Engineering (FSE 24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00282 2024-02-02 eess.AS cs.SD 86%

PAM: Prompting Audio-Language Models for Audio Quality Assessment

Soham Deshmukh, Dareen Alharthi, Benjamin Elizalde, Hannes Gamper, Mahmoud Al Ismail, Rita Singh, Bhiksha Raj, Huaming Wang

专题命中 评测与基准 :language model(title,abstract);prompting(title)

详情

展开后加载摘要…

URL PDF HTML 收藏