arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2509.14749 2025-09-19 cs.CL cs.IR 89%

Evaluating Large Language Models for Cross-Lingual Retrieval

Longfei Zuo, Pingjun Hong, Oliver Kraus, Barbara Plank, Robert Litschko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14623 2025-09-19 cs.SE cs.AI cs.PL cs.SY eess.SY 89%

Automating Modelica Module Generation Using Large Language Models: A Case Study on Building Control Description Language

Hanlong Wan, Xing Lu, Yan Chen, Karthik Devaprasad, Laura Hinkle

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments This is the pre-peer-review version of a journal paper; the repo is available at: https://github.com/pnnl/prompt2control

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08375 2025-09-17 cs.CL 89%

EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models

Tao Zou, Xinghua Zhang, Haiyang Yu, Minzheng Wang, Fei Huang, Yongbin Li

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15805 2025-09-17 cs.CL 89%

Keep Security! Benchmarking Security Policy Preservation in Large Language Model Contexts Against Indirect Attacks in Question Answering

Hwan Chang, Yumin Kim, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10683 2025-09-16 cs.CV cs.AI 89%

A Comparison and Evaluation of Fine-tuned Convolutional Neural Networks to Large Language Models for Image Classification and Segmentation of Brain Tumors on MRI

Felicia Liu, Jay J. Yoo, Farzad Khalvati

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03814 2025-09-16 cs.RO cs.AI 89%

Large Language Models for Multi-Robot Systems: A Survey

Peihan Li, Zijian An, Shams Abrar, Lifeng Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02074 2025-09-10 cs.CV cs.AI 89%

Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07010 2025-09-10 cs.CV cs.AI cs.ET 89%

Human-in-the-Loop: Quantitative Evaluation of 3D Models Generation by Large Language Models

Ahmed R. Sadik, Mariusz Bujny

机构 * Honda Research Institute Europe - Germany(本田欧洲研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06838 2025-09-09 cs.CL cs.CR 89%

EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models

Mohammad Reza Mirbagheri, Mohammad Mahdi Mirkamali, Zahra Motoshaker Arani, Ali Javeri, Amir Mahdi Sadeghzadeh, Rasool Jalili

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06065 2025-09-09 cs.CL 89%

KatotohananQA: Evaluating Truthfulness of Large Language Models in Filipino

Lorenzo Alfred Nery, Ronald Dawson Catignas, Thomas James Tiam-Lee

机构 * De La Salle University, Manila, Philippines(德拉萨大学,马尼拉,菲律宾)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 14 pages, 1 figure, 9 tables, 1 listing. To appear in Proceedings of NLPIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04809 2025-09-09 cs.AI cs.HC 89%

TalkToAgent: A Human-centric Explanation of Reinforcement Learning Agents with Large Language Models

Haechang Kim, Hao Chen, Can Li, Jong Min Lee

机构 * Department of Chemical and Biological Engineering, Seoul National University, Republic of Korea(化学与生物工程系,首尔国立大学) Davidson School of Chemical Engineering, Purdue University, United States(化学工程大卫森学院,普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 31 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04078 2025-09-09 cs.SE cs.AI 89%

RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models

Jingjing Liu, Zeming Liu, Zihao Cheng, Mengliang He, Xiaoming Shi, Yuhang Guo, Xiangrong Zhu, Yuanfang Guo, Yunhong Wang, Haifeng Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) East China Normal University(华东师范大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 30 pages, 12 figures, EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05665 2025-09-09 cs.CL 89%

Exploring the Limits of Large Language Models: A Systematic Evaluation of Masked Text Processing Ability through MskQA and MskCal

Fuka Matsuzaki, Haru-Tada Sato

机构 * Department of Data Science(数据科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01962 2025-09-03 cs.CL 89%

DRAssist: Dispute Resolution Assistance using Large Language Models

Sachin Pawar, Manoj Apte, Girish K. Palshikar, Basit Ali, Nitin Ramrakhiyani

机构 * TCS Research, Tata Consultancy Services Limited(塔塔咨询公司研究部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted at the 20th International Conference on Artificial Intelligence and Law (ICAIL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00987 2025-09-03 cs.AI 89%

Causal MAS: A Survey of Large Language Model Architectures for Discovery and Effect Estimation

Adib Bazgir, Amir Habibdoust, Yuwen Zhang, Xing Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 24 pages. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20008 2025-09-01 cs.AI cs.PL cs.SE 89%

QHackBench: Benchmarking Large Language Models for Quantum Code Generation Using PennyLane Hackathon Challenges

Abdul Basit, Minghao Shao, Muhammad Haider Asif, Nouhaila Innan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments To appear at the IEEE International Conference on Quantum Artificial Intelligence (QAI), Naples, Italy, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20385 2025-08-29 cs.CL 89%

CAPE: Context-Aware Personality Evaluation Framework for Large Language Models

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

机构 * Kyoto University(京都大学) IIT Kanpur(印度理工学院坎浦尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at EMNLP25 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19492 2025-08-28 cs.CY cs.CL 89%

Geopolitical Parallax: Beyond Walter Lippmann Just After Large Language Models

Mehmet Can Yavuz, Humza Gohar Kabir, Aylin Özkan

机构 * Faculty of Engineering and Natural Sciences, Işık University(工程与自然科学学院,伊斯克大学) Arky Multimedia(Arky多媒体)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 7 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18905 2025-08-27 cs.AI 89%

Interactive Evaluation of Large Language Models for Multi-Requirement Software Engineering Tasks

Dimitrios Rontogiannis, Maxime Peyrard, Nicolas Baldwin, Martin Josifoski, Robert West, Dimitrios Gunopulos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21038 2025-08-27 cs.CR cs.AI 89%

Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models

Yakai Li, Jiekang Hu, Weiduan Sang, Luping Ma, Dongsheng Nie, Weijuan Zhang, Aimin Yu, Yi Su, Qingjia Huang, Qihang Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Sinochem Energy High-Tech Co., Ltd.(中石化能源高科技有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18889 2025-08-26 cs.CR cs.AI 89%

Security Concerns for Large Language Models: A Survey

Miles Q. Li, Benjamin C. M. Fung

机构 * Infinite Optimization AI Lab, Montreal, Canada(无限优化人工智能实验室,加拿大蒙特利尔) School of Information Studies, McGill University, Montreal, Canada(信息研究学院,麦吉尔大学,加拿大蒙特利尔)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13790 2025-08-21 cs.AI 89%

The NordDRG AI Benchmark for Large Language Models

Tapio Pitkäranta

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Aalto University(阿alto大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14056 2025-08-21 cs.CL cs.DB 89%

Confidence Estimation for Text-to-SQL in Large Language Models

Sepideh Entezari Maleki, Mohammadreza Pourreza, Davood Rafiei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13257 2025-08-20 cs.AR cs.AI 89%

ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models

Wenhao Lv, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12566 2025-08-19 cs.AI 89%

Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models

Wei Song, Haonan Zhong, Ziqi Ding, Jingling Xue, Yuekang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03368 2025-08-19 cs.AI cs.GT 89%

Game Reasoning Arena: A Framework and Benchmark for Assessing Reasoning Capabilities of Large Language Models via Game Play

Lucia Cipolina-Kun, Marianna Nezhurina, Jenia Jitsev

机构 * LAION Juelich Supercomputing Center (JSC)(LAION尤利奇超级计算机中心(JSC)) Research Center Juelich (FZJ)(尤利奇研究中心(FZJ))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06371 2025-08-18 cs.CL 89%

Relationship Detection on Tabular Data Using Statistical Analysis and Large Language Models

Panagiotis Koletsis, Christos Panagiotopoulos, Georgios Th. Papadopoulos, Vasilis Efthymiou

机构 * Harokopio University(哈罗科波斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08632 2025-08-13 cs.AI 89%

AgriGPT: a Large Language Model Ecosystem for Agriculture

Bo Yang, Yu Zhang, Lanfei Feng, Yunkui Chen, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Yurui Li, Yuxuan Chen, Guijun Yang, Yong He, Runhe Huang, Shijian Li

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) College of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Geological Engineering and Geomatics, Chang’an University, China(长安大学地质工程与测绘学院) College of Biosystems Engineering and Food Science, Zhejiang University, China(浙江大学生物系统工程与食品科学学院) Faculty of Computer and Information Sciences, Hosei University, Japan(立命馆大学计算机与信息科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02141 2025-08-13 cs.CV cs.CL 89%

WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image

Yuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang, Xiyue Wang, Linlin Shen

机构 * Shenzhen University(深圳大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

Comments ICCV 2025, 38 pages, 22 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07959 2025-08-12 cs.CL 89%

Large Language Models for Subjective Language Understanding: A Survey

Changhao Song, Yazhou Zhang, Hui Gao, Ben Yao, Peng Zhang

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) School of Nursing(护理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏