arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2510.12813 2025-10-16 cs.CL cs.AI cs.LG 89%

Cancer Diagnosis Categorization in Electronic Health Records Using Large Language Models and BioBERT: Model Performance Evaluation Study

Soheil Hashtarkhani, Rezaur Rashid, Christopher L Brett, Lokesh Chinthala, Fekede Asefa Kumsa, Janet A Zink, Robert L Davis, David L Schwartz, Arash Shaban-Nejad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 Pages

Journal ref JMIR Cancer, 2025 Oct 2:11:e72005

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13272 2025-10-14 cs.SE 89%

An Empirical Study of Python Library Migration Using Large Language Models

Md Mohayeminul Islam, Ajay Kumar Jha, May Mahmoud, Ildar Akhmetov, Sarah Nadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01386 2025-10-14 cs.SE 89%

Can Large Language Models Serve as Data Analysts? A Multi-Agent Assisted Approach for Qualitative Data Analysis

Zeeshan Rasheed, Muhammad Waseem, Aakash Ahmad, Kai-Kristian Kemell, Wang Xiaofeng, Anh Nguyen Duc, Pekka Abrahamsson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 34 pages and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03014 2025-10-14 cs.HC 89%

Survey of Large Language Models in Extended Reality: Technical Paradigms and Application Frontiers

Jingyan Wang, Yang Zhao, Haotian Mao, Xubo Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Withdrawn by the authors after identifying improper reuse of illustrative materials and partial omission of citations in certain sections. A revised version will be prepared to ensure accurate attribution, and comprehensive citation coverage

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09230 2025-10-13 cs.CV cs.AI cs.CL cs.LG 89%

Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras

Jindong Hong, Wencheng Zhang, Shiqin Qiao, Jianhai Chen, Jianing Qiu, Chuanyang Zheng, Qian Xu, Yun Ji, Qianyue Wen, Weiwei Sun, Hao Li, Huizhen Li, Huichao Wang, Kai Wu, Meng Li, Yijun He, Lingjie Luo, Jiankai Sun

机构 * Bytedance(字节跳动) Peking University(北京大学) Peking University People’s Hospital(北京大学人民医院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 89%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05533 2025-10-08 q-fin.PM 89%

The New Quant: A Survey of Large Language Models in Financial Prediction and Trading

Weilong Fu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05365 2025-10-08 cs.SE 89%

Test Case Generation from Bug Reports via Large Language Models: A Cognitive Layered Evaluation Framework

Irtaza Sajid Qureshi, Zhen Ming, Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11625 2025-10-07 cs.CL cs.AI cs.CV cs.LG 89%

MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering

Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学) Department of Computer Science(计算机科学系) International Institute of Information Technology(国际信息科技研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26111 2025-10-01 cs.SE 89%

A Multi-Language Object-Oriented Programming Benchmark for Large Language Models

Shuai Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, Lefei Zhang, Fu Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25240 2025-10-01 cs.LG cs.AI cs.CL 89%

HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement

Ming Yang, Xiaofan Li, Zhiyuan Ma, Dengliang Shi, Jintao Du, Yu Cheng, Weiguo Zheng

机构 * Fudan University(复旦大学) Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09897 2025-10-01 cs.CE 89%

Finetuning Large Language Model as an Effective Symbolic Regressor

Yingfan Hua, Ruikun Li, Jun Yao, Guohang Zhuang, Shixiang Tang, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23970 2025-09-30 cs.CR 89%

Binary Diff Summarization using Large Language Models

Meet Udeshi, Venkata Sai Charan Putrevu, Prashanth Krishnamurthy, Prashant Anantharaman, Sean Carrick, Ramesh Karri, Farshad Khorrami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15587 2025-09-29 cs.CL cs.AI cs.LG 89%

DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models

Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) WeChat AI, Tencent(腾讯微信AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by EMNLP 2025. Project Page: https://ttchungc.github.io/projects/divlogiceval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10655 2025-09-29 cs.CR cs.CY 89%

Safety and Security Analysis of Large Language Models: Benchmarking Risk Profile and Harm Potential

Charankumar Akiri, Harrison Simpson, Kshitiz Aryal, Aarav Khanna, Maanak Gupta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21323 2025-09-29 cs.IR 89%

SPELUNKER: Item Similarity Search Using Large Language Models and Custom K-Nearest Neighbors

Ana Rodrigues, João Mata, Rui Rego

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23601 2025-09-25 cs.CV 89%

EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis

Shengyuan Liu, Boyun Zheng, Wenting Chen, Zhihao Peng, Zhenfei Yin, Jing Shao, Jiancong Hu, Yixuan Yuan

机构 * Chinese University of Hong Kong(中国香港大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 40 pages, 22 figures; Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20136 2025-09-25 cs.SE 89%

V-GameGym: Visual Game Generation for Code Large Language Models

Wei Zhang, Jack Yang, Renshuai Tao, Lingzheng Chai, Shawn Guo, Jiajun Wu, Xiaoming Chen, Ganqu Cui, Ning Ding, Xander Xu, Hu Wei, Bowen Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20197 2025-09-24 cs.SE 89%

A Preliminary Study on the Robustness of Code Generation by Large Language Models

Zike Li, Mingwei Liu, Anji Li, Kaifeng He, Yanlin Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12613 2025-09-24 cs.CL cs.AI cs.CV cs.LG cs.MA 89%

Exploring Model Kinship for Merging Large Language Models

Yedi Hu, Yunzhi Yao, Ningyu Zhang, Huajun Chen, Shumin Deng

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) NUS-NCS Joint Lab(新加坡国立大学NCS联合实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12459 2025-09-23 cs.CL cs.AI cs.LG 89%

Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements

Guangxiang Zhao, Saier Hu, Xiaoqi Jian, Jinzhu Wu, Yuhan Wu, Change Jia, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇源科技) Zhinao(360智脑) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07973 2025-09-22 cs.CR 89%

Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey

Shang Wang, Tianqing Zhu, Bo Liu, Ming Ding, Dayong Ye, Wanlei Zhou, Philip S. Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 35 pages, 9 tables, 12 figures. To appear in ACM Computing Surveys (CSUR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12629 2025-09-19 cs.SE 89%

Ensembling Large Language Models for Code Vulnerability Detection: An Empirical Evaluation

Zhihong Sun, Jia Li, Yao Wan, Chuanyi Li, Hongyu Zhang, Zhi jin, Ge Li, Hong Liu, Chen Lyu, Songlin Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19335 2025-09-19 cs.HC 89%

Knoll: Creating a Knowledge Ecosystem for Large Language Models

Dora Zhao, Diyi Yang, Michael S. Bernstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 21 pages, 8 figures, 7 tables; see https://stanfordhci.github.io/knoll/

Journal ref UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16307 2025-09-19 cs.CL cs.AI cs.LG 89%

PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models

Chenzhuo Zhao, Ziqian Liu, Xinda Wang, Junting Lu, Chaoyi Ruan

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13535 2025-09-18 cs.SE 89%

Crash Report Enhancement with Large Language Models: An Empirical Study

S M Farah Al Fahim, Md Nakhla Rafi, Zeyang Ma, Dong Jae Kim, Tse-Hsun, Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12973 2025-09-17 cs.SE 89%

Evaluating Large Language Models for Code Translation: Effects of Prompt Language and Prompt Design

Aamer Aljagthami, Mohammed Banabila, Musab Alshehri, Mohammed Kabini, Mohammad D. Alahmadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06164 2025-09-17 cs.CL cs.AI cs.HC cs.LG 89%

Benchmarking Gender and Political Bias in Large Language Models

Jinrui Yang, Xudong Han, Timothy Baldwin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11446 2025-09-16 cs.SE 89%

Large Language Models (LLMs) for Requirements Engineering (RE): A Systematic Literature Review

Mohammad Amin Zadenoori, Jacek Dąbrowski, Waad Alhoshan, Liping Zhao, Alessio Ferrari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10814 2025-09-16 cs.CR 89%

Automatic Generation of a Cryptography Misuse Taxonomy Using Large Language Models

Yang Zhang, Wenyi Ouyang, Yi Zhang, Liang Cheng, Chen Wu, Wenxin Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏