arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2404.00287 2025-12-29 cs.SE cs.CR 90%

Evaluating Large Language Models for Line-Level Vulnerability Localization

评估大型语言模型在行级漏洞定位中的表现

Jian Zhang, Chong Wang, Anran Li, Weisong Sun, Cen Zhang, Wei Ma, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文评估了大型语言模型在行级漏洞定位中的表现,发现判别微调在有充足训练数据时效果显著,而提示方法在低数据环境下更有效,同时提出了改进微调过程的策略。

Comments Accepted to TSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17028 2025-12-22 cs.CL cs.AI cs.LG 90%

A Women's Health Benchmark for Large Language Models

为大型语言模型建立女性健康基准

Victoria-Elisabeth Gruber, Razvan Marinescu, Diego Fajardo, Amin H. Nassar, Christopher Arkfeld, Alexandria Ludlow, Shama Patel, Mehrnoosh Samaei, Valerie Klug, Anna Huber, Marcel Gühner, Albert Botta i Orfila, Irene Lagoja, Kimya Tarr, Haleigh Larson, Mary Beth Howard

机构 * Lumos AI Medical Oncology, Yale Cancer Center(耶鲁癌症中心医学肿瘤学部) Obstetrics and Gynecology, MGH, Harvard Medical School(妇产科,MGH,哈佛医学院) Obstetrics, Gynecology & Reproductive Sciences, UCSF(妇产科与生殖科学,UCSF) Brown Division of Global Emergency Medicine(全球急诊医学部,布朗分部) Department of Emergency Medicine, Emory University(急诊医学部,埃默里大学) Pharmacy Department, Clinic Ottakring(药学部,克利克诊所) Windrush Surgery, Buckinghamshire, Oxfordshire and Berkshire West Integrated Care Board, NHS(温德许手术,贝肯ham郡,牛津郡和伯克希尔西部整合护理委员会,NHS) Women’s Health Research, Yale School of Medicine(女性健康研究,耶鲁医学院) Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出女性健康基准,评估LLM在女性健康领域的表现,发现现有模型在关键任务上存在显著缺陷,需进一步改进以提供可靠医疗建议。

Comments 15 pages, 6 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22821 2025-12-19 cs.SE 90%

Identifying and Mitigating API Misuse in Large Language Models

识别和缓解大语言模型中的API误用

Terry Yue Zhuo, Junda He, Jiamou Sun, Zhenchang Xing, David Lo, John Grundy, Xiaoning Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出Dr.Fix方法,通过分类法指导LLM自动修复生成代码中的API误用问题,提升修复精度。

Comments Accepted at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07927 2025-12-16 cs.AI cs.CL cs.LG 90%

Solving Inequality Proofs with Large Language Models

用大语言模型解决不等式证明

Pan Lu, Jiayi Sheng, Luna Lyu, Jikai Jin, Tony Xia, Alex Gu, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。

Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08894 2025-12-10 cs.LG cs.AI cs.CL 90%

Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training

重新审视大型语言模型训练中下游指标的缩放特性

Jakub Krajewski, Amitis Shidani, Dan Busbridge, Sam Wiseman, Jason Ramapuram

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出直接框架建模LLM训练预算与下游任务性能的缩放关系,发现幂律可准确描述log准确率,且优于传统两阶段方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07261 2025-12-09 cs.SE 90%

Automatic Syntax Error Repair for Discrete Controller Synthesis using Large Language Model

利用大语言模型实现离散控制器综合的自动语法错误修复

Yusei Ishimizu, Takuto Yamauchi, Sinan Chen, Jinyu Cai, Jialong Li, Kenji Tei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14222 2025-12-01 cs.AI cs.CL cs.LG stat.OT 90%

A Survey on Large Language Model-based Agents for Statistics and Data Science

关于基于大型语言模型的统计与数据科学代理的综述

Maojun Sun, Ruijian Han, Binyan Jiang, Houduo Qi, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。

Journal ref Am. Statist. (2025) 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 90%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05383 2025-11-10 cs.CE 90%

Connectomics Informed by Large Language Models

Elinor Thompson, Tiantian He, Anna Schroder, Ahmed Abdulaal, Alec Sargood, Sonja Soskic, Henry F. J. Tregidgo, Daniel C. Alexander

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02936 2025-11-06 cs.LG cs.AI cs.CL 90%

Zero-shot data citation function classification using transformer-based large language models (LLMs)

Neil Byers, Ali Zaidi, Valerie Skye, Chris Beecroft, Kjiersten Fagnan

机构 * DOE Joint Genome Institute(美国能源部联合基因组研究所) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00389 2025-11-04 cs.CV 90%

Rethinking Facial Expression Recognition in the Era of Multimodal Large Language Models: Benchmark, Datasets, and Beyond

Fan Zhang, Haoxuan Li, Shengju Qian, Xin Wang, Zheng Lian, Hao Wu, Zhihong Zhu, Yuan Gao, Qiankun Li, Yefeng Zheng, Zhouchen Lin, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00024 2025-11-04 cs.CY cs.AI cs.CL cs.LG stat.AP 90%

Chitchat with AI: Understand the supply chain carbon disclosure of companies worldwide through Large Language Model

Haotian Hang, Yueyang Shen, Vicky Zhu, Jose Cruz, Michelle Li

机构 * University of Southern California(南加州大学) University of Michigan(密歇根大学) Babson College(巴布森学院) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04678 2025-10-28 cs.CL cs.AI cs.LG 90%

FaithLM: Towards Faithful Explanations for Large Language Models

Yu-Neng Chuang, Guanchu Wang, Chia-Yuan Chang, Ruixiang Tang, Shaochen Zhong, Fan Yang, Mengnan Du, Xuanting Cai, Vladimir Braverman, Xia Hu

机构 * Rice University(里士大学) Texas A&M University(德克萨斯农工大学) Wake Forest University(沃杰森林大学) New Jersey Institute of Technology(新泽西理工学院) John Hopkins University(约翰霍普金斯大学) Google Research(谷歌研究) Meta Platforms, Inc.(元宇宙平台公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22085 2025-10-28 cs.CR cs.AI cs.CL cs.LG 90%

Jailbreak Mimicry: Automated Discovery of Narrative-Based Jailbreaks for Large Language Models

Pavlos Ntais

机构 * University of Athens(雅典大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13472 2025-10-21 cs.SE cs.AI cs.CL cs.LG 90%

CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation

Xinchen Wang, Pengfei Gao, Chao Peng, Ruida Hu, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16579 2025-10-21 cs.SE 90%

Human-Aligned Code Readability Assessment with Large Language Models

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Pawel Borsukiewicz, Xin Zhou, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05613 2025-09-24 cs.LG cs.AI cs.CL 90%

A Survey on Sparse Autoencoders: Interpreting the Internal Mechanisms of Large Language Models

Dong Shu, Xuansheng Wu, Haiyan Zhao, Daking Rai, Ziyu Yao, Ninghao Liu, Mengnan Du

机构 * Northwestern University(西北大学) University of Georgia(佐治亚大学) New Jersey Institute of Technology(新泽西理工学院) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17276 2025-09-23 cs.CL cs.AI cs.LG 90%

Probabilistic Token Alignment for Large Language Model Fusion

Runjia Zeng, James Chenhao Liang, Cheng Han, Zhiwen Cao, Jiahao Liu, Xiaojun Quan, Yingjie Victor Chen, Lifu Huang, Tong Geng, Qifan Wang, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) U.S. Naval Research Laboratory(美国海军研究实验室) University of Missouri-Kansas City(密苏里大学-Kansas城分校) Adobe(Adobe公司) Meituan(美团) Sun Yat-sen University(孙中山大学) Purdue University(普渡大学) UC Davis(加州大学戴维斯分校) University of Rochester(罗切斯特大学) Rice University(莱斯大学) Meta AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01219 2025-09-16 cs.CL cs.AI cs.CY cs.LG 90%

Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Yue Zhang, Yafu Li, Leyang Cui, Deng Cai, Lemao Liu, Tingchen Fu, Xinting Huang, Enbo Zhao, Yu Zhang, Chen Xu, Yulong Chen, Longyue Wang, Anh Tuan Luu, Wei Bi, Freda Shi, Shuming Shi

机构 * Tencent AI lab(腾讯AI实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) Nanyang Technological University(南洋理工大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress;

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03331 2025-09-04 cs.SE cs.CR 90%

VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities

Weizhe Wang, Wei Ma, Qiang Hu, Yao Zhang, Jianfei Sun, Bin Wu, Yang Liu, Guangquan Xu, Lingxiao Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09577 2025-08-13 cs.HC 90%

Polymind: Parallel Visual Diagramming with Large Language Models to Support Prewriting Through Microtasks

Qian Wan, Jiannan Li, Huanchen Wang, Zhicong Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted to CSCW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08109 2025-08-12 cs.CL cs.AI cs.LG 90%

A Closer Look at Machine Unlearning for Large Language Models

Xiaojian Yuan, Tianyu Pang, Chao Du, Kejiang Chen, Weiming Zhang, Min Lin

机构 * University of Science and Technology of China(中国科学技术大学) Sea AI Lab, Singapore(新加坡Sea AI实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03470 2025-08-06 cs.SE 90%

On the Evaluation of Large Language Models in Multilingual Vulnerability Repair

Dong wang, Junji Yu, Honglin Shu, Michael Fu, Chakkrit Tantithamthavorn, Yasutaka Kamei, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20762 2025-07-29 cs.IR 90%

Watermarking Large Language Model-based Time Series Forecasting

Wei Yuan, Chaoqun Yang, Yu Xing, Tong Chen, Nguyen Quoc Viet Hung, Hongzhi Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18784 2025-07-29 cs.SE 90%

Secret Breach Detection in Source Code with Large Language Models

Md Nafiu Rahman, Sadif Ahmed, Zahin Wahab, S M Sohan, Rifat Shahriyar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM 2025) cameraready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12808 2025-07-18 cs.CL cs.AI cs.LG cs.SD eess.AS 90%

Large Language Models' Internal Perception of Symbolic Music

Andrew Shin, Kunitake Kaneko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08367 2025-07-14 cs.CV cs.SY eess.SY 90%

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment

Yuki Yoshihara, Linjing Jiang, Nihan Karatas, Hitoshi Kanamori, Asuka Harada, Takahiro Tanaka

机构 * Institutes of Innovation for Future Society, Nagoya University, Japan(面向未来的创新研究所,名古屋大学,日本)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21567 2025-07-03 cs.CL cs.AI cs.LG 90%

BioPars: A Pretrained Biomedical Large Language Model for Persian Biomedical Text Mining

Baqer M. Merzah, Tania Taami, Salman Asoudeh, Saeed Mirzaee, Amir reza Hossein pour, Amir Ali Bengari

机构 * Department of Computer Science, Faculty of Education, University of Kufa(计算机科学系,教育学院,科菲大学) Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学) Department of Computer Engineering, Velayat University(计算机工程系,瓦莱yat大学) Department of Mechanical Engineering, Amirkabir University of Technology(机械工程系,阿米卡比尔技术大学) Department of Computer Engineering, Ferdowsi University of Mashhad(计算机工程系,法尔德大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04370 2025-07-02 cs.CL cs.AI cs.LG 90%

Large Language Model Confidence Estimation via Black-Box Access

Tejaswini Pedapati, Amit Dhurandhar, Soumya Ghosh, Soham Dan, Prasanna Sattigeri

机构 * IBM Research Yorktown Heights(IBM研究院纽约高地分部) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Microsoft New York(微软纽约分公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01763 2025-06-24 cs.DB cs.AI cs.CL cs.LG 90%

When Large Language Models Meet Vector Databases: A Survey

Zhi Jing, Yongye Su, Yikun Han, Bo Yuan, Haiyun Xu, Chunjiang Liu, Kehai Chen, Min Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学) University of Michigan(密歇根大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National Science Library (Chengdu), Chinese Academy of Sciences(中国科学院成都科学图书馆) Shandong University of Technology(山东科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏