arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-15 至 2025-08-15 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2508.10226 2025-08-15 cs.CL cs.AI 90%

Using Large Language Models to Measure Symptom Severity in Patients At Risk for Schizophrenia

Andrew X. Chen, Guillermo Horga, Sean Escola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10003 2025-08-15 cs.CL cs.AI 90%

Semantic Structure in Large Language Model Embeddings

Austin C. Kozlowski, Callin Dai, Andrei Boutyline

机构 * University of Chicago(芝加哥大学) University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05262 2025-08-15 cs.CV 89%

Debiasing Multimodal Large Language Models via Penalization of Language Priors

YiFan Zhang, Yang Shi, Weichen Yu, Qingsong Wen, Xue Wang, Wenjing Yang, Zhang Zhang, Liang Wang, Rong Jin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Alibaba Group(阿里巴巴集团) National University of Defense Technology(国防科技大学) Meta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13871 2025-08-15 cs.LG cs.AI cs.CR 88%

An Explainable Transformer-based Model for Phishing Email Detection: A Large Language Model Approach

Mohammad Amaz Uddin, Md Mahiuddin, Iqbal H. Sarker

机构 * Department of Computer Science and Engineering, BGC Trust University Bangladesh(Bangladesh BGC Trust 大学 计算机科学与工程系) Department of Computer Science and Engineering, International Islamic University Chittagong(Bangladesh 国际伊斯兰大学 昌德加荣分校 计算机科学与工程系) Centre for Securing Digital Futures, School of Science, Edith Cowan University(澳大利亚 埃德温·考文大学 科学学院 安全数字未来中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10368 2025-08-15 cs.CL 88%

Large Language Models for Summarizing Czech Historical Documents and Beyond

Václav Tran, Jakub Šmíd, Jiří Martínek, Ladislav Lenc, Pavel Král

机构 * Department of Computer Science and Engineering, University of West Bohemia in Pilsen(计算机科学与工程系,西波西米亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Published in Proceedings of the 17th International Conference on Agents and Artificial Intelligence - Volume 2 (ICAART 2025). Official version: https://www.scitepress.org/Link.aspx?doi=10.5220/0013374100003890

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10007 2025-08-15 cs.CL stat.ME 88%

Automated scoring of the Ambiguous Intentions Hostility Questionnaire using fine-tuned large language models

Y. Lyu, D. Combs, D. Neumann, Y. C. Leong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments We have no known conflict of interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10535 2025-08-15 cs.CL cs.AI cs.SE 88%

CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks

Hongchao Jiang, Yiming Chen, Yushi Cao, Hung-yi Lee, Robby T. Tan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Dataset is available at https://huggingface.co/datasets/mattymchen/codejudgebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10517 2025-08-15 cs.SE 85%

Bridging Solidity Evolution Gaps: An LLM-Enhanced Approach for Smart Contract Compilation Error Resolution

Likai Ye, Mengliang Li, Dehai Zhao, Jiamou Sun, Xiaoxue Ren

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments International Conference on Software Maintenance and Evolution (ICSME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06762 2025-08-15 cs.SE 85%

Detecção de Conflitos Semânticos com Testes Gerados por LLM

Nathalia Barbosa, Paulo Borba, Léuson Da Silva

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Comments: 11 pages, in Portuguese language. 3 figures. Submitted to SAST 2025 (X Simpósio Brasileiro de Teste de Software Sistemático e Automatizado). in Portuguese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07321 2025-08-15 cs.SE cs.CR 85%

VERCATION: Precise Vulnerable Open-source Software Version Identification based on Static Analysis and LLM

Yiran Cheng, Ting Zhang, Lwin Khin Shar, Shouguo Yang, Chaopeng Dong, David Lo, Shichao Lv, Zhiqiang Shi, Limin Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09937 2025-08-15 cs.CL cs.AI cs.LG 83%

A Comprehensive Evaluation framework of Alignment Techniques for LLMs

Muneeza Azmat, Momin Abbas, Maysa Malfiza Garcia de Macedo, Marcelo Carpinette Grave, Luan Soares de Souza, Tiago Machado, Rogerio A de Paula, Raya Horesh, Yixin Chen, Heloisa Caroline de Souza Pereira Candello, Rebecka Nordenlow, Aminat Adebiyi

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);RLHF(abstract)

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09993 2025-08-15 cs.CL 83%

A Transparent Fairness Evaluation Protocol for Open-Source Language Model Benchmarking on the Blockchain

Hugo Massaroli, Leonardo Iara, Emmanuel Iarussi, Viviana Siless

机构 * Business School, Di Tella University, Argentina(迪特拉大学商学院,阿根廷)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10028 2025-08-15 cs.CL cs.AI cs.HC cs.LG 80%

PREF: Reference-Free Evaluation of Personalised Text Generation in LLMs

Xiao Fu, Hossein A. Rahmani, Bin Wu, Jerome Ramos, Emine Yilmaz, Aldo Lipani

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10110 2025-08-15 cs.CV cs.AI 79%

Empowering Morphing Attack Detection using Interpretable Image-Text Foundation Model

Sushrut Patwardhan, Raghavendra Ramachandra, Sushma Venkatesh

机构 * Norwegian University of Science and Technology (NTNU)(挪威科学技术大学) MOBAI AS(MOBAI公司)

专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10014 2025-08-15 cs.CL 79%

PersonaEval: Are LLM Evaluators Human Enough to Judge Role-Play?

Lingfeng Zhou, Jialing Zhang, Jin Gao, Mohan Jiang, Dequan Wang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22793 2025-08-15 cs.CV cs.CL 79%

Evaluation of Cultural Competence of Vision-Language Models

Srishti Yadav, Lauren Tilton, Maria Antoniak, Taylor Arnold, Jiaang Li, Siddhesh Milind Pawar, Antonia Karamolegkou, Stella Frank, Zhaochong An, Negar Rostamzadeh, Daniel Hershcovich, Serge Belongie, Ekaterina Shutova

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) Department of Rhetoric and Communication Studies, University of Richmond(修辞与传播研究系,里士满大学) Department of Data Science and Statistics, University of Richmond(数据科学与统计系,里士满大学) Google Research(谷歌研究) ILLC, University of Amsterdam(阿姆斯特丹大学ILLC中心) Pioneer Centre of AI, Denmark(丹麦先锋人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16135 2025-08-15 eess.AS cs.LG cs.SD 79%

Evaluation of Speech Foundation Models for ASR on Child-Adult Conversations in Autism Diagnostic Sessions

Aditya Ashvin, Rimita Lahiri, Aditya Kommineni, Somer Bishop, Catherine Lord, Sudarsana Reddy Kadiri, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Laboratory(信号分析与解释实验室) Department of Psychiatry(精神病学系) Semel Institute of Neuroscience and Human Behavior(Semel神经科学与人类行为研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments Accepted at Workshop on Child Computer Interaction (WOCCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10137 2025-08-15 cs.CL cs.AI 79%

mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning

Nghia Trung Ngo, Franck Dernoncourt, Thien Huu Nguyen

机构 * Department of Computer Science, University of Oregon(俄勒冈大学计算机科学系) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06117 2025-08-15 cs.CL cs.AI 79%

Fleurs-SLU: A Massively Multilingual Benchmark for Spoken Language Understanding

Fabian David Schmidt, Ivan Vulić, Goran Glavaš, David Ifeoluwa Adelani

机构 * Center For Artificial Intelligence and Data Science, University of Würzburg(人工智能与数据科学中心,乌尔姆大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) Mila, McGill University and Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10677 2025-08-15 cs.CR cs.LG 77%

Advancing Autonomous Incident Response: Leveraging LLMs and Cyber Threat Intelligence

Amine Tellache, Abdelaziz Amara Korba, Amdjed Mokhtari, Horea Moldovan, Yacine Ghamri-Doudane

机构 * OODRIVE-Trusted Cloud Solutions(OODRIVE可信云计算解决方案) L3i Lab, University of La Rochelle(L3i实验室,拉罗什-科尔贝尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10047 2025-08-15 cs.AI 77%

A Survey of Optimization Modeling Meets LLMs: Progress and Future Directions

Ziyang Xiao, Jingrong Xie, Lilin Xu, Shisi Guan, Jingyan Zhu, Xiongwei Han, Xiaojin Fu, WingYin Yu, Han Wu, Wei Shi, Qingcan Kang, Jiahui Duan, Tao Zhong, Mingxuan Yuan, Jia Zeng, Yuan Wang, Gang Chen, Dongxiang Zhang

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) School of Business, Singapore University of Social Sciences(新加坡国立大学商学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10011 2025-08-15 cs.CL 77%

Evaluation of GPT-based large language generative AI models as study aids for the national licensure examination for registered dietitians in Japan

Yuta Nagamori, Mikoto Kosai, Yuji Kawai, Haruka Marumo, Misaki Shibuya, Tatsuya Negishi, Masaki Imanishi, Yasumasa Ikeda, Koichiro Tsuchiya, Asuka Sawai, Licht Miyamoto

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09956 2025-08-15 cs.CL 77%

Performance of GPT-5 Frontier Models in Ophthalmology Question Answering

Fares Antaki, David Mikhail, Daniel Milad, Danny A Mammo, Sumit Sharma, Sunil K Srivastava, Bing Yu Chen, Samir Touma, Mertcan Sevgi, Jonathan El-Khoury, Pearse A Keane, Qingyu Chen, Yih Chung Tham, Renaud Duval

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19325 2025-08-15 cs.AI 77%

FEAT: A Preference Feedback Dataset through a Cost-Effective Auto-Generation and Labeling Framework for English AI Tutoring

Hyein Seo, Taewook Hwang, Yohan Lee, sangkeun Jung

机构 * Chungnam National University(Chungnam 国立大学) Electronics and Telecommunications Research Institute(电子信息通信研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments ACL 2025 (Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10025 2025-08-15 cs.CL cs.AI cs.LG 75%

Detecting and explaining postpartum depression in real-time with generative artificial intelligence

Silvia García-Méndez, Francisco de Arriba-Pérez

机构 * Information Technologies Group, atlanTTic, University of Vigo, Vigo, Spain(信息科技组,atlanTTic,维戈大学,维戈,西班牙)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10230 2025-08-15 cs.SD cs.AI 74%

No Free Lunch from Audio Pretraining in Bioacoustics: A Benchmark Study of Embeddings

Chenggang Chen, Zhiyu Yang

机构 * Department of Biomedical Engineering Johns Hopkins University(生物医学工程系约翰·霍普金斯大学)

专题命中 评测与基准 :pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10005 2025-08-15 cs.CL cs.AI 73%

From Answers to Questions: EQGBench for Evaluating LLMs' Educational Question Generation

Chengliang Zhou, Mei Wang, Ting Zhang, Qiannan Zhu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09999 2025-08-15 cs.CL cs.LG 73%

XFacta: Contemporary, Real-World Dataset and Evaluation for Multimodal Misinformation Detection with Multimodal LLMs

Yuzhuo Xiao, Zeyu Han, Yuhan Wang, Huaizu Jiang

机构 * Guizhou University(贵州大学) Northeastern University(东北大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments For associated code and dataset, see https://github.com/neu-vi/XFacta

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10428 2025-08-15 cs.LG 70%

SC2Arena and StarEvolve: Benchmark and Self-Improvement Framework for LLMs in Complex Decision-Making Tasks

Pengbo Shen, Yaqing Wang, Ni Mu, Yao Luan, Runpeng Xie, Senhao Yang, Lexiang Wang, Hao Hu, Shuang Xu, Yiqin Yang, Bo Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10421 2025-08-15 cs.CL 70%

Evaluating LLMs on Chinese Idiom Translation

Cai Yang, Yao Dou, David Heineman, Xiaofeng Wu, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏