arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2510.07173 2025-10-09 cs.CL cs.LG 86%

NurseLLM: The First Specialized Language Model for Nursing

Md Tawkat Islam Khondaker, Julia Harrington, Shady Shehata

机构 * Yourika Labs(Yourika实验室) The University of British Columbia(不列颠哥伦比亚大学) Western University(西方大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09387 2025-10-08 cs.LG cs.AI 86%

MetaLLMix : An XAI Aided LLM-Meta-learning Based Approach for Hyper-parameters Optimization

Mohamed Bal-Ghaoui, Mohammed Tiouti

机构 * R&D Department, Audensiel Conseil Paris, France(Audensiel Conseil 巴黎法国研发部) Université Évry Paris-Saclay(Évry 巴黎-萨克莱大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05152 2025-10-08 cs.CL cs.AI 86%

A Single Character can Make or Break Your LLM Evals

Jingtong Su, Jianyu Zhang, Karen Ullrich, Léon Bottou, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05131 2025-10-08 cs.CL cs.AI 86%

Rationale-Augmented Retrieval with Constrained LLM Re-Ranking for Task Discovery

Bowen Wei

机构 * George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02089 2025-10-07 cs.LG cs.AI cs.CR 86%

SALAD: Systematic Assessment of Machine Unlearning on LLM-Aided Hardware Design

Zeng Wang, Minghao Shao, Rupesh Karn, Likhitha Mankali, Jitendra Bhandari, Ramesh Karri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02343 2025-10-06 cs.CL cs.AI 86%

$\texttt{BluePrint}$: A Social Media User Dataset for LLM Persona Evaluation and Training

Aurélien Bück-Kaeffer, Je Qin Chooi, Dan Zhao, Maximilian Puelma Touzel, Kellin Pelrine, Jean-François Godbout, Reihaneh Rabbany, Zachary Yang

机构 * McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Harvard College(哈佛学院) NYU(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00415 2025-10-06 q-fin.CP cs.AI cs.CL cs.MA q-fin.PM 86%

MarketSenseAI 2.0: Enhancing Stock Analysis through LLM Agents

George Fatouros, Kostas Metaxas, John Soldatos, Manos Karathanassis

机构 * George Fatouros 1,2(乔治·法图罗斯(1,2)) Kostas Metaxas 1,3(科斯塔斯·梅塔克斯(1,3)) John Soldatos 2(约翰·索拉托斯(2)) Manos Karathanassis 3(曼纳斯·卡拉塔西斯(3))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 7 figures, Under review at Financial Innovation (FIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01164 2025-10-02 cs.CL cs.AI cs.CY cs.HC 86%

Social Welfare Function Leaderboard: When LLM Agents Allocate Social Welfare

Zhengliang Shi, Ruotian Ma, Jen-tse Huang, Xinbei Ma, Xingyu Chen, Mengru Wang, Qu Yang, Yue Wang, Fanghua Ye, Ziyang Chen, Shanyi Wang, Cixing Li, Wenxuan Wang, Zhaopeng Tu, Xiaolong Li, Zhaochun Ren, Linus

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20097 2025-10-02 cs.CL cs.AI 86%

Integrated Framework for LLM Evaluation with Answer Generation

Sujeong Lee, Hayoung Lee, Seongsoo Heo, Wonik Choi

机构 * Inha University(成均馆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07132 2025-10-02 cs.LG cs.CL 86%

LLM-based feature generation from text for interpretable machine learning

Vojtěch Balek, Lukáš Sýkora, Vilém Sklenák, Tomáš Kliegr

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref Machine Learning (2025) 114:241

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25818 2025-10-01 cs.CV cs.AI cs.CL 86%

VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions

Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16594 2025-09-30 cs.AI cs.CL 86%

From Generation to Judgment: Opportunities and Challenges of LLM-as-a-judge

Dawei Li, Bohan Jiang, Liangjie Huang, Alimohammad Beigi, Chengshuai Zhao, Zhen Tan, Amrita Bhattacharjee, Yuxuan Jiang, Canyu Chen, Tianhao Wu, Kai Shu, Lu Cheng, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23515 2025-09-30 cs.CL cs.AI 86%

From Human Annotation to Automation: LLM-in-the-Loop Active Learning for Arabic Sentiment Analysis

Dania Refai, Alaa Dalaq, Doaa Dalaq, Irfan Ahmad

机构 * Information and Computer Science Department, KFUPM, Dhahran 31261, Saudi Arabia(信息与计算机科学系,KFUPM,沙特阿拉伯达哈兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22715 2025-09-30 cs.CL cs.AI 86%

TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?

Jiho Park, Jongyoon Song, Minjin Choi, Kyuho Heo, Taehun Huh, Ji Won Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21117 2025-09-29 cs.AI cs.CL 86%

TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them

Yidong Wang, Yunze Song, Tingyuan Zhu, Xuanwang Zhang, Zhuohao Yu, Hao Chen, Chiyu Song, Qiufeng Wang, Cunxiang Wang, Zhen Wu, Xinyu Dai, Yue Zhang, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学) Institute of Science Tokyo(东京科学研究院) Nanjing University(南京大学) Westlake University(西湖大学) Southeast University(东南大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20680 2025-09-26 cs.LG cs.CL cs.CR 86%

Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation

Wenkai Guo, Xuefeng Liu, Haolin Wang, Jianwei Niu, Shaojie Tang, Jing Yuan

机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Hangzhou Innovation Institute of Beihang University, Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems, Hangzhou, China(北京航空航天大学杭州创新研究院,浙江省工业大数据与机器人智能系统重点实验室) Center for AI Business Innovation, Department of Management Science and Systems, University at Buffalo, Buffalo, New York, USA(人工智能商业创新中心,管理科学与系统系,布法罗大学) University of North Texas, Denton, Texas, USA(德克萨斯大学达文波特分校) Zhongguancun Laboratory, Beijing, China(中关村实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 28 pages, 32 figures, accepted to the Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19369 2025-09-25 cs.CL cs.AI 86%

SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use

Changhyun Jeon, Jinhee Park, Jungwoo Choi, Keonwoo Kim, Jisu Kim, Minji Hong

专题命中 评测与基准 :SLM(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10999 2025-09-25 cs.CL cs.AI 86%

TALEC: Teach Your LLM to Evaluate in Specific Domain with In-house Criteria by Criteria Division and Zero-shot Plus Few-shot

Kaiqi Zhang, Shuai Yuan, Honghan Zhao

机构 * ByteDance China(字节跳动中国) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17628 2025-09-24 cs.CL cs.AI 86%

MSCoRe: A Benchmark for Multi-Stage Collaborative Reasoning in LLM Agents

Yuzhen Lei, Hongbin Xie, Jiaxing Zhao, Shuangxue Liu, Xuan Song

机构 * Jilin University(吉林大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18370 2025-09-24 cs.SE cs.CL cs.CR cs.LG 86%

Training Language Model Agents to Find Vulnerabilities with CTF-Dojo

Terry Yue Zhuo, Dingmin Wang, Hantian Ding, Varun Kumar, Zijian Wang

机构 * Monash University(墨尔本大学) AWS AI Labs(亚马逊AI实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00367 2025-09-23 cs.CL cs.AI 86%

KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation

JunSeo Kim, HyeHyeon Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16394 2025-09-23 cs.CL cs.AI cs.HC 86%

Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans

Deuksin Kwon, Kaleen Shrestha, Bin Han, Elena Hayoung Lee, Gale Lucas

机构 * University of Southern California(南加州大学) USC for Institute of Creative Technologies(南加州大学创意技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10179 2025-09-22 cs.CL cs.AI 86%

Benchmark of stylistic variation in LLM-generated texts

Jiří Milička, Anna Marklová, Václav Cvrček

机构 * Department of Linguistics, Faculty of Arts, Charles University(语言学系,艺术学院,查尔斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Data and scripts: https://osf.io/hs7xt/. Interactive charts: https://www.korpus.cz/stylisticbenchmark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00032 2025-09-22 cs.CL cs.AI 86%

KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis

Shinwoo Park, Shubin Kim, Do-Kyung Kim, Yo-Sub Han

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14404 2025-09-19 cs.SE cs.AI cs.CL cs.PL 86%

A Taxonomy of Prompt Defects in LLM Systems

Haoye Tian, Chong Wang, BoYang Yang, Lyuye Zhang, Yang Liu

机构 * School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Jisuan Institute of Technology, Beijing JudaoYouda Network Technology Co. Ltd.(智算技术研究所,北京judaoYouda网络技术有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19345 2025-09-17 cs.CL cs.AI 86%

PatentScore: Multi-dimensional Evaluation of LLM-Generated Patent Claims

Yongmin Yoo, Qiongkai Xu, Longbing Cao

机构 * Frontier AI Research Centre, Macquarie University School of Computing, FSE, Macquarie University(前沿人工智能研究中心、麦考瑞大学计算机学院、FSE、麦考瑞大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09707 2025-09-15 cs.NE cs.AI cs.CL 86%

LLM-Based Instance-Driven Heuristic Bias In the Context of a Biased Random Key Genetic Algorithm

Camilo Chacón Sartori, Martín Isla Pino, Pedro Pinacho-Davidson, Christian Blum

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Submitted to a journal for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09706 2025-09-15 cs.CR cs.AI cs.CL 86%

Differential Robustness in Transformer Language Models: Empirical Evaluation Under Adversarial Text Attacks

Taniya Gidatkar, Oluwaseun Ajao, Matthew Shardlow

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 tables, to appear in proceedings of Recent Advances in Natural Language Processing (RANLP 2025) and ACL Anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11538 2025-09-12 cs.CL cs.AI eess.AS 86%

MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond

Muhammad Huzaifah, Geyu Lin, Tianchi Liu, Hardik B. Sailor, Kye Min Tan, Tarun K. Vangani, Qiongqiong Wang, Jeremy H. M. Wong, Jinyang Wu, Nancy F. Chen, Ai Ti Aw

机构 * MERaLiON Team(MERaLiON团队) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息通信研究所(I2R),A*STAR,新加坡)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08182 2025-09-11 cs.PL cs.AI cs.CL 86%

XML Prompting as Grammar-Constrained Interaction: Fixed-Point Semantics, Convergence Guarantees, and Human-AI Protocols

Faruk Alpay, Taylan Alpay

机构 * Lightcap Institut für die Zukunft(未来研究所) Turkish Aeronautical Association(土耳其航空协会) Aerospace Engineering(航空航天工程)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 7 pages, multiple XML prompts

详情

展开后加载摘要…

URL PDF HTML 收藏