arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2509.13603 2025-09-18 cs.IR cs.AI 85%

Modernizing Facebook Scoped Search: Keyword and Embedding Hybrid Retrieval with LLM Evaluation

Yongye Su, Zeya Zhang, Jane Kou, Cheng Ju, Shubhojeet Sarkar, Yamin Wang, Ji Liu, Shengbo Guo

机构 * Meta

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 Pages, work done as Yongye Su's internship project at Meta

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18530 2025-09-17 cs.CV cs.LG 85%

IMPROVE: Iterative Model Pipeline Refinement and Optimization Leveraging LLM Experts

Eric Xue, Ke Chen, Zeyi Huang, Yuyang Ji, Haohan Wang

机构 * University of Toronto(多伦多大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21587 2025-09-16 cs.CL 85%

A Cross-Cultural Comparison of LLM-based Public Opinion Simulation: Evaluating Chinese and U.S. Models on Diverse Societies

Weihong Qi, Fan Huang, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10570 2025-09-16 cs.RO cs.AI 85%

Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey

Wei Dai, Shengen Wu, Wei Wu, Zhenhao Wang, Sisuo Lyu, Haicheng Liao, Limin Yu, Weiping Ding, Runwei Guan, Yutao Yue

机构 * Department of Mathematical Sciences, School of Physical sciences, University of Liverpool(利物浦大学数学科学系) Department of Communications and Networking, School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学通讯与网络系) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) Deep Interdisciplinary Intelligence Lab, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)深度跨学科智能实验室) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向) Institute of Deep Perception Technology, Jiangsu(江苏深度感知技术研究院)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09970 2025-09-15 cs.CR cs.AI 85%

Securing LLM-Generated Embedded Firmware through AI Agent-Driven Validation and Patching

Seyed Moein Abtahi, Akramul Azim

机构 * Faculty of Engineering(工程学院) Applied Science Ontario Tech University(应用科学奥尔巴尼技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08493 2025-09-11 cs.CR cs.AI 85%

Send to which account? Evaluation of an LLM-based Scambaiting System

Hossein Siadati, Haadi Jafarian, Sima Jafarikhah

机构 * AI Research, Cybera Global Inc./ UNCW(AI研究、Cybera全球公司/UNCW) Department of Computer Science and Engineering, UC Denver(计算机科学与工程系,UC Denver) Department of Computer Science, UNCW(计算机科学系,UNCW)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14161 2025-09-11 cs.CL 85%

TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks

Frank F. Xu, Yufan Song, Boxuan Li, Yuxuan Tang, Kritanjali Jain, Mengxue Bao, Zora Z. Wang, Xuhui Zhou, Zhitong Guo, Murong Cao, Mingyang Yang, Hao Yang Lu, Amaad Martin, Zhe Su, Leander Maben, Raj Mehta, Wayne Chi, Lawrence Jang, Yiqing Xie, Shuyan Zhou, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Independent(独立研究者) Duke University(杜克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16661 2025-09-10 cs.CL 85%

A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP

Shinnosuke Ono, Issey Sukeda, Takuro Fujii, Kosei Buma, Shunsuke Sasaki

机构 * EQUES Inc.(EQUES公司) The University of Tokyo(东京大学) University of Tsukuba(筑波大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

Comments 15 pages, 9 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05541 2025-09-09 cs.AI 85%

SenseCF: LLM-Prompted Counterfactuals for Intervention and Sensor Data Augmentation

Shovito Barua Soumma, Asiful Arefeen, Stephanie M. Carpenter, Melanie Hingle, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School of Nutritional Sciences and Wellness, University of Arizona(亚利桑那大学营养科学与健康学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the IEEE-EMBS International Conference on Body Sensor Networks (IEEE-EMBS BSN) 2025, LA, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13384 2025-09-09 cs.AI cs.CY stat.ME stat.OT 85%

Delving Into the Psychology of Machines: Exploring the Structure of Self-Regulated Learning via LLM-Generated Survey Responses

Leonie V. D. E. Vogelsmeier, Eduardo Oliveira, Kamila Misiejuk, Sonsoles López-Pernas, Mohammed Saqr

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05759 2025-09-09 cs.CL 85%

Reinforced Lifelong Editing for Language Models

Zherui Li, Houcheng Jiang, Hao Chen, Baolong Bi, Zhenhong Zhou, Fei Sun, Junfeng Fang, Xiang Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20541 2025-09-08 cs.AI 85%

MeLA: A Metacognitive LLM-Driven Architecture for Automatic Heuristic Design

Zishang Qiu, Xinan Chen, Long Chen, Ruibin Bai

机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波分校计算机科学学院) College of Teacher Education, Zhejiang Normal University(浙江师范大学教师教育学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04007 2025-09-05 cs.AI 85%

AutoPBO: LLM-powered Optimization for Local Search PBO Solvers

Jinyuan Li, Yi Chu, Yiwen Sun, Mengchuan Zou, Shaowei Cai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03312 2025-09-05 cs.CL cs.MA 85%

AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?

Guibin Zhang, Junhao Wang, Junjie Chen, Wangchunshu Zhou, Kun Wang, Shuicheng Yan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09002 2025-09-05 cs.SE cs.AI cs.CR cs.OS 85%

KNighter: Transforming Static Analysis with LLM-Synthesized Checkers

Chenyuan Yang, Zijie Zhao, Zichen Xie, Haoyu Li, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05982 2025-09-05 cs.CL 85%

HamRaz: A Culture-Based Persian Conversation Dataset for Person-Centered Therapy Using LLM Agents

Mohammad Amin Abbasi, Farnaz Sadat Mirnezami, Ali Neshati, Hassan Naderi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12100 2025-09-04 cs.CR cs.AI 85%

LLM Embedding-based Attribution (LEA): Quantifying Source Contributions to Generative Model's Response for Vulnerability Analysis

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

机构 * Rochester Institute of Technology(罗切斯特技术学院) Gonzaga University(戈兹加大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02363 2025-09-03 cs.CL 85%

Towards Temporal Knowledge-Base Creation for Fine-Grained Opinion Analysis with Language Models

Gaurav Negi, Atul Kr. Ojha, Omnia Zayed, Paul Buitelaar

机构 * Insight SFI Research Ireland Centre for Data Analytics, University of Galway(爱尔兰数据分析师中心,Galway大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02666 2025-09-03 cs.CL 85%

A Survey on Progress in LLM Alignment from the Perspective of Reward Design

Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang, Jian Yang, Mark Dras, Usman Naseem

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02198 2025-09-03 cs.CL 85%

FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain

Anum Afzal, Juraj Vladika, Florian Matthes

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01441 2025-09-03 cs.AI cs.MA 85%

LLM-empowered Agents Simulation Framework for Scenario Generation in Service Ecosystem Governance

Deyu Zhou, Yuqi Hou, Xiao Xue, Xudong Lu, Qingzhong Li, Lizhen Cui

机构 * School of Software, Shandong University(软件学院,山东大学) Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(SDU-NTU人工智能研究中心(C-FAIR),山东大学) College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室,天津大学) ShanDa Dareway Software Co. Ltd(山东达瑞软件有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18190 2025-09-03 cs.AI cs.DB cs.IR 85%

ST-Raptor: LLM-Powered Semi-Structured Table Question Answering

Zirui Tang, Boyu Niu, Xuanhe Zhou, Boxiu Li, Wei Zhou, Jiannan Wang, Guoliang Li, Xinyi Zhang, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Simon Fraser University(西蒙弗雷泽大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Extension of our SIGMOD 2026 paper. Please refer to source code available at: https://github.com/weAIDB/ST-Raptor

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00273 2025-09-03 cs.CL 85%

Echoes in AI: Quantifying lack of plot diversity in LLM outputs

Weijia Xu, Nebojsa Jojic, Sudha Rao, Chris Brockett, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments PNAS Vol. 122 No. 35. Copyright \c{opyright} 2025 the Author(s). Published by PNAS. This open access article is distributed under Creative Commons Attribution-NonCommercial-NoDerivatives License 4.0 (CC BY-NC-ND)

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (35) e2504966122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21222 2025-09-01 cs.CV cs.AI 85%

Generalizable Object Re-Identification via Visual In-Context Prompting

Zhizhong Huang, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);foundation model(abstract);分类 cs.AI

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20818 2025-08-29 cs.LG cs.MA 85%

cMALC-D: Contextual Multi-Agent LLM-Guided Curriculum Learning with Diversity-Based Context Blending

Anirudh Satheesh, Keenan Powell, Hua Wei

机构 * Department of Computer Science, University of Maryland, College Park, Maryland, USA(美国马里兰大学计算机科学系) School of Computing and Augmented Intelligence, Arizona State University, Tempe, Arizona, USA(亚利桑那州立大学计算与增强智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments A shorter version has been accepted to the 2025 Conference on Information and Knowledge Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20420 2025-08-29 cs.CL 85%

CAMB: A comprehensive industrial LLM benchmark on civil aviation maintenance

Feng Zhang, Chengjie Pang, Yuehan Zhang, Chenyu Luo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19580 2025-08-28 cs.CL 85%

ArgCMV: An Argument Summarization Benchmark for the LLM-era

Omkar Gurjar, Agam Goyal, Eshwar Chandrasekharan

机构 * Siebel School of Computing and Data Science(计算与数据科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13972 2025-08-28 cs.CL 85%

Truth or Twist? Optimal Model Selection for Reliable Label Flipping Evaluation in LLM-based Counterfactuals

Qianli Wang, Van Bach Nguyen, Nils Feldhus, Luis Felipe Villa-Arenas, Christin Seifert, Sebastian Möller, Vera Schmitt

机构 * Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) University of Marburg(马尔堡大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Deutsche Telekom(德国电信) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at INLG 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18420 2025-08-27 cs.LG 85%

LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning

André Quadros, Cassio Silva, Ronnie Alves

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 11 pages, 5 figures, Accepted to the ENIAC 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17378 2025-08-26 cs.CL 85%

UI-Level Evaluation of ALLaM 34B: Measuring an Arabic-Centric LLM via HUMAIN Chat

Omer Nacar

机构 * NAMAA Community(NAMAA社区) Riyadh - KSA(利雅得-科威特)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏