arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2602.00011 2026-02-03 cs.IR cs.AI cs.CL 87%

Chained Prompting for Better Systematic Review Search Strategies

链式提示法提升系统综述搜索策略

Fatima Nasser, Fouad Trad, Ammar Mohanna, Ghada El-Hajj Fuleihan, Ali Chehab

机构 * Electrical and Computer Engineering(电气与计算机工程系) American University of Beirut(贝鲁特美国大学) Department of Internal Medicine(内科系)

专题命中 评测与基准 :prompting(title);large language model(abstract,comments);language model(abstract,comments);LLM(abstract)

AI总结 本文提出基于LLM的链式提示框架,用于自动化生成系统综述的高召回率搜索策略,通过分解目标、提取PICO要素等方法提升检索效果。

Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15436 2026-01-27 cs.AI cs.CL cs.CY 87%

Not Your Typical Sycophant: The Elusive Nature of Sycophancy in Large Language Models

并非典型的阿谀者:在大语言模型中阿谀行为的 elusive 性

Shahar Ben Natan, Oren Tsur

机构 * Ben Gurion University(本· Gurion 大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种评估大语言模型阿谀倾向的方法,发现阿谀行为与最近性偏见相互作用,导致建设性干扰效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09626 2026-01-15 cs.LG cs.AI cs.SY eess.SY 87%

From Prompt to Protocol: Fast Charging Batteries with Large Language Models

从提示到协议:利用大语言模型实现快速充电电池

Ge Lei, Ferran Brosa Planella, Sterling G. Baird, Samuel J. Cooper

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院伦敦设计工程学院) University of Warwick(沃里克大学) Acceleration Consortium, University of Toronto(多伦多大学加速联盟)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型设计快速充电电池协议,通过Prompt-to-Optimizer和Prompt-to-Protocol方法提升充电效率和电池健康状态

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06341 2026-01-13 cs.LG cs.AI cs.SE 87%

Evaluating Robustness of Large Language Models in Enterprise Applications: Benchmarks for Perturbation Consistency Across Formats and Languages

评估大型语言模型在企业应用中的鲁棒性:跨格式和语言的扰动一致性基准测试

Tara Bogavelli, Oluwanifemi Bamgbose, Gabrielle Gauthier Melançon, Fanny Riols, Roshnee Sharma

机构 * ServiceNow

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出跨格式和语言的扰动一致性基准测试,评估大型语言模型在企业应用中的鲁棒性,发现模型大小与鲁棒性关系复杂,8B参数模型表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06213 2026-01-13 cs.CR cs.AI cs.LG cs.SE 87%

Cyber Threat Detection and Vulnerability Assessment System using Generative AI and Large Language Model

基于生成式人工智能和大语言模型的网络威胁检测与漏洞评估系统

Keerthi Kumar. M, Swarun Kumar Joginpelly, Sunil Khemka, Lakshmi. S R, Navin Chhibber

专题命中 评测与基准 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于RoBERTa模型的网络威胁检测系统,通过加密数据和生成令牌提升检测准确率,优于传统BERT模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10791 2025-12-12 cs.CL cs.AI 87%

The FACTS Leaderboard: A Comprehensive Benchmark for Large Language Model Factuality

FACTS排行榜:大型语言模型事实性的综合基准

Aileen Cheng, Alon Jacovi, Amir Globerson, Ben Golan, Charles Kwong, Chris Alberti, Connie Tao, Eyal Ben-David, Gaurav Singh Tomar, Lukas Haas, Yonatan Bitton, Adam Bloniarz, Aijun Bai, Andrew Wang, Anfal Siddiqui, Arturo Bajuelos Castillo, Aviel Atias, Chang Liu, Corey Fry, Daniel Balle, Deepanway Ghosal, Doron Kukliansky, Dror Marcus, Elena Gribovskaya, Eran Ofek, Honglei Zhuang, Itay Laish, Jan Ackermann, Lily Wang, Meg Risdal, Megan Barnes, Michael Fink, Mohamed Amin, Moran Ambar, Natan Potikha, Nikita Gupta, Nitzan Katz, Noam Velan, Ofir Roval, Ori Ram, Polina Zablotskaia, Prathamesh Bang, Priyanka Agrawal, Rakesh Ghiya, Sanjay Ganapathy, Simon Baumgartner, Sofia Erell, Sushant Prakash, Thibault Sellam, Vikram Rao, Xuanhui Wang, Yaroslav Akulov, Yulong Yang, Zhen Yang, Zhixin Lai, Zhongru Wu, Anca Dragan, Avinatan Hassidim, Fernando Pereira, Slav Petrov, Srinivasan Venkatachary, Tulsee Doshi, Yossi Matias, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 FACTS排行榜为大型语言模型提供事实性评估的综合基准,通过四个子排行榜全面衡量模型在不同场景下的事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09563 2025-12-11 cs.CL cs.AI 87%

System Report for CCL25-Eval Task 10: Prompt-Driven Large Language Model Merge for Fine-Grained Chinese Hate Speech Detection

CCL25-Eval任务10系统报告:基于提示的大型语言模型融合用于细粒度中文仇恨言论检测

Binglin Wu, Jiaxiu Zou, Xianneng Li

机构 * School of Economics and Management, Dalian University of Technology(经济管理学院,大连理工大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于提示的LLM融合框架,通过三阶段方法提升细粒度中文仇恨言论检测的性能。

Comments Accepted at CCL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03070 2025-12-05 cs.AI cs.LG stat.ML 87%

Epidemiology of Large Language Models: A Benchmark for Observational Distribution Knowledge

大语言模型的流行病学:一种用于观察分布知识的基准测试

Drago Plecko, Patrik Okanovic, Shreyas Havaldar, Torsten Hoefler, Elias Bareinboim

机构 * Department of Statistics & Data Science University of California, Los Angeles(统计与数据科学系,加州大学洛杉矶分校) Department of Computer Science ETH Zürich(计算机科学系,苏黎世联邦理工学院) Causal AI Lab Columbia University(因果AI实验室,哥伦比亚大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于评估大语言模型在现实世界概率分布知识方面能力的基准测试,发现LLMs在理解和内部化真实世界统计信息方面表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14086 2025-11-19 cs.CV cs.AI cs.CL 87%

Error-Driven Scene Editing for 3D Grounding in Large Language Models

Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/zhangyuejoslin/Deer-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25007 2025-10-30 cs.AI cs.LG 87%

Taming the Real-world Complexities in CPT E/M Coding with Large Language Models

Islam Nassar, Yang Lin, Yuan Jin, Rongxin Zhu, Chang Wei Tan, Zenan Zhai, Nitika Mathur, Thanh Tien Vu, Xu Zhong, Long Duong, Yuan-Fang Li

机构 * Oracle Health & AI(Oracle健康与人工智能)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22860 2025-10-06 cs.CR cs.AI cs.LG 87%

Permissioned LLMs: Enforcing Access Control in Large Language Models

Bargav Jayaraman, Virendra J. Marathe, Hamid Mozaffari, William F. Shen, Krishnaram Kenthapadi

机构 * Oracle Labs(Oracle实验室) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19430 2025-10-03 cs.CL cs.AI 87%

Deriving Strategic Market Insights with Large Language Models: A Benchmark for Forward Counterfactual Generation

Keane Ong, Rui Mao, Deeksha Varshney, Paul Pu Liang, Erik Cambria, Gianmarco Mengaldo

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Published at Empirical Methods in Natural Language Processing 2025 (Main Conference) (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18319 2025-09-29 cs.AI cs.CL 87%

Development and Validation of a Large Language Model for Generating Fully-Structured Radiology Reports

Chuang Niu, Md Sayed Tanveer, Md Zabirul Islam, Parisa Kaviani, Qing Lyu, Mannudeep K. Kalra, Christopher T. Whitlow, Ge Wang

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15027 2025-09-19 cs.CL cs.AI 87%

CLEAR: A Comprehensive Linguistic Evaluation of Argument Rewriting by Large Language Models

Thomas Huber, Christina Niklaus

机构 * University of St. Gallen(圣加尔登大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10970 2025-09-18 cs.LG cs.AI 87%

The Psychogenic Machine: Simulating AI Psychosis, Delusion Reinforcement and Harm Enablement in Large Language Models

Joshua Au Yeung, Jacopo Dalmasso, Luca Foschini, Richard JB Dobson, Zeljko Kraljevic

机构 * King’s College Hospital(国王学院医院) Nuraxi AI Dev and Doc: AI for Healthcare(Nuraxi AI 人工智能医疗) Sage Bionetworks(Sage 生物网络) University College London(伦敦大学学院) King’s College London(国王学院伦敦)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11026 2025-09-16 cs.AI cs.CL 87%

Rethinking Human Preference Evaluation of LLM Rationales

Ziang Li, Manasi Ganti, Zixian Ma, Helena Vasconcelos, Qijia He, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract,journal_ref);large language model(abstract);分类 cs.CL、cs.AI

Comments Published in the XLLM-Reason-Plan Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025

Journal ref Proceedings of the XLLM-Reason-Plan Workshop, Conference on Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15865 2025-09-09 cs.RO cs.AI cs.CL 87%

BeSimulator: A Large Language Model Powered Text-based Behavior Simulator

Jianan Wang, Bin Li, Jingtao Qi, Xueying Wang, Fu Li, Hanxun Li

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05006 2025-09-08 cs.CL cs.LG 87%

Do Large Language Models Need Intent? Revisiting Response Generation Strategies for Service Assistant

Inbal Bolshinsky, Shani Kupiec, Almog Sasson, Yehudit Aperstein, Alexander Apartsin

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16682 2025-09-03 cs.CL cs.AI 87%

Automatic Input Rewriting Improves Translation with Large Language Models

Dayeon Ki, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17894 2025-08-22 cs.CL cs.AI 87%

Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model

Khalil Hennara, Muhammad Hreden, Mohamed Motaism Hamed, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06729 2025-08-12 cs.CL cs.AI 87%

Large Language Models for Oral History Understanding with Text Classification and Sentiment Analysis

Komala Subramanyam Cherukuri, Pranav Abishai Moses, Aisa Sakata, Jiangping Chen, Haihua Chen

机构 * University of North Texas(北卡罗来纳州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13300 2025-07-18 cs.CL cs.AI 87%

AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research

Yilun Zhao, Weiyuan Chen, Zhijian Xu, Manasi Patwardhan, Yixin Liu, Chengye Wang, Lovekesh Vig, Arman Cohan

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) TCS Research(TCS研究)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23836 2025-07-17 cs.CL cs.AI 87%

Large Language Models Often Know When They Are Being Evaluated

Joe Needham, Giles Edkins, Govind Pimpale, Henning Bartsch, Marius Hobbhahn

机构 * MATS Apollo Research ML Alignment & Theory Scholars (MATS)(机器学习对齐与理论学者(MATS))

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08054 2025-07-14 cs.AI cs.CL cs.SE 87%

Text2BIM: Generating Building Models Using a Large Language Model-based Multi-Agent Framework

Changyu Du, Sebastian Esser, Stavros Nousias, André Borrmann

机构 * Chair of Computing in Civil and Building Engineering, Technical University of Munich, Munich, Germany(土木与建筑工程计算系,慕尼黑技术大学,德国慕尼黑) TUM Georg Nemetschek Institute, Munich, Germany(慕尼黑技术大学格奥尔·奈梅克研究所,德国慕尼黑)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Journal of Computing in Civil Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12663 2025-06-12 cs.CL cs.AI 87%

Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment

Xiaotian Zhang, Ruizhe Chen, Yang Feng, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(Angelalign技术公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments ACL Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07962 2025-06-10 cs.CL cs.AI cs.CY stat.ML 87%

Correlated Errors in Large Language Models

Elliot Kim, Avi Garg, Kenny Peng, Nikhil Garg

机构 * cornell(康奈尔大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20609 2025-05-28 cs.AI cs.CL 87%

Comparisons between a Large Language Model-based Real-Time Compound Diagnostic Medical AI Interface and Physicians for Common Internal Medicine Cases using Simulated Patients

Hyungjun Park, Chang-Yun Woo, Seungjo Lim, Seunghwan Lim, Keunho Kwak, Ju Young Jeong, Chong Hyun Suh

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04756 2025-05-23 cs.CL cs.LG 87%

Red-Teaming for Inducing Societal Bias in Large Language Models

Chu Fei Luo, Ahmad Ghawanmeh, Bharat Bhimshetty, Kashyap Murali, Murli Jadhav, Xiaodan Zhu, Faiza Khan Khattak

机构 * Queen’s University Vector Institute(女王大学向量研究所) SigmaRed Tech.(SigmaRed科技公司) Ernst & Young(埃森哲) Monark Health(Monark健康)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08399 2025-05-21 cs.CL cs.AI 87%

Beyond Self-Reports: Multi-Observer Agents for Personality Assessment in Large Language Models

Yin Jou Huang, Rafik Hadfi

机构 * Graduate School of Informatics, Kyoto University(信息学研究生院,京都大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02448 2025-05-21 cs.CL cs.AI 87%

Rate, Explain and Cite (REC): Enhanced Explanation and Attribution in Automatic Evaluation by Large Language Models

Aliyah R. Hsu, James Zhu, Zhichao Wang, Bin Bi, Shubham Mehrotra, Shiva K. Pentyala, Katherine Tan, Xiang-Bo Mao, Roshanak Omrani, Sougata Chaudhuri, Regunathan Radhakrishnan, Sitaram Asur, Claire Na Cheng, Bin Yu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏