arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2604.24544 2026-04-28 cs.AI cs.CL 92%

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E: 一个合成、定制、端到端的LLM应用严格评估器

Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

机构 * Deutsche Bank, Berlin Technology Center(德意志银行,柏林技术中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STELLAR-E通过合成数据生成系统,实现无需现有数据的高质量定制数据集创建,提升LLM应用评估的效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22237 2026-04-27 cs.CL cs.AI 92%

Tell Me Why: Designing an Explainable LLM-based Dialogue System for Student Problem Behavior Diagnosis

告诉我原因:设计一个可解释的基于LLM的对话系统用于学生问题行为诊断

Zhilin Fan, Deliang Wang, Penghe Chen, Yu Lu

机构 * School of Educational Technology, Beijing Normal University, Beijing, China(北京师范大学教育技术学院) Advanced Innovation Center for Future Education, Beijing Normal University, Beijing, China(北京师范大学未来教育创新中心) Faculty of Education, The University of Hong Kong, Hong Kong SAR, China(香港大学教育学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的可解释对话系统,通过层次归因方法生成自然语言解释,提升教育对话系统中LLM的可解释性,实验证明其在识别支持证据方面优于基线方法。

Comments This paper has been accepted in AIED2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13527 2026-04-27 cs.CL cs.AI 92%

Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression

逻辑突破:通过形式逻辑表达高效解锁LLM安全限制

Jingyu Peng, Maolin Wang, Nan Wang, Jiatong Li, Yuchen Li, Yuyang Ye, Wanyu Wang, Pengyue Jia, Kai Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Rutgers University(罗格斯大学) University of Science and Technology of China(中国科学技术大学) Universiteit van Amsterdam(阿姆斯特丹大学) Baidu Inc(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 92%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14199 2026-04-17 q-fin.CP cs.AI cs.LG 92%

PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data

PolyBench:基于实时预测市场数据的LLM预测与交易能力基准测试

Pu Cheng, Juncheng Liu, Yunshen Long

机构 * College of Electrical Engineering, Sichuan University(四川大学电气工程学院) School of Economics, Sichuan University(四川大学经济学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolyBench基准测试,通过实时预测市场数据评估七种先进LLM的预测与交易能力,发现仅两种模型在严格市场状态下实现正收益,揭示了语言流畅性与真实概率推理之间的差距。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 92%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02908 2026-01-07 cs.CV cs.AI cs.LG 92%

TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors

TA-Prompting: 通过时间锚点增强视频大语言模型以实现密集视频描述

Wei-Yuan Cheng, Kai-Po Chang, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA(NVIDIA公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI、cs.LG

AI总结 TA-Prompting通过引入时间锚点提升视频大语言模型的密集视频描述能力,有效解决时间边界识别问题,提升时间感知视频事件理解性能。

Comments 8 pages for main paper (exclude citation pages), 6 pages for appendix, totally 10 figures 7 tables and 2 algorithms. The paper is accepted by WACV 2026

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00047 2025-10-13 cs.LG cs.AI 92%

TriP-LLM: A Tri-Branch Patch-wise Large Language Model Framework for Time-Series Anomaly Detection

Yuan-Cheng Yu, Yen-Chieh Ouyang, Chun-An Lin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted version of the paper published in IEEE Access (2025). Licensed under a Creative Commons Attribution 4.0 License (CC BY 4.0). Published version available at IEEE Xplore

Journal ref IEEE Access, vol. 13, pp. 168643-168653, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05935 2025-10-08 cs.LG cs.AI 92%

LLM-FS-Agent: A Deliberative Role-based Large Language Model Architecture for Transparent Feature Selection

Mohamed Bal-Ghaoui, Fayssal Sabri

机构 * R&D Department, Audensiel Conseil(Audensiel Conseil 研发部) Ecole Centrale de Lyon(Lyon 工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00863 2025-09-01 cs.CL cs.LG 92%

L3Cube-MahaEmotions: A Marathi Emotion Recognition Dataset with Synthetic Annotations using CoTR prompting and Large Language Models

Nidhi Kowtal, Raviraj Joshi

机构 * Pune Institute of Computer Technology(普那计算机技术研究所) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) L3Cube Labs(L3Cube实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02429 2025-08-05 cs.AI cs.LG 92%

Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting

Miaosen Luo, Jiesen Long, Zequn Li, Yunying Yang, Yuncheng Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Information Technology in Education, South China Normal University(华南师范大学教育信息技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06623 2025-07-10 cs.CL cs.AI 92%

Expediting data extraction using a large language model (LLM) and scoping review protocol: a methodological study within a complex scoping review

James Stewart-Evans, Emma Wilson, Tessa Langley, Andrew Prayle, Angela Hands, Karen Exley, Jo Leonardi-Bee

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 44 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03785 2025-07-10 cs.CL cs.AI 92%

Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons

Isik Baran Sandan, Tu Anh Dinh, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to GEM @ ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11985 2025-05-28 cs.CL cs.AI 92%

No LLM is Free From Bias: A Comprehensive Study of Bias Evaluation in Large Language Models

Charaka Vinayak Kumar, Ashok Urlana, Gopichand Kanumolu, Bala Mallikarjunarao Garlapati, Pruthwik Mishra

机构 * IIIT Hyderabad(印度海得拉尔印度理工学院) TCS Research(塔塔咨询服务研究) SVNIT Surat(萨瓦尔特理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);prompting(abstract)

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19568 2025-05-27 cs.AI cs.LG 92%

MSD-LLM: Predicting Ship Detention in Port State Control Inspections with Large Language Model

Jiongchao Jin, Xiuju Fu, Xiaowei Gao, Tao Cheng, Ran Yan

机构 * Institute of High Performance Computing(高性能计算研究所) Agency for Science, Technology and Research(科技研究局) Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(伦敦帝国理工学院) SpaceTimeLab, Department of Civil, Environmental and Geomatic Engineering(空间时间实验室,土木、环境与测绘工程系) University College London(伦敦大学学院) School of Civil and Environmental Engineering(土木与环境工程学院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00032 2025-05-02 cs.CL cs.AI 92%

MDD-LLM: Towards Accuracy Large Language Models for Major Depressive Disorder Diagnosis

Yuyang Sha, Hongxin Pan, Wei Xu, Weiyu Meng, Gang Luo, Xinyu Du, Xiaobing Zhai, Henry H. Y. Tong, Caijuan Shi, Kefeng Li

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01903 2025-04-30 cs.CV cs.CL cs.LG 92%

Prophet: Prompting Large Language Models with Complementary Answer Heuristics for Knowledge-based Visual Question Answering

Zhou Yu, Xuecheng Ouyang, Zhenwei Shao, Meng Wang, Jun Yu

机构 * Key Laboratory of Complex Systems Modeling and Simulation, the School of Computer Science, Hangzhou Dianzi University(复杂系统建模与仿真重点实验室、计算机科学学院、杭州电子大学) HDU-ITMO Joint Institute, Hangzhou Dianzi University(杭州电子大学-ITMO联合学院) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院、合肥工业大学) School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(智能科学与工程学院、哈尔滨工业大学深圳校区)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments An extended journal version of our CVPR 2023 paper, which has been accepted at IEEE T-PAMI 2025. The original conference version can be referred to as the v1 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10430 2025-04-15 cs.CL cs.AI cs.HC 92%

LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models

Minqian Liu, Zhiyang Xu, Xinyi Zhang, Heajun An, Sarvech Qadir, Qi Zhang, Pamela J. Wisniewski, Jin-Hee Cho, Sang Won Lee, Ruoxi Jia, Lifu Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06475 2025-03-11 cs.AI cs.CL 92%

SKG-LLM: Developing a Mathematical Model for Stroke Knowledge Graph Construction Using Large Language Models

Ali Sarabadani, Kheirolah Rahsepar Fard, Hamid Dalvand

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00914 2024-11-05 cs.LG cs.AI cs.CE 92%

AAD-LLM: Adaptive Anomaly Detection Using Large Language Models

Alicia Russell-Gilbert, Alexander Sommers, Andrew Thompson, Logan Cummins, Sudip Mittal, Shahram Rahimi, Maria Seale, Joseph Jaboure, Thomas Arnold, Joshua Church

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14961 2024-10-22 cs.LG cs.AI cs.SI 92%

LangGFM: A Large Language Model Alone Can be a Powerful Graph Foundation Model

Tianqianjin Lin, Pengwei Yan, Kaisong Song, Zhuoren Jiang, Yangyang Kang, Jun Lin, Weikang Yuan, Junjie Cao, Changlong Sun, Xiaozhong Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15377 2024-09-25 cs.CL cs.AI 92%

Prompting Large Language Models for Supporting the Differential Diagnosis of Anemia

Elisa Castagnari, Lillian Muyama, Adrien Coulet

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

Journal ref LLMs4MI 2024 @FLLM 2024, IEEE, Nov 2024, Dubai, United Arab Emirates

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20574 2024-08-20 cs.CL cs.AI 92%

Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark

Chanjun Park, Hyeonwoo Kim, Dahyun Kim, Seonghwan Cho, Sanghoon Kim, Sukyung Lee, Yungi Kim, Hwalsuk Lee

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06373 2024-08-09 cs.CL cs.AI 92%

LLM Discussion: Enhancing the Creativity of Large Language Models via Discussion Framework and Role-Play

Li-Chun Lu, Shou-Jen Chen, Tsung-Min Pai, Chan-Hung Yu, Hung-yi Lee, Shao-Hua Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 40 pages, 9 figures, COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07909 2024-02-14 cs.HC cs.AI cs.CL cs.DB 92%

Prompt4Vis: Prompting Large Language Models with Example Mining and Schema Filtering for Tabular Data Visualization

Shuaimin Li, Xuanang Chen, Yuanfeng Song, Yunze Song, Chen Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06831 2024-01-17 cs.CL cs.AI 92%

A Survey on the Applications of Frontier AI, Foundation Models, and Large Language Models to Intelligent Transportation Systems

Mohamed R. Shoaib, Heba M. Emara, Jun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);分类 cs.CL、cs.AI

Comments This paper appears in International Conference on Computer and Applications (ICCA) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00272 2023-10-03 cs.CL cs.AI 92%

Investigating the Efficacy of Large Language Models in Reflective Assessment Methods through Chain of Thoughts Prompting

Baphumelele Masikisiki, Vukosi Marivate, Yvette Hlope

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in the Associate Computer Machinery

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12940 2023-09-25 cs.CL cs.AI 92%

Self-Explanation Prompting Improves Dialogue Understanding in Large Language Models

Haoyu Gao, Ting-En Lin, Hangyu Li, Min Yang, Yuchuan Wu, Wentao Ma, Yongbin Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11991 2023-09-04 cs.CL cs.AI 92%

Psy-LLM: Scaling up Global Mental Health Psychological Services with AI-based Large Language Models

Tin Lai, Yukun Shi, Zicong Du, Jiajie Wu, Ken Fu, Yichao Dou, Ziqi Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13711 2023-05-24 cs.CL cs.AI 92%

LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models

Yen-Ting Lin, Yun-Nung Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at 5th NLP4ConvAI

详情

展开后加载摘要…

URL PDF HTML 收藏