arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2403.13244 2024-10-11 cs.CL cs.AI 88%

Instruction Multi-Constraint Molecular Generation Using a Teacher-Student Large Language Model

Peng Zhou, Jianmin Wang, Chunyan Li, Zixu Wang, Yiping Liu, Siqi Sun, Jianxin Lin, Leyi Wei, Xibao Cai, Houtim Lai, Wei Liu, Longyue Wang, Yuansheng Liu, Xiangxiang Zeng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00896 2024-10-11 cs.CL cs.AI 88%

DiaHalu: A Dialogue-level Hallucination Evaluation Benchmark for Large Language Models

Kedi Chen, Qin Chen, Jie Zhou, Yishen He, Liang He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06707 2024-10-10 cs.CL cs.AI 88%

Calibrating Verbalized Probabilities for Large Language Models

Cheng Wang, Gyuri Szarvas, Georges Balazs, Pavel Danchenko, Patrick Ernst

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04452 2024-10-08 cs.CL cs.AI 88%

MindScope: Exploring cognitive biases in large language models through Multi-Agent Systems

Zhentao Xie, Jiabao Zhao, Yilei Wang, Jinxin Shi, Yanhong Bai, Xingjiao Wu, Liang He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages,7 figures,Our paper has been accepted for presentation at the 2024 European Conference on Artificial Intelligence (ECAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18638 2024-10-08 cs.CL cs.AI 88%

ConSiDERS-The-Human Evaluation Framework: Rethinking Human Evaluation for Generative Large Language Models

Aparna Elangovan, Ling Liu, Lei Xu, Sravan Bodapati, Dan Roth

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01450 2024-10-03 cs.CL cs.AI 88%

Agent-Driven Large Language Models for Mandarin Lyric Generation

Hong-Hsiang Liu, Yi-Wen Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, figures, Accepted at O-COCOSDA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02996 2024-10-03 cs.CL cs.AI 88%

Are Large Language Models Consistent over Value-laden Questions?

Jared Moore, Tanvi Deshpande, Diyi Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 10 figures, In Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18139 2024-10-01 cs.CL cs.AI 88%

Cause and Effect: Can Large Language Models Truly Understand Causality?

Swagata Ashwani, Kshiteesh Hegde, Nishith Reddy Mannuru, Mayank Jindal, Dushyant Singh Sengar, Krishna Chaitanya Rao Kathala, Dishant Banga, Vinija Jain, Aman Chadha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments AI Trustworthiness and Risk Assessment for Challenged Contexts (ATRACC) AAAI 2024 Fall Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18548 2024-09-30 cs.CL cs.AI 88%

Research on Predicting Public Opinion Event Heat Levels Based on Large Language Models

Yi Ren, Tianyi Zhang, Weibin Li, DuoMu Zhou, Chenhao Qin, FangCheng Dong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16220 2024-09-25 cs.IR cs.AI cs.CL 88%

Towards Enhancing Linked Data Retrieval in Conversational UIs using Large Language Models

Omar Mussa, Omer Rana, Benoît Goossens, Pablo Orozco-Terwengel, Charith Perera

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted at the 25th International Web Information Systems Engineering Conference (WISE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02559 2024-09-25 cs.CL cs.AI 88%

A Framework for Human Evaluation of Large Language Models in Healthcare Derived from Literature Review

Thomas Yu Chow Tam, Sonish Sivarajkumar, Sumit Kapoor, Alisa V Stolyar, Katelyn Polanska, Karleigh R McCarthy, Hunter Osterhoudt, Xizhi Wu, Shyam Visweswaran, Sunyang Fu, Piyush Mathur, Giovanni E. Cacciamani, Cong Sun, Yifan Peng, Yanshan Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12450 2024-09-25 cs.SE cs.AI cs.LG cs.PL 88%

Can It Edit? Evaluating the Ability of Large Language Models to Follow Code Editing Instructions

Federico Cassano, Luisa Li, Akul Sethi, Noah Shinn, Abby Brennan-Jones, Jacob Ginesin, Edward Berman, George Chakhnashvili, Anton Lozhkov, Carolyn Jane Anderson, Arjun Guha

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10303 2024-09-24 cs.CL cs.AI 88%

A Survey on Large Language Models from General Purpose to Medical Applications: Datasets, Methodologies, and Evaluations

Jinqiang Wang, Huansheng Ning, Yi Peng, Qikai Wei, Daniel Tesfai, Wenwei Mao, Tao Zhu, Runhe Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 25 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08326 2024-09-24 cs.CL cs.AI 88%

RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning

Junjie Ye, Yilong Wu, Songyang Gao, Caishuang Huang, Sixian Li, Guanyu Li, Xiaoran Fan, Qi Zhang, Tao Gui, Xuanjing Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13537 2024-09-23 cs.CL cs.AI 88%

ShizishanGPT: An Agricultural Large Language Model Integrating Tools and Resources

Shuting Yang, Zehui Liu, Wolfgang Mayer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages,3 figures, WISE2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13359 2024-09-23 cs.CL cs.AI 88%

EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models

Yuyan Chen, Hao Wang, Songzhou Yan, Sijia Liu, Yueze Li, Yi Zhao, Yanghua Xiao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13354 2024-09-23 cs.CL cs.AI 88%

Recent Advancement of Emotion Cognition in Large Language Models

Yuyan Chen, Yanghua Xiao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16218 2024-09-23 cs.CL cs.AI 88%

Knowledge Editing for Large Language Models: A Survey

Song Wang, Yaochen Zhu, Haochen Liu, Zaiyi Zheng, Chen Chen, Jundong Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10338 2024-09-17 cs.CL cs.AI 88%

The 20 questions game to distinguish large language models

Gurvan Richardeau, Erwan Le Merrer, Camilla Penzo, Gilles Tredan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09841 2024-09-17 cs.CL cs.AI 88%

Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond

Fangzhi Xu, Qika Lin, Jiawei Han, Tianzhe Zhao, Jun Liu, Erik Cambria

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 37 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08011 2024-09-12 cs.LG cs.AI 88%

A Survey of Large Language Models for Graphs

Xubin Ren, Jiabin Tang, Dawei Yin, Nitesh Chawla, Chao Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments Published as a KDD'24 survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07544 2024-09-12 cs.CL cs.AI 88%

From Words to Numbers: Your Large Language Model Is Secretly A Capable Regressor When Given In-Context Examples

Robert Vacareanu, Vlad-Andrei Negru, Vasile Suciu, Mihai Surdeanu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 55 pages, 48 figures COLM camera-ready version; Changes include: (i) added real-world datasets (Appendix I), (ii) fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03454 2024-09-11 cs.CL cs.AI 88%

How Much Data is Enough Data? Fine-Tuning Large Language Models for In-House Translation: Performance Evaluation Across Multiple Dataset Sizes

Inacio Vieira, Will Allred, Séamus Lankford, Sheila Castilho, Andy Way

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06072 2024-09-11 cs.CL cs.LG 88%

DetoxBench: Benchmarking Large Language Models for Multitask Fraud & Abuse Detection

Joymallya Chakraborty, Wei Xia, Anirban Majumder, Dan Ma, Walid Chaabene, Naveed Janvekar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 12 pages

Journal ref Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08632 2024-09-09 cs.CL cs.AI cs.CV 88%

A Survey on Benchmarks of Multimodal Large Language Models

Jian Li, Weiheng Lu, Hao Fei, Meng Luo, Ming Dai, Min Xia, Yizhang Jin, Zhenye Gan, Ding Qi, Chaoyou Fu, Ying Tai, Wankou Yang, Yabiao Wang, Chengjie Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07747 2024-09-09 cs.CL cs.AI 88%

FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models

Yan Liu, Renren Jin, Ling Shi, Zheng Yao, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01941 2024-09-04 cs.CL cs.LG 88%

Towards Leveraging Large Language Models for Automated Medical Q&A Evaluation

Jack Krolik, Herprit Mahal, Feroz Ahmad, Gaurav Trivedi, Bahador Saket

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01864 2024-09-04 cs.SD cs.AI cs.CL cs.DL eess.AS 88%

The Role of Large Language Models in Musicology: Are We Ready to Trust the Machines?

Pedro Ramoneda, Emilia Parada-Cabaleiro, Benno Weck, Xavier Serra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10311 2024-09-04 cs.CL cs.AI 88%

CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models

Wenjing Zhang, Xuejiao Lei, Zhaoxiang Liu, Meijuan An, Bikun Yang, KaiKai Zhao, Kai Wang, Shiguo Lian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00551 2024-09-04 cs.CL cs.AI cs.SE 88%

Testing and Evaluation of Large Language Models: Correctness, Non-Toxicity, and Fairness

Wenxuan Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏