arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2407.02395 2024-07-08 cs.SE cs.CL 88%

Is Your AI-Generated Code Really Safe? Evaluating Large Language Models on Secure Code Generation with CodeSecEval

Jiexin Wang, Xitong Luo, Liuwen Cao, Hongkui He, Hailin Huang, Jiayuan Xie, Adam Jatowt, Yi Cai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2310.16263

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03129 2024-07-04 cs.CL 88%

Social Bias Evaluation for Large Language Models Requires Prompt Variations

Rem Hida, Masahiro Kaneko, Naoaki Okazaki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02301 2024-07-03 cs.CL 88%

CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models

Ying Nie, Binwei Yan, Tianyu Guo, Hao Liu, Haoyu Wang, Wei He, Binfan Zheng, Weihao Wang, Qiang Li, Weijian Sun, Yunhe Wang, Dacheng Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01358 2024-07-02 cs.CL 88%

Evaluating Knowledge-based Cross-lingual Inconsistency in Large Language Models

Xiaolin Xing, Zhiwei He, Haoyu Xu, Xing Wang, Rui Wang, Yu Hong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11985 2024-07-02 cs.CL cs.CY 88%

Climate Change from Large Language Models

Hongyin Zhu, Prayag Tiwari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09022 2024-07-02 cs.CL 88%

Exploring the Potential of Large Language Models in Computational Argumentation

Guizhen Chen, Liying Cheng, Luu Anh Tuan, Lidong Bing

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03192 2024-06-27 cs.IR cs.CL 88%

Do Large Language Models Rank Fairly? An Empirical Study on the Fairness of LLMs as Rankers

Yuan Wang, Xuyang Wu, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at NAACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17915 2024-06-27 cs.CV cs.AI 88%

Semi-supervised classification of dental conditions in panoramic radiographs using large language model and instance segmentation: A real-world dataset evaluation

Bernardo Silva, Jefferson Fontinele, Carolina Letícia Zilli Vieira, João Manuel R. S. Tavares, Patricia Ramos Cury, Luciano Oliveira

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 43 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16356 2024-06-25 cs.CL 88%

Evaluation of Instruction-Following Ability for Large Language Models on Story-Ending Generation

Rem Hida, Junki Ohmura, Toshiyuki Sekiya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15885 2024-06-25 cs.SD cs.AI eess.AS 88%

The Music Maestro or The Musically Challenged, A Massive Music Evaluation Benchmark for Large Language Models

Jiajia Li, Lu Yang, Mingni Tang, Cong Chen, Zuchao Li, Ping Wang, Hai Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted to ACL-Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13737 2024-06-25 cs.CL 88%

EthioLLM: Multilingual Large Language Models for Ethiopian Languages with Task Evaluation

Atnafu Lambebo Tonja, Israel Abebe Azime, Tadesse Destaw Belay, Mesay Gemeda Yigezu, Moges Ahmed Mehamed, Abinew Ali Ayele, Ebrahim Chekol Jibril, Michael Melese Woldeyohannis, Olga Kolesnikova, Philipp Slusallek, Dietrich Klakow, Shengwu Xiong, Seid Muhie Yimam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at LREC-Coling 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17944 2024-06-25 cs.CL 88%

Large Language Models(LLMs) on Tabular Data: Prediction, Generation, and Understanding -- A Survey

Xi Fang, Weijie Xu, Fiona Anting Tan, Jiani Zhang, Ziqing Hu, Yanjun Qi, Scott Nickleach, Diego Socolinsky, Srinivasan Sengamedu, Christos Faloutsos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 41 pages, 4 figures, 8 tables

Journal ref TMLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07045 2024-06-25 cs.CL 88%

SafetyBench: Evaluating the Safety of Large Language Models

Zhexin Zhang, Leqi Lei, Lindong Wu, Rui Sun, Yongkang Huang, Chong Long, Xiao Liu, Xuanyu Lei, Jie Tang, Minlie Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14169 2024-06-21 cs.IR cs.LG 88%

Optimizing Novelty of Top-k Recommendations using Large Language Models and Reinforcement Learning

Amit Sharma, Hua Li, Xue Li, Jian Jiao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Accepted at KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12347 2024-06-19 cs.CL 88%

Interpreting Bias in Large Language Models: A Feature-Based Approach

Nirmalendu Prakash, Lee Ka Wei Roy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11903 2024-06-19 q-fin.GN cs.AI q-fin.CP 88%

A Survey of Large Language Models for Financial Applications: Progress, Prospects and Challenges

Yuqi Nie, Yaxuan Kong, Xiaowen Dong, John M. Mulvey, H. Vincent Poor, Qingsong Wen, Stefan Zohren

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11100 2024-06-11 cs.CL 88%

When LLMs Meet Cunning Texts: A Fallacy Understanding Benchmark for Large Language Models

Yinghui Li, Qingyu Zhou, Yuanzhen Luo, Shirong Ma, Yangning Li, Hai-Tao Zheng, Xuming Hu, Philip S. Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05063 2024-06-10 cs.CL 88%

Are Large Language Models More Empathetic than Humans?

Anuradha Welivita, Pearl Pu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, 3 figures. arXiv admin note: text overlap with arXiv:2403.05572

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04941 2024-06-10 cs.CL 88%

TCMD: A Traditional Chinese Medicine QA Dataset for Evaluating Large Language Models

Ping Yu, Kaitao Song, Fengchen He, Ming Chen, Jianfeng Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04712 2024-06-10 cs.CL 88%

AICoderEval: Improving AI Domain Code Generation of Large Language Models

Yinghui Xia, Yuyan Chen, Tianyu Shi, Jun Wang, Jinsong Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04214 2024-06-07 cs.CL 88%

ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language Models

Yuanyi Ren, Haoran Ye, Hanjun Fang, Xin Zhang, Guojie Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04113 2024-06-07 cs.CL 88%

Uncovering Limitations of Large Language Models in Information Seeking from Tables

Chaoxu Pang, Yixuan Cao, Chunhao Yang, Ping Luo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03757 2024-06-07 cs.RO cs.LG 88%

RoboCoder: Robotic Learning from Basic Skills to General Tasks with Large Language Models

Jingyao Li, Pengguang Chen, Sitong Wu, Chuanyang Zheng, Hong Xu, Jiaya Jia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13607 2024-06-06 cs.CV cs.CL 88%

CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models

Fuwen Luo, Chi Chen, Zihao Wan, Zhaolu Kang, Qidong Yan, Yingjie Li, Xiaolong Wang, Siyu Wang, Ziyue Wang, Xiaoyue Mi, Peng Li, Ning Ma, Maosong Sun, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17080 2024-06-06 cs.CL 88%

MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation

Zhongshen Zeng, Pengguang Chen, Shu Liu, Haiyun Jiang, Jiaya Jia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Code: https://github.com/dvlab-research/MR-GSM8K

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20410 2024-06-06 cs.CL 88%

FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models

Yuxin Jiang, Yufei Wang, Xingshan Zeng, Wanjun Zhong, Liangyou Li, Fei Mi, Lifeng Shang, Xin Jiang, Qun Liu, Wei Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 22 pages, 11 figures, 16 tables. ACL 2024 main camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11406 2024-06-06 cs.CL 88%

LaMP: When Large Language Models Meet Personalization

Alireza Salemi, Sheshera Mysore, Michael Bendersky, Hamed Zamani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01069 2024-06-05 cs.CL 88%

LLMCRIT: Teaching Large Language Models to Use Criteria

Weizhe Yuan, Pengfei Liu, Matthias Gallé

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ACL 2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00039 2024-06-04 cs.CL 88%

How Ready Are Generative Pre-trained Large Language Models for Explaining Bengali Grammatical Errors?

Subhankar Maity, Aniket Deroy, Sudeshna Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at Educational Data Mining 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07529 2024-06-04 cs.CV cs.CL 88%

MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception

Yuhao Wang, Yusheng Liao, Heyang Liu, Hongcheng Liu, Yu Wang, Yanfeng Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏