arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2311.08649 2023-11-16 cs.SE cs.AI 88%

Autonomous Large Language Model Agents Enabling Intent-Driven Mobile GUI Testing

Juyeon Yoon, Robert Feldt, Shin Yoo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08287 2023-11-15 cs.CL 88%

How Well Do Large Language Models Understand Syntax? An Evaluation by Asking Natural Language Questions

Houquan Zhou, Yang Hou, Zhenghua Li, Xuebin Wang, Zhefeng Wang, Xinyu Duan, Min Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07491 2023-11-14 cs.CL 88%

A Step Closer to Comprehensive Answers: Constrained Multi-Stage Question Decomposition with Large Language Models

Hejing Cao, Zhenwei An, Jiazhan Feng, Kun Xu, Liwei Chen, Dongyan Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05179 2023-11-13 cs.CL cs.CV 88%

M3Exam: A Multilingual, Multimodal, Multilevel Benchmark for Examining Large Language Models

Wenxuan Zhang, Sharifah Mahani Aljunied, Chang Gao, Yew Ken Chia, Lidong Bing

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments NeurIPS 2023 (Datasets and Benchmarks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19233 2023-11-09 cs.CL 88%

Building Real-World Meeting Summarization Systems using Large Language Models: A Practical Perspective

Md Tahmid Rahman Laskar, Xue-Yong Fu, Cheng Chen, Shashi Bhushan TN

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2023 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02426 2023-11-03 cs.CL 88%

ParroT: Translating during Chat using Large Language Models tuned with Human Translation and Feedback

Wenxiang Jiao, Jen-tse Huang, Wenxuan Wang, Zhiwei He, Tian Liang, Xing Wang, Shuming Shi, Zhaopeng Tu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 12 pages; EMNLP 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18357 2023-10-31 cs.CL 88%

Leveraging Large Language Models for Enhanced Product Descriptions in eCommerce

Jianghong Zhou, Bo Liu, Jhalak Nilesh Acharya Yao Hong, Kuang-chih Lee, Musen Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, 4 figures, EMNLP2023 workshop, The 2023 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16673 2023-10-26 cs.SE cs.AI cs.IR 88%

Exploring Large Language Models for Code Explanation

Paheli Bhattacharya, Manojit Chakraborty, Kartheek N S N Palepu, Vikas Pandey, Ishan Dindorkar, Rakesh Rajpurohit, Rishabh Gupta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at the Forum for Information Retrieval Evaluation 2023 (IRSE Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16517 2023-10-26 cs.CL 88%

OccuQuest: Mitigating Occupational Bias for Inclusive Large Language Models

Mingfeng Xue, Dayiheng Liu, Kexin Yang, Guanting Dong, Wenqiang Lei, Zheng Yuan, Chang Zhou, Jingren Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03368 2023-10-26 cs.CL 88%

Evaluating Hallucinations in Chinese Large Language Models

Qinyuan Cheng, Tianxiang Sun, Wenwei Zhang, Siyin Wang, Xiangyang Liu, Mozhi Zhang, Junliang He, Mianqiu Huang, Zhangyue Yin, Kai Chen, Xipeng Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15941 2023-10-25 cs.CL 88%

This is not a Dataset: A Large Negation Benchmark to Challenge Large Language Models

Iker García-Ferrero, Begoña Altuna, Javier Álvez, Itziar Gonzalez-Dios, German Rigau

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted in the The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15773 2023-10-25 cs.CL 88%

BLESS: Benchmarking Large Language Models on Sentence Simplification

Tannon Kew, Alison Chi, Laura Vásquez-Rodríguez, Sweta Agrawal, Dennis Aumiller, Fernando Alva-Manchego, Matthew Shardlow

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments This paper has been accepted to EMNLP 2023 as a main long paper. 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07355 2023-10-24 cs.CL 88%

ZARA: Improving Few-Shot Self-Rationalization for Small Language Models

Wei-Lin Chen, An-Zi Yen, Cheng-Kuang Wu, Hen-Hsen Huang, Hsin-Hsi Chen

专题命中 评测与基准 :language model(title,abstract);small language model(title);prompting(abstract);分类 cs.CL

Comments Accepted as a long paper at EMNLP Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14389 2023-10-24 cs.CL 88%

Evaluating Subjective Cognitive Appraisals of Emotions from Large Language Models

Hongli Zhan, Desmond C. Ong, Junyi Jessy Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2023 (Findings) Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13985 2023-10-24 cs.CL 88%

HateRephrase: Zero- and Few-Shot Reduction of Hate Intensity in Online Posts using Large Language Models

Vibhor Agarwal, Yu Chen, Nishanth Sastry

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13800 2023-10-24 cs.CL 88%

Evaluation Metrics in the Era of GPT-4: Reliably Evaluating Large Language Models on Sequence to Sequence Tasks

Andrea Sottana, Bin Liang, Kai Zou, Zheng Yuan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12152 2023-10-24 cs.CL 88%

Revisiting Automated Topic Model Evaluation with Large Language Models

Dominik Stammbach, Vilém Zouhar, Alexander Hoyle, Mrinmaya Sachan, Elliott Ash

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Forthcoming in EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11747 2023-10-24 cs.CL 88%

HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Junyi Li, Xiaoxue Cheng, Wayne Xin Zhao, Jian-Yun Nie, Ji-Rong Wen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2023 Main Conference (Long Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08172 2023-10-19 cs.CL 88%

Exploring the Cognitive Knowledge Structure of Large Language Models: An Educational Diagnostic Assessment Approach

Zheyuan Zhang, Jifan Yu, Juanzi Li, Lei Hou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2023 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11392 2023-10-18 cs.CV cs.AI 88%

Towards Automatic Satellite Images Captions Generation Using Large Language Models

Yingxu He, Qiqi Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09550 2023-10-17 cs.CL 88%

Can Large Language Model Comprehend Ancient Chinese? A Preliminary Test on ACLUE

Yixuan Zhang, Haonan Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at RANLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08487 2023-10-13 cs.CL 88%

GraphextQA: A Benchmark for Evaluating Graph-Enhanced Large Language Models

Yuanchun Shen, Ruotong Liao, Zhen Han, Yunpu Ma, Volker Tresp

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05818 2023-10-10 cs.CL 88%

SC-Safety: A Multi-round Open-ended Question Adversarial Safety Benchmark for Large Language Models in Chinese

Liang Xu, Kangkang Zhao, Lei Zhu, Hang Xue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 20 pages, 8 tables, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05553 2023-10-10 cs.CL 88%

Regulation and NLP (RegNLP): Taming Large Language Models

Catalina Goanta, Nikolaos Aletras, Ilias Chalkidis, Sofia Ranchordas, Gerasimos Spanakis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, long paper at EMNLP 2023 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05092 2023-10-10 cs.CL 88%

Benchmarking Large Language Models with Augmented Instructions for Fine-grained Information Extraction

Jun Gao, Huan Zhao, Yice Zhang, Wei Wang, Changlong Yu, Ruifeng Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04944 2023-10-10 cs.LG 88%

Beyond Text: A Deep Dive into Large Language Models' Ability on Understanding Graph Data

Yuntong Hu, Zheng Zhang, Liang Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04815 2023-10-10 cs.LG 88%

Critique Ability of Large Language Models

Liangchen Luo, Zi Lin, Yinxiao Liu, Lei Shu, Yun Zhu, Jingbo Shang, Lei Meng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05782 2023-10-09 cs.CL hep-th math.HO physics.comp-ph 88%

Large Language Models

Michael R. Douglas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 47 pages (v2: added references, corrected typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02431 2023-10-05 cs.HC cs.CL 88%

Can Large Language Models Provide Security & Privacy Advice? Measuring the Ability of LLMs to Refute Misconceptions

Yufan Chen, Arjun Arunasalam, Z. Berkay Celik

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to the Annual Computer Security Applications Conference (ACSAC), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16145 2023-09-29 cs.CL cs.CY cs.HC 88%

The Confidence-Competence Gap in Large Language Models: A Cognitive Study

Aniket Kumar Singh, Suman Devkota, Bishal Lamichhane, Uttam Dhakal, Chandra Dhakal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 19 pages, 8 Figures, to be published in a journal (Journal TBD), All Authors contributed equally and were Supervised by Chandra Dhakal

详情

展开后加载摘要…

URL PDF HTML 收藏