arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2304.05128 2023-10-06 cs.CL cs.AI 88%

Teaching Large Language Models to Self-Debug

Xinyun Chen, Maxwell Lin, Nathanael Schärli, Denny Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12727 2023-09-25 cs.AI cs.CL 88%

In-context Interference in Chat-based Large Language Models

Eric Nuertey Coleman, Julio Hurtado, Vincenzo Lomonaco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16755 2023-09-22 cs.CL cs.AI 88%

Can large language models generate salient negative statements?

Hiba Arnaout, Simon Razniewski

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments For data, see https://www.mpi-inf.mpg.de/fileadmin/inf/d5/research/negation_in_KBs/data.csv

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05557 2023-09-20 cs.CL cs.AI cs.NI 88%

An Empirical Study of NetOps Capability of Pre-Trained Large Language Models

Yukai Miao, Yu Bai, Li Chen, Dan Li, Haifeng Sun, Xizheng Wang, Ziqiu Luo, Yanyu Ren, Dapeng Sun, Xiuting Xu, Qi Zhang, Chao Xiang, Xinchi Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14096 2023-09-18 cs.CL cs.AI 88%

Chinese Fine-Grained Financial Sentiment Analysis with Large Language Models

Yinyu Lan, Yanru Wu, Wang Xu, Weiqiang Feng, Youhao Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by (FinLLM 2023)@IJCAI 2023, https://finllm.github.io/workshop/#/fcb

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06495 2023-09-14 cs.CL cs.AI cs.PF 88%

AGIBench: A Multi-granularity, Multimodal, Human-referenced, Auto-scoring Benchmark for Large Language Models

Fei Tang, Wanling Gao, Luzhou Peng, Jianfeng Zhan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07267 2023-09-14 cs.HC cs.AI cs.CL 88%

Diminished Diversity-of-Thought in a Standard Large Language Model

Peter S. Park, Philipp Schoenegger, Chongyang Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 67 pages (42-page main text, 25-page SI); 12 visualizations (four tables and three figures in the main text, five figures in the SI); additional exploratory follow-up study varied the demographic details preceding the prompt; preregistered OSF database is available at https://osf.io/dzp8t/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17926 2023-08-31 cs.CL cs.AI cs.IR 88%

Large Language Models are not Fair Evaluators

Peiyi Wang, Lei Li, Liang Chen, Zefan Cai, Dawei Zhu, Binghuai Lin, Yunbo Cao, Qi Liu, Tianyu Liu, Zhifang Sui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14608 2023-08-30 cs.LG cs.CL cs.CY cs.SI 88%

AI in the Gray: Exploring Moderation Policies in Dialogic Large Language Models vs. Human Answers in Controversial Topics

Vahid Ghafouri, Vibhor Agarwal, Yong Zhang, Nishanth Sastry, Jose Such, Guillermo Suarez-Tangil

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11391 2023-08-29 cs.AI cs.LG 88%

A Survey of Safety and Trustworthiness of Large Language Models through the Lens of Verification and Validation

Xiaowei Huang, Wenjie Ruan, Wei Huang, Gaojie Jin, Yi Dong, Changshun Wu, Saddek Bensalem, Ronghui Mu, Yi Qi, Xingyu Zhao, Kaiwen Cai, Yanghao Zhang, Sihao Wu, Peipei Xu, Dengyu Wu, Andre Freitas, Mustafa A. Mustafa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13512 2023-08-21 cs.CL cs.AI cs.SD eess.AS 88%

Can ChatGPT Detect Intent? Evaluating Large Language Models for Spoken Language Understanding

Mutian He, Philip N. Garner

专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 2 figures; Accepted by Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08061 2023-08-17 cs.CL cs.LG cs.SE 88%

The Costly Dilemma: Generalization, Evaluation and Cost-Optimal Deployment of Large Language Models

Abi Aryan, Aakash Kumar Nain, Andrew McMahon, Lucas Augusto Meyer, Harpreet Singh Sahota

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15425 2023-07-31 cs.CL cs.AI 88%

A Critical Review of Large Language Models: Sensitivity, Bias, and the Path Toward Specialized AI

Arash Hajikhani, Carolyn Cole

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 17 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08393 2023-07-18 cs.CL cs.LG 88%

On the application of Large Language Models for language teaching and assessment technology

Andrew Caines, Luca Benedetto, Shiva Taslimipoor, Christopher Davis, Yuan Gao, Oeistein Andersen, Zheng Yuan, Mark Elliott, Russell Moore, Christopher Bryant, Marek Rei, Helen Yannakoudakis, Andrew Mullooly, Diane Nicholls, Paula Buttery

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted at the AIED2023 workshop: Empowering Education with LLMs - the Next-Gen Interface and Content Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07443 2023-07-17 cs.LG cs.AI q-bio.QM 88%

Can Large Language Models Empower Molecular Property Prediction?

Chen Qian, Huayi Tang, Zhirui Yang, Hong Liang, Yong Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03712 2023-07-10 cs.LG cs.CL cs.CV 88%

INT-FP-QSim: Mixed Precision and Formats For Large Language Models and Vision Transformers

Lakshmi Nair, Mikhail Bernadskiy, Arulselvan Madhavan, Craig Chan, Ayon Basumallik, Darius Bunandar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments This report is supplementary material to the open-source code available at: https://github.com/lightmatter-ai/INT-FP-QSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16244 2023-06-29 cs.CL cs.AI 88%

CBBQ: A Chinese Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models

Yufei Huang, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11507 2023-06-21 cs.CL cs.AI 88%

TrustGPT: A Benchmark for Trustworthy and Responsible Large Language Models

Yue Huang, Qihui Zhang, Philip S. Y, Lichao Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments We are currently expanding this work and welcome collaborators!

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08714 2023-06-09 cs.CL cs.AI 88%

Sensitivity and Robustness of Large Language Models to Prompt Template in Japanese Text Classification Tasks

Chengguang Gan, Tatsunori Mori

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Under Review. 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04610 2023-06-08 cs.CL cs.AI 88%

The Two Word Test: A Semantic Benchmark for Large Language Models

Nicholas Riccardi, Rutvik H. Desai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures, 3 tables, submitted to NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05050 2023-05-29 cs.CL cs.AI 88%

ANALOGICAL -- A Novel Benchmark for Long Text Analogy Evaluation in Large Language Models

Thilini Wijesiriwardene, Ruwan Wickramarachchi, Bimal G. Gajera, Shreeyash Mukul Gowaikar, Chandan Gupta, Aman Chadha, Aishwarya Naresh Reganti, Amit Sheth, Amitava Das

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted as a long paper at Findings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15268 2023-05-25 cs.CL cs.AI 88%

EvEval: A Comprehensive Evaluation of Event Semantics for Large Language Models

Zhengwei Tao, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Yanlin Feng, Jia Li, Wenpeng Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14693 2023-05-25 cs.CL cs.LG 88%

Have Large Language Models Developed a Personality?: Applicability of Self-Assessment Tests in Measuring Personality in LLMs

Xiaoyang Song, Akshat Gupta, Kiyan Mohebbizadeh, Shujie Hu, Anant Singh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02783 2023-05-24 cs.SE cs.AI cs.CL cs.PL 88%

Automated Code generation for Information Technology Tasks in YAML through Large Language Models

Saurabh Pujar, Luca Buratti, Xiaojie Guo, Nicolas Dupuis, Burn Lewis, Sahil Suneja, Atin Sood, Ganesh Nalawade, Matthew Jones, Alessandro Morari, Ruchir Puri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.15004 2023-05-23 cs.AI cs.LG 88%

Are Emergent Abilities of Large Language Models a Mirage?

Rylan Schaeffer, Brando Miranda, Sanmi Koyejo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03945 2023-05-22 cs.LG cs.AI 88%

Understanding HTML with Large Language Models

Izzeddin Gur, Ofir Nachum, Yingjie Miao, Mustafa Safdari, Austin Huang, Aakanksha Chowdhery, Sharan Narang, Noah Fiedel, Aleksandra Faust

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07378 2023-05-15 cs.CL cs.CY cs.LG 88%

Surfacing Biases in Large Language Models using Contrastive Input Decoding

Gal Yona, Or Honovich, Itay Laish, Roee Aharoni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05377 2023-05-10 cs.AI cs.LG 88%

Professional Certification Benchmark Dataset: The First 500 Jobs For Large Language Models

David Noever, Matt Ciolino

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09420 2023-05-09 cs.SE cs.AI cs.CL cs.PL 88%

Large Language Models Meet NL2Code: A Survey

Daoguang Zan, Bei Chen, Fengji Zhang, Dianjie Lu, Bingchao Wu, Bei Guan, Yongji Wang, Jian-Guang Lou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to the main conference of ACL 2023 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11857 2023-05-09 cs.CL cs.LG 88%

Shortcut Learning of Large Language Models in Natural Language Understanding

Mengnan Du, Fengxiang He, Na Zou, Dacheng Tao, Xia Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by Communications of the ACM (CACM), Review Article

详情

展开后加载摘要…

URL PDF HTML 收藏