arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2401.06628 2024-02-22 cs.CL 88%

OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models

Shuai Wang, Liang Ding, Li Shen, Yong Luo, Bo Du, Dacheng Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12267 2024-02-20 cs.CL 88%

High-quality Data-to-Text Generation for Severely Under-Resourced Languages with Out-of-the-box Large Language Models

Michela Lorandi, Anya Belz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16132 2024-02-19 cs.CL 88%

RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models

Tianhao Shen, Sun Li, Quan Tu, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Our dataset is available at https://github.com/Magnetic2014/RoleEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08392 2024-02-14 cs.CL 88%

Large Language Models as Minecraft Agents

Chris Madge, Massimo Poesio

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01269 2024-02-14 cs.CR cs.AI cs.SE 88%

LLbezpeky: Leveraging Large Language Models for Vulnerability Detection

Noble Saji Mathews, Yelizaveta Brus, Yousra Aafer, Meiyappan Nagappan, Shane McIntosh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments This project report was presented as a part of the course CS858 at the University of Waterloo under the supervision of Prof. Yousra Aafer

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04592 2024-02-05 cs.CL 88%

An Assessment on Comprehending Mental Health through Large Language Models

Mihael Arcan, David-Paul Niland, Fionn Delahunty

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16765 2024-01-31 cs.CR cs.AI 88%

A Cross-Language Investigation into Jailbreak Attacks in Large Language Models

Jie Li, Yi Liu, Chongyang Liu, Ling Shi, Xiaoning Ren, Yaowen Zheng, Yang Liu, Yinxing Xue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14242 2024-01-26 cs.CL 88%

Improving Natural Language Capability of Code Large Language Model

Wei Li, Daoguang Zan, Bei Guan, Ailun Yu, Xiaolin Chen, Yongji Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12714 2024-01-24 cs.SE cs.AI 88%

Evaluation of large language models for assessing code maintainability

Marc Dillmann, Julien Siebert, Adam Trendowicz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 14 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11185 2024-01-23 cs.CL cs.HC 88%

How the Advent of Ubiquitous Large Language Models both Stymie and Turbocharge Dynamic Adversarial Question Generation

Yoo Yeon Sung, Ishani Mondal, Jordan Boyd-Graber

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15407 2024-01-23 cs.CL 88%

A Comprehensive Analysis of the Effectiveness of Large Language Models as Automatic Dialogue Evaluators

Chen Zhang, Luis Fernando D'Haro, Yiming Chen, Malu Zhang, Haizhou Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments An extended version of AAAI-2024 camera-ready paper (appendix included, 16 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08276 2024-01-17 cs.CV cs.CL 88%

AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception

Yipo Huang, Quan Yuan, Xiangfei Sheng, Zhichao Yang, Haoning Wu, Pengfei Chen, Yuzhe Yang, Leida Li, Weisi Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07872 2024-01-17 cs.CL 88%

The What, Why, and How of Context Length Extension Techniques in Large Language Models -- A Detailed Survey

Saurav Pawar, S. M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Aman Chadha, Amitava Das

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05319 2024-01-11 cs.CL cs.SE 88%

Leveraging Print Debugging to Improve Code Generation in Large Language Models

Xueyu Hu, Kun Kuang, Jiankai Sun, Hongxia Yang, Fei Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04471 2024-01-10 cs.CL 88%

TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models

Xue Zhang, Xiangyu Shi, Xinyue Lou, Rui Qi, Yufeng Chen, Jinan Xu, Wenjuan Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01313 2024-01-09 cs.CL 88%

A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models

S. M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Anku Rani, Vipula Rawte, Aman Chadha, Amitava Das

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00642 2024-01-02 cs.CL 88%

Predicting Anti-microbial Resistance using Large Language Models

Hyunwoo Yoo, Bahrad Sokhansanj, James R. Brown, Gail Rosen

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15838 2023-12-27 cs.CL cs.CR 88%

SecQA: A Concise Question-Answering Dataset for Evaluating Large Language Models in Computer Security

Zefang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12598 2023-12-25 cs.SE cs.AI 88%

A Case Study on Test Case Construction with Large Language Models: Unveiling Practical Insights and Challenges

Roberto Francisco de Lima Junior, Luiz Fernando Paes de Barros Presta, Lucca Santos Borborema, Vanderson Nogueira da Silva, Marcio Leal de Melo Dahia, Anderson Carlos Sousa e Santos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12853 2023-12-21 cs.CL 88%

CORECODE: A Common Sense Annotated Dialogue Dataset with Benchmark Tasks for Chinese Large Language Models

Dan Shi, Chaobin You, Jiantao Huang, Taihao Li, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01431 2023-12-21 cs.CL 88%

Benchmarking Large Language Models in Retrieval-Augmented Generation

Jiawei Chen, Hongyu Lin, Xianpei Han, Le Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11988 2023-12-20 cs.SE cs.AI cs.PL 88%

Xpert: Empowering Incident Management with Query Recommendations via Large Language Models

Yuxuan Jiang, Chaoyun Zhang, Shilin He, Zhihao Yang, Minghua Ma, Si Qin, Yu Kang, Yingnong Dang, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted as a reseach paper at ICSE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08056 2023-12-14 cs.CV cs.AI 88%

Knowledge-Aware Artifact Image Synthesis with LLM-Enhanced Prompting and Multi-Source Supervision

Shengguang Wu, Zhenglun Chen, Qi Su

专题命中 评测与基准 :LLM(title);prompting(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06351 2023-12-12 cs.CV cs.CL cs.RO 88%

Evaluation of Large Language Models for Decision Making in Autonomous Driving

Kotaro Tanahashi, Yuichi Inoue, Yu Yamaguchi, Hidetatsu Yaginuma, Daiki Shiotsuka, Hiroyuki Shimatani, Kohei Iwamasa, Yoshiaki Inoue, Takafumi Yamaguchi, Koki Igari, Tsukasa Horinouchi, Kento Tokuhiro, Yugo Tokuchi, Shunsuke Aoki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at the 2023 Symposium on Machine Learning for Autonomous Driving collocated with NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04687 2023-12-11 cs.SE cs.LG 88%

LLM4TDD: Best Practices for Test Driven Development Using Large Language Models

Sanyogita Piya, Allison Sullivan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01882 2023-12-05 cs.CV cs.AI 88%

Unleashing the Potential of Large Language Model: Zero-shot VQA for Flood Disaster Scenario

Yimin Sun, Chao Wang, Yan Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments accepted by The 4th International Conference on Artificial Intelligence and Computer Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16673 2023-11-29 cs.CV cs.AI 88%

Large Language Models Meet Computer Vision: A Brief Survey

Raby Hamadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14335 2023-11-28 cs.SD cs.AI cs.MM eess.AS 88%

WavJourney: Compositional Audio Creation with Large Language Models

Xubo Liu, Zhongkai Zhu, Haohe Liu, Yi Yuan, Meng Cui, Qiushi Huang, Jinhua Liang, Yin Cao, Qiuqiang Kong, Mark D. Plumbley, Wenwu Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments GitHub: AGI/WavJourney" target="_blank" rel="noopener">https://github.com/Audio-AGI/WavJourney

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13165 2023-11-23 cs.AI 88%

Multimodal Large Language Models: A Survey

Jiayang Wu, Wensheng Gan, Zefeng Chen, Shicheng Wan, Philip S. Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments IEEE BigData 2023. 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09829 2023-11-17 cs.CL 88%

FollowEval: A Multi-Dimensional Benchmark for Assessing the Instruction-Following Capability of Large Language Models

Yimin Jing, Renren Jin, Jiahao Hu, Huishi Qiu, Xiaohua Wang, Peng Wang, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏