arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2404.16563 2024-10-10 cs.CL 88%

Evaluating Large Language Models on Time Series Feature Understanding: A Comprehensive Taxonomy and Benchmark

Elizabeth Fons, Rachneet Kaur, Soham Palande, Zhen Zeng, Tucker Balch, Manuela Veloso, Svitlana Vyetrenko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12726 2024-10-10 cs.CL 88%

Evaluating Character Understanding of Large Language Models via Character Profiling from Fictional Works

Xinfeng Yuan, Siyu Yuan, Yuhan Cui, Tianhe Lin, Xintao Wang, Rui Xu, Jiangjie Chen, Deqing Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05099 2024-10-08 cs.CL 88%

Investigating large language models for their competence in extracting grammatically sound sentences from transcribed noisy utterances

Alina Wróblewska

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at CoNLL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03905 2024-10-08 cs.CL 88%

PersonalSum: A User-Subjective Guided Personalized Summarization Dataset for Large Language Models

Lemei Zhang, Peng Liu, Marcus Tiedemann Oekland Henriksboe, Even W. Lauvrak, Jon Atle Gulla, Heri Ramampiaro

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at NeurIPS 2024 Track on Datasets and Benchmarks. Code available at https://github.com/SmartmediaAI/PersonalSum

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02499 2024-10-04 cs.CL 88%

Defining Knowledge: Bridging Epistemology and Large Language Models

Constanza Fierro, Ruchira Dhar, Filippos Stamatiou, Nicolas Garneau, Anders Søgaard

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01769 2024-10-04 cs.CL 88%

Quantifying Generalization Complexity for Large Language Models

Zhenting Qi, Hongyin Luo, Xuliang Huang, Zhuokai Zhao, Yibo Jiang, Xiangjun Fan, Himabindu Lakkaraju, James Glass

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04459 2024-10-04 cs.CL 88%

Generalists vs. Specialists: Evaluating Large Language Models for Urdu

Samee Arif, Abdul Hameed Azeemi, Agha Ali Raza, Awais Athar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11096 2024-10-04 cs.CL 88%

The Potential and Challenges of Evaluating Attitudes, Opinions, and Values in Large Language Models

Bolei Ma, Xinpeng Wang, Tiancheng Hu, Anna-Carolina Haensch, Michael A. Hedderich, Barbara Plank, Frauke Kreuter

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03741 2024-10-04 cs.SE cs.CL 88%

Enhanced Automated Code Vulnerability Repair using Large Language Models

David de-Fitero-Dominguez, Eva Garcia-Lopez, Antonio Garcia-Cabot, Jose-Javier Martinez-Herraiz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Engineering Applications of Artificial Intelligence. Volume 138, Part A, December 2024, 109291

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14646 2024-10-03 cs.CL 88%

Unveiling the Achilles' Heel of NLG Evaluators: A Unified Adversarial Framework Driven by Large Language Models

Yiming Chen, Chen Zhang, Danqing Luo, Luis Fernando D'Haro, Robby T. Tan, Haizhou Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ACL24 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10833 2024-10-01 cs.CL 88%

A Comprehensive Survey of Scientific Large Language Models and Their Applications in Scientific Discovery

Yu Zhang, Xiusi Chen, Bowen Jin, Sheng Wang, Shuiwang Ji, Wei Wang, Jiawei Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 35 pages; Accepted to EMNLP 2024 (Project Page: https://github.com/yuzhimanhua/Awesome-Scientific-Language-Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07736 2024-10-01 cs.CL 88%

MultiPragEval: Multilingual Pragmatic Evaluation of Large Language Models

Dojun Park, Jiwoo Lee, Seohyun Park, Hyeyun Jeong, Youngeun Koo, Soonha Hwang, Seonwoo Park, Sungeun Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments The 2nd GenBench workshop on generalisation (benchmarking) in NLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05561 2024-10-01 cs.CL 88%

TrustLLM: Trustworthiness in Large Language Models

Yue Huang, Lichao Sun, Haoran Wang, Siyuan Wu, Qihui Zhang, Yuan Li, Chujie Gao, Yixin Huang, Wenhan Lyu, Yixuan Zhang, Xiner Li, Zhengliang Liu, Yixin Liu, Yijue Wang, Zhikun Zhang, Bertie Vidgen, Bhavya Kailkhura, Caiming Xiong, Chaowei Xiao, Chunyuan Li, Eric Xing, Furong Huang, Hao Liu, Heng Ji, Hongyi Wang, Huan Zhang, Huaxiu Yao, Manolis Kellis, Marinka Zitnik, Meng Jiang, Mohit Bansal, James Zou, Jian Pei, Jian Liu, Jianfeng Gao, Jiawei Han, Jieyu Zhao, Jiliang Tang, Jindong Wang, Joaquin Vanschoren, John Mitchell, Kai Shu, Kaidi Xu, Kai-Wei Chang, Lifang He, Lifu Huang, Michael Backes, Neil Zhenqiang Gong, Philip S. Yu, Pin-Yu Chen, Quanquan Gu, Ran Xu, Rex Ying, Shuiwang Ji, Suman Jana, Tianlong Chen, Tianming Liu, Tianyi Zhou, William Wang, Xiang Li, Xiangliang Zhang, Xiao Wang, Xing Xie, Xun Chen, Xuyu Wang, Yan Liu, Yanfang Ye, Yinzhi Cao, Yong Chen, Yue Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments This work is still under work and we welcome your contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10383 2024-10-01 cs.CL cs.CR 88%

Privacy in Large Language Models: Attacks, Defenses and Future Directions

Haoran Li, Yulin Chen, Jinglong Luo, Jiecong Wang, Hao Peng, Yan Kang, Xiaojin Zhang, Qi Hu, Chunkit Chan, Zenglin Xu, Bryan Hooi, Yangqiu Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments We upload the survey to cover more recent papers and inlcude privacy resaearch on multi-modality

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16202 2024-09-26 cs.AI 88%

CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data

Qian-Wen Zhang, Haochen Wang, Fang Li, Siyu An, Lingfeng Qiao, Liangcai Gao, Di Yin, Xing Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15154 2024-09-24 cs.SE cs.AI 88%

RMCBench: Benchmarking Large Language Models' Resistance to Malicious Code

Jiachi Chen, Qingyuan Zhong, Yanlin Wang, Kaiwen Ning, Yongkun Liu, Zenan Xu, Zhe Zhao, Ting Chen, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 12 pages, 6 figures, 5 tables, 39th IEEE/ACM International Conference on Automated Software Engineering (ASE '24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09886 2024-09-24 eess.AS cs.CL cs.SD 88%

Speech-Copilot: Leveraging Large Language Models for Speech Processing via Task Decomposition, Modularization, and Program Generation

Chun-Yi Kuan, Chih-Kai Yang, Wei-Ping Huang, Ke-Han Lu, Hung-yi Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to SLT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14368 2024-09-24 cs.SE cs.AI cs.HC 88%

Evaluating the Quality of Code Comments Generated by Large Language Models for Novice Programmers

Aysa Xuemo Fan, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Jiaze Ke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14050 2024-09-24 cs.AI 88%

The use of GPT-4o and Other Large Language Models for the Improvement and Design of Self-Assessment Scales for Measurement of Interpersonal Communication Skills

Goran Bubaš

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08966 2024-09-24 cs.AI 88%

Graph Learning and Its Advancements on Large Language Models: A Holistic Survey

Shaopeng Wei, Jun Wang, Yu Zhao, Xingyan Chen, Qing Li, Fuzhen Zhuang, Ji Liu, Fuji Ren, Gang Kou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 23 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13317 2024-09-23 cs.CL 88%

JMedBench: A Benchmark for Evaluating Japanese Biomedical Large Language Models

Junfeng Jiang, Jiahao Huang, Akiko Aizawa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11783 2024-09-23 cs.CL 88%

Development and bilingual evaluation of Japanese medical large language model within reasonably low computational resources

Issey Sukeda

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 18 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06088 2024-09-20 cs.AI 88%

Assessing Student Errors in Experimentation Using Artificial Intelligence and Large Language Models: A Comparative Study with Human Raters

Arne Bewersdorff, Kathrin Seßler, Armin Baur, Enkelejda Kasneci, Claudia Nerdel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11491 2024-09-19 cs.CL 88%

Enriching Datasets with Demographics through Large Language Models: What's in a Name?

Khaled AlNuaimi, Gautier Marti, Mathieu Ravaut, Abdulla AlKetbi, Andreas Henschel, Raed Jaradat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 8 pages, 7 Tables, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14507 2024-09-19 cs.CL 88%

Internal Consistency and Self-Feedback in Large Language Models: A Survey

Xun Liang, Shichao Song, Zifan Zheng, Hanyu Wang, Qingchen Yu, Xunkai Li, Rong-Hua Li, Yi Wang, Zhonghao Wang, Feiyu Xiong, Zhiyu Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 20 pages, 10 figures, 6 tables, 13 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10550 2024-09-18 cs.CY cs.CL 88%

Agentic Society: Merging skeleton from real world and texture from Large Language Model

Yuqi Bai, Kun Sun, Huishi Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 16 pages, 5 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09052 2024-09-17 eess.IV cs.AI cs.CV 88%

OrthoDoc: Multimodal Large Language Model for Assisting Diagnosis in Computed Tomography

Youzhu Jin, Yichen Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10453 2024-09-17 cs.CL 88%

Steering Conversational Large Language Models for Long Emotional Support Conversations

Navid Madani, Sougata Saha, Rohini Srihari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10718 2024-09-16 cs.SE cs.CL 88%

CodeJudge-Eval: Can Large Language Models be Good Judges in Code Understanding?

Yuwei Zhao, Ziyang Luo, Yuchen Tian, Hongzhan Lin, Weixiang Yan, Annan Li, Jing Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14450 2024-09-12 cs.CL 88%

An Empirical Study on Information Extraction using Large Language Models

Ridong Han, Chaohao Yang, Tao Peng, Prayag Tiwari, Xiang Wan, Lu Liu, Benyou Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 52 pages, Version 2.0; This article has an original arxiv version entitled "Is Information Extraction Solved by ChatGPT? An Analysis of Performance, Evaluation Criteria, Robustness and Errors'', whose url link is arXiv:2305.14450v1

详情

展开后加载摘要…

URL PDF HTML 收藏