arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2408.01963 2024-11-05 cs.CL stat.AP 88%

A Novel Metric for Measuring the Robustness of Large Language Models in Non-adversarial Scenarios

Samuel Ackerman, Ella Rabinovich, Eitan Farchi, Ateret Anaby-Tavor

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Published in the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP) findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01353 2024-11-05 cs.LG 88%

Can Large Language Model Predict Employee Attrition?

Xiaoye Ma, Weiheng Liu, Changyi Zhao, Liliya R. Tukhvatulina

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01318 2024-11-04 cs.CR cs.LG 88%

JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Patrick Chao, Edoardo Debenedetti, Alexander Robey, Maksym Andriushchenko, Francesco Croce, Vikash Sehwag, Edgar Dobriban, Nicolas Flammarion, George J. Pappas, Florian Tramer, Hamed Hassani, Eric Wong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments The camera-ready version of JailbreakBench v1.0 (accepted at NeurIPS 2024 Datasets and Benchmarks Track): more attack artifacts, more test-time defenses, a more accurate jailbreak judge (Llama-3-70B with a custom prompt), a larger dataset of human preferences for selecting a jailbreak judge (300 examples), an over-refusal evaluation dataset, a semantic refusal judge based on Llama-3-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24005 2024-11-01 cs.LG 88%

Context-Aware Testing: A New Paradigm for Model Testing with Large Language Models

Paulius Rauba, Nabeel Seedat, Max Ruiz Luyten, Mihaela van der Schaar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments Presented at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024). *Rauba & Seedat contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22832 2024-10-31 cs.CR cs.AI cs.IR 88%

HijackRAG: Hijacking Attacks against Retrieval-Augmented Large Language Models

Yucheng Zhang, Qinfeng Li, Tianyu Du, Xuhong Zhang, Xinkui Zhao, Zhengwen Feng, Jianwei Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12673 2024-10-30 cs.CL 88%

Estimating Knowledge in Large Language Models Without Generating a Single Token

Daniela Gottesman, Mor Geva

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21067 2024-10-29 cs.CL 88%

CRAT: A Multi-Agent Framework for Causality-Enhanced Reflective and Retrieval-Augmented Translation with Large Language Models

Meiqi Chen, Fandong Meng, Yingxue Zhang, Yan Zhang, Jie Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20814 2024-10-29 cs.CL 88%

NewTerm: Benchmarking Real-Time New Terms for Large Language Models with Annual Updates

Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Min Zhang, Zhaopeng Tu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08690 2024-10-25 cs.CL 88%

A Survey on Open Information Extraction from Rule-based Model to Large Language Model

Pai Liu, Wenyang Gao, Wenjie Dong, Lin Ai, Ziwei Gong, Songfang Huang, Zongsheng Li, Ehsan Hoque, Julia Hirschberg, Yue Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments The first five authors contributed to this work equally. Names are ordered randomly

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12376 2024-10-24 cs.AI 88%

ShapefileGPT: A Multi-Agent Large Language Model Framework for Automated Shapefile Processing

Qingming Lin, Rui Hu, Huaxia Li, Sensen Wu, Yadong Li, Kai Fang, Hailin Feng, Zhenhong Du, Liuchang Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05876 2024-10-24 cs.CL 88%

Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications

Zhangyin Feng, Weitao Ma, Weijiang Yu, Lei Huang, Haotian Wang, Qianglong Chen, Weihua Peng, Xiaocheng Feng, Bing Qin, Ting liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Work in progress; 22 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16983 2024-10-23 cs.AI 88%

Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models

Zhijie Tan, Xu Chu, Weiping Li, Tong Mo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10943 2024-10-23 cs.CL 88%

SysBench: Can Large Language Models Follow System Messages?

Yanzhao Qin, Tao Zhang, Tao Zhang, Yanjun Shen, Wenjing Luo, Haoze Sun, Yan Zhang, Yujing Qiao, Weipeng Chen, Zenan Zhou, Wentao Zhang, Bin Cui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05072 2024-10-22 cs.CL 88%

Aligning Translation-Specific Understanding to General Understanding in Large Language Models

Yichong Huang, Baohang Li, Xiaocheng Feng, Chengpeng Fu, Wenshuai Huo, Ting Liu, Bing Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16044 2024-10-22 cs.CL 88%

Large Language Models Know What To Say But Not When To Speak

Muhammad Umair, Vasanth Sarathy, JP de Ruiter

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15161 2024-10-22 cs.HC cs.CL 88%

Evaluation Of P300 Speller Performance Using Large Language Models Along With Cross-Subject Training

Nithin Parthasarathy, James Soetedjo, Saarang Panchavati, Nitya Parthasarathy, Corey Arnold, Nader Pouratian, William Speier

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 21 pages, 11 figures, 1 table. arXiv admin note: substantial text overlap with arXiv:2405.13329

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12377 2024-10-22 cs.CL cs.CY 88%

HerO at AVeriTeC: The Herd of Open Large Language Models for Verifying Real-World Claims

Yejun Yoon, Jaeyoon Jung, Seunghyun Yoon, Kunwoo Park

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments A system description paper for the AVeriTeC shared task, hosted by the seventh FEVER workshop (co-located with EMNLP 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14165 2024-10-21 cs.CL 88%

Automated Genre-Aware Article Scoring and Feedback Using Large Language Models

Chihang Wang, Yuxin Dong, Zhenhong Zhang, Ruotong Wang, Shuo Wang, Jiajing Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14145 2024-10-21 cs.CL 88%

CAPE: A Chinese Dataset for Appraisal-based Emotional Generation using Large Language Models

June M. Liu, He Cao, Renliang Sun, Rui Wang, Yu Li, Jiaxing Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08806 2024-10-21 cs.AI 88%

Combining Insights From Multiple Large Language Models Improves Diagnostic Accuracy

Gioele Barabucci, Victor Shia, Eugene Chu, Benjamin Harack, Nathan Fu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 5 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12896 2024-10-18 cs.CL 88%

A Survey on Data Synthesis and Augmentation for Large Language Models

Ke Wang, Jiahui Zhu, Minjie Ren, Zeming Liu, Shiwei Li, Zongye Zhang, Chenkai Zhang, Xiaoyu Wu, Qiqi Zhan, Qingjie Liu, Yunhong Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12029 2024-10-17 cs.CL cs.CY 88%

On Classification with Large Language Models in Cultural Analytics

David Bamman, Kent K. Chang, Li Lucy, Naitian Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref CHR 2024: Computational Humanities Research Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03514 2024-10-17 cs.CL 88%

CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models

Zexuan Qiu, Jingjing Li, Shijue Huang, Xiaoqi Jiao, Wanjun Zhong, Irwin King

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11710 2024-10-16 cs.CL 88%

MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models

Pei Wang, Yanan Wu, Zekun Wang, Jiaheng Liu, Xiaoshuai Song, Zhongyuan Peng, Ken Deng, Chenchen Zhang, Jiakai Wang, Junran Peng, Ge Zhang, Hangyu Guo, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08414 2024-10-16 cs.CL 88%

Understanding the Interplay between Parametric and Contextual Knowledge for Large Language Models

Sitao Cheng, Liangming Pan, Xunjian Yin, Xinyi Wang, William Yang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 27 pages, 8 figures and 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09330 2024-10-16 cs.CL 88%

Fostering Natural Conversation in Large Language Models with NICO: a Natural Interactive COnversation dataset

Renliang Sun, Mengyuan Liu, Shiping Yang, Rui Wang, Junqing He, Jiaxing Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 16 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00935 2024-10-16 cs.CL 88%

Resolving Knowledge Conflicts in Large Language Models

Yike Wang, Shangbin Feng, Heng Wang, Weijia Shi, Vidhisha Balachandran, Tianxing He, Yulia Tsvetkov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Published at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09628 2024-10-15 cs.CL 88%

Enhanced Electronic Health Records Text Summarization Using Large Language Models

Ruvarashe Madzime, Clement Nyirenda

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03648 2024-10-15 cs.CL 88%

AutoWebGLM: A Large Language Model-based Web Navigating Agent

Hanyu Lai, Xiao Liu, Iat Long Iong, Shuntian Yao, Yuxuan Chen, Pengbo Shen, Hao Yu, Hanchen Zhang, Xiaohan Zhang, Yuxiao Dong, Jie Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06121 2024-10-14 cs.CL 88%

Multilingual and Multi-topical Benchmark of Fine-tuned Language models and Large Language Models for Check-Worthy Claim Detection

Martin Hyben, Sebastian Kula, Ivan Srba, Robert Moro, Jakub Simko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 21 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏