arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2309.09400 2023-09-19 cs.CL cs.AI 90%

CulturaX: A Cleaned, Enormous, and Multilingual Dataset for Large Language Models in 167 Languages

Thuat Nguyen, Chien Van Nguyen, Viet Dac Lai, Hieu Man, Nghia Trung Ngo, Franck Dernoncourt, Ryan A. Rossi, Thien Huu Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06503 2023-09-14 cs.CL cs.LG cs.SI 90%

Leveraging Large Language Models and Weak Supervision for Social Media data annotation: an evaluation using COVID-19 self-reported vaccination tweets

Ramya Tekumalla, Juan M. Banda

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06384 2023-09-13 cs.CL cs.AI 90%

Towards Reliable and Fluent Large Language Models: Incorporating Feedback Learning Loops in QA Systems

Dongyub Lee, Taesun Whang, Chanhee Lee, Heuiseok Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 5 pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03079 2023-09-07 q-fin.ST cs.CL cs.LG 90%

GPT-InvestAR: Enhancing Stock Investment Strategies through Annual Report Analysis with Large Language Models

Udit Gupta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16474 2023-09-01 cs.CL cs.AI 90%

Enhancing Subtask Performance of Multi-modal Large Language Model

Yongqiang Zhao, Zhenyu Li, Feng Zhang, Xinhai Xu, Donghong Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12674 2023-08-25 cs.CL cs.AI 90%

Improving Translation Faithfulness of Large Language Models via Augmenting Instructions

Yijie Chen, Yijin Liu, Fandong Meng, Yufeng Chen, Jinan Xu, Jie Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments Our code and datasets are released in Github: https://github.com/pppa2019/swie_overmiss_llm4mt

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11462 2023-08-23 cs.CL cs.AI cs.CY 90%

LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models

Neel Guha, Julian Nyarko, Daniel E. Ho, Christopher Ré, Adam Chilton, Aditya Narayana, Alex Chohlas-Wood, Austin Peters, Brandon Waldon, Daniel N. Rockmore, Diego Zambrano, Dmitry Talisman, Enam Hoque, Faiz Surani, Frank Fagan, Galit Sarfaty, Gregory M. Dickinson, Haggai Porat, Jason Hegland, Jessica Wu, Joe Nudell, Joel Niklaus, John Nay, Jonathan H. Choi, Kevin Tobia, Margaret Hagan, Megan Ma, Michael Livermore, Nikon Rasumov-Rahe, Nils Holzenberger, Noam Kolt, Peter Henderson, Sean Rehaag, Sharad Goel, Shang Gao, Spencer Williams, Sunny Gandhi, Tom Zur, Varun Iyer, Zehua Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 143 pages, 79 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07902 2023-08-16 cs.CL cs.AI 90%

Through the Lens of Core Competency: Survey on Evaluation of Large Language Models

Ziyu Zhuang, Qiguang Chen, Longxuan Ma, Mingda Li, Yi Han, Yushan Qian, Haopeng Bai, Zixian Feng, Weinan Zhang, Ting Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07286 2023-08-15 cs.CL cs.LG 90%

The Devil is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation

Patrick Fernandes, Daniel Deutsch, Mara Finkelstein, Parker Riley, André F. T. Martins, Graham Neubig, Ankush Garg, Jonathan H. Clark, Markus Freitag, Orhan Firat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01414 2023-08-04 cs.CL cs.AI 90%

HouYi: An open-source large language model specially designed for renewable energy and carbon neutrality field

Mingliang Bai, Zhihao Zhou, Ruidong Wang, Yusheng Yang, Zizhen Qin, Yunxiao Chen, Chunjin Mu, Jinfu Liu, Daren Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15020 2023-07-28 cs.CL cs.AI 90%

SuperCLUE: A Comprehensive Chinese Large Language Model Benchmark

Liang Xu, Anqi Li, Lei Zhu, Hang Xue, Changtai Zhu, Kangkang Zhao, Haonan He, Xuanwei Zhang, Qiyue Kang, Zhenzhong Lan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10188 2023-07-21 cs.CL cs.LG 90%

Several categories of Large Language Models (LLMs): A Short Survey

Saurabh Pahune, Manoj Chandrasekharan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15066 2023-07-12 cs.AI cs.CL 90%

GPT4Graph: Can Large Language Models Understand Graph Structured Data ? An Empirical Evaluation and Benchmarking

Jiayan Guo, Lun Du, Hengyu Liu, Mengyu Zhou, Xinyi He, Shi Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04738 2023-07-11 cs.RO cs.AI cs.LG 90%

RoCo: Dialectic Multi-Robot Collaboration with Large Language Models

Zhao Mandi, Shreeya Jain, Shuran Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03385 2023-07-10 cs.CL cs.CY cs.LG 90%

AI-UPV at EXIST 2023 -- Sexism Characterization Using Large Language Models Under The Learning with Disagreements Regime

Angel Felipe Magnossão de Paula, Giulia Rizzi, Elisabetta Fersini, Damiano Spina

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 15 pages, 9 tables, 1 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13651 2023-06-30 cs.CL cs.LG 90%

Bring Your Own Data! Self-Supervised Evaluation for Large Language Models

Neel Jain, Khalid Saifullah, Yuxin Wen, John Kirchenbauer, Manli Shu, Aniruddha Saha, Micah Goldblum, Jonas Geiping, Tom Goldstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Code is available at https://github.com/neelsjain/BYOD. First two authors contributed equally. 21 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04757 2023-06-16 cs.CL cs.AI 90%

INSTRUCTEVAL: Towards Holistic Evaluation of Instruction-Tuned Large Language Models

Yew Ken Chia, Pengfei Hong, Lidong Bing, Soujanya Poria

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Github: https://github.com/declare-lab/instruct-eval Leaderboard: https://declare-lab.github.io/instruct-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03503 2023-06-13 cs.CY cs.AI cs.CL 90%

Applying Standards to Advance Upstream & Downstream Ethics in Large Language Models

Jose Berengueres, Marybeth Sandell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05817 2023-06-02 cs.AI cs.CL cs.NE 90%

Level Generation Through Large Language Models

Graham Todd, Sam Earle, Muhammad Umair Nasir, Michael Cerny Green, Julian Togelius

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Journal ref FDG 2023: Proceedings of the 18th International Conference on the Foundations of Digital Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12024 2023-06-01 cs.CL cs.AI 90%

cTBLS: Augmenting Large Language Models with Conversational Tables

Anirudh S Sundar, Larry Heck

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15458 2023-05-10 cs.LG cs.CL 90%

Validating Large Language Models with ReLM

Michael Kuchnik, Virginia Smith, George Amvrosiadis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05613 2023-04-13 cs.CL cs.AI 90%

ChatGPT Beyond English: Towards a Comprehensive Evaluation of Large Language Models in Multilingual Learning

Viet Dac Lai, Nghia Trung Ngo, Amir Pouran Ben Veyseh, Hieu Man, Franck Dernoncourt, Trung Bui, Thien Huu Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03269 2023-02-20 cs.CL cs.AI cs.IR 90%

PLACES: Prompting Language Models for Social Conversation Synthesis

Maximillian Chen, Alexandros Papangelis, Chenyang Tao, Seokhwan Kim, Andy Rosenbaum, Yang Liu, Zhou Yu, Dilek Hakkani-Tur

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments In Findings of EACL 2023. 25 pages, 4 figures, 26 tables. Code available at https://github.com/alexa/PLACES

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02318 2022-05-06 cs.LG cs.CL 90%

Language Models in the Loop: Incorporating Prompting into Weak Supervision

Ryan Smith, Jason A. Fries, Braden Hancock, Stephen H. Bach

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20722 2026-07-24 cs.CL 新提交 90%

REGARD: Regional Affective Differences in Large Language Models

REGARD:大语言模型中的区域情感差异

Andrei Chetvergov, Alexander Evseev, Mikhail Solovev, Timofei Sivoraksha, Stepan Ukolov, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

机构 * Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Russian Presidential Academy of National Economy and Public Administration(俄罗斯总统国民经济与公共管理学院)

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究跨大语言模型对后苏联实体情感框架差异,用目标导向的效价-唤醒-优势剖析,向19个模型询问500个特定区域目标并评分验证,聚类得出行为聚类,发现效价-唤醒-优势剖析能捕捉情感强度,补充传统情感评估。

Comments 17 pages, 11 figures, 3 tables. Includes evaluation of 19 language models, two independent VAD judges, and human validation on 300 items

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13339 2025-07-08 cs.CL eess.AS 90%

NTU Speechlab LLM-Based Multilingual ASR System for Interspeech MLC-SLM Challenge 2025

Yizhou Peng, Bin Wang, Yi-Wen Chao, Ziyang Ma, Haoyang Zhang, Hexin Liu, Xie Chen, Eng Siong Chng

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) MiroMind, Singapore(MiroMind公司) Shanghai Jiao Tong University, China(上海交通大学) Peking University, China(北京大学)

专题命中 评测与基准 :SLM(title,abstract);LLM(title);large language model(abstract);language model(abstract)

Comments Accepted by Interspeech 2025 MLC-SLM challenge (5th place). System report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14748 2025-06-05 cs.CL 90%

Large Language Models Struggle to Describe the Haystack without Human Help: Human-in-the-loop Evaluation of Topic Models

Zongxia Li, Lorena Calvo-Bartolomé, Alexander Hoyle, Paiheng Xu, Alden Dima, Juan Francisco Fung, Jordan Boyd-Graber

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments 22 Pages. LLM for Data Exploration and content analysis, Topic Models. 63rd Annual Meeting of the Association for Computational Linguistics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21514 2025-05-29 cs.LG cs.PL cs.SE 90%

SIMCOPILOT: Evaluating Large Language Models for Copilot-Style Code Generation

Mingchao Jiang, Abhinav Jain, Sophia Zorek, Chris Jermaine

机构 * Department of Computer Science(计算机科学系) Department of Statistics(统计学系) Rice University(里士满大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.LG

Comments Keywords: Benchmark Dataset, LLM Evaluation, Gen-AI, Program Synthesis; TLDR: SimCoPilot is a benchmark for evaluating LLMs as "copilot"-style interactive coding assistants, testing their ability to integrate and complete code within complex real-world software environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11193 2025-02-18 cs.CL 90%

Large Language Models Penetration in Scholarly Writing and Peer Review

Li Zhou, Ruijie Zhang, Xunlian Dai, Daniel Hershcovich, Haizhou Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL

Comments Transparency in NLP, LLM-generated text evaluation and detection, LLM Penetration, Scholarly Credibility and Accountability

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03536 2024-12-16 cs.CL 90%

Social Bias in Large Language Models For Bangla: An Empirical Study on Gender and Religious Bias

Jayanta Sadhu, Maneesha Rani Saha, Rifat Shahriyar

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at The First Workshop on Language Models for Low-Resource Languages (LoResLM) at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏