arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2408.15895 2024-08-29 cs.CL cs.LG 88%

Bias in LLMs as Annotators: The Effect of Party Cues on Labelling Decision by Large Language Models

Sebastian Vallejo Vera, Hunter Driggers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15769 2024-08-29 cs.CV cs.AI cs.CL 88%

A Survey on Evaluation of Multimodal Large Language Models

Jiaxing Huang, Jingyi Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07917 2024-08-26 cs.AI cs.CL 88%

DesignQA: A Multimodal Benchmark for Evaluating Large Language Models' Understanding of Engineering Documentation

Anna C. Doris, Daniele Grandi, Ryan Tomich, Md Ferdous Alam, Mohammadmehdi Ataei, Hyunmin Cheong, Faez Ahmed

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08924 2024-08-23 cs.CR cs.AI cs.CL 88%

Prefix Guidance: A Steering Wheel for Large Language Models to Defend Against Jailbreak Attacks

Jiawei Zhao, Kejiang Chen, Xiaojian Yuan, Weiming Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05961 2024-08-23 cs.CL cs.AI 88%

LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders

Parishad BehnamGhader, Vaibhav Adlakha, Marius Mosbach, Dzmitry Bahdanau, Nicolas Chapados, Siva Reddy

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08930 2024-08-20 cs.CR cs.AI cs.CL 88%

DePrompt: Desensitization and Evaluation of Personal Identifiable Information in Large Language Model Prompts

Xiongtao Sun, Gan Liu, Zhipeng He, Hui Li, Xiaoguang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18208 2024-08-20 cs.CL cs.LG 88%

ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models

Benjamin Feuer, Yurong Liu, Chinmay Hegde, Juliana Freire

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments VLDB 2024

Journal ref Proceedings of the VLDB Endowment, Volume 17, Issue 9, Pages 2279 - 2292, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05948 2024-08-13 cs.CL cs.IR cs.LG 88%

ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA datasets with Large Language Models

Ronak Pradeep, Daniel Lee, Ali Mousavi, Jeff Pound, Yisi Sang, Jimmy Lin, Ihab Ilyas, Saloni Potdar, Mostafa Arefiyan, Yunyao Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05328 2024-08-13 cs.CL cs.AI cs.ET cs.HC econ.GN q-fin.EC 88%

From Text to Insight: Leveraging Large Language Models for Performance Evaluation in Management

Ning Li, Huaikang Zhou, Mingze Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 39 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04643 2024-08-12 cs.CL cs.LG 88%

Risks, Causes, and Mitigations of Widespread Deployments of Large Language Models (LLMs): A Survey

Md Nazmus Sakib, Md Athikul Islam, Royal Pathak, Md Mashrur Arifin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to 2nd International Conference on Artificial Intelligence, Blockchain, and Internet of Things (AIBThings-2024), September 07-08, 2024, Michigan, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04568 2024-08-09 cs.CL cs.AI 88%

Learning Fine-Grained Grounded Citations for Attributed Large Language Models

Lei Huang, Xiaocheng Feng, Weitao Ma, Yuxuan Gu, Weihong Zhong, Xiachong Feng, Weijiang Yu, Weihua Peng, Duyu Tang, Dandan Tu, Bing Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02201 2024-08-06 cs.LG cs.CL 88%

Evaluating the Performance of Large Language Models for SDG Mapping (Technical Report)

Hui Yin, Amir Aryani, Nakul Nambiar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08831 2024-08-06 cs.CL cs.AI cs.IR 88%

eCeLLM: Generalizing Large Language Models for E-commerce from Large-scale, High-quality Instruction Data

Bo Peng, Xinyi Ling, Ziru Chen, Huan Sun, Xia Ning

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ICML 2024; Bo Peng and Xinyi Ling contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13028 2024-08-06 cs.CL cs.AI 88%

Reliable Academic Conference Question Answering: A Study Based on Large Language Model

Zhiwei Huang, Juan Li, Long Jin, Junjie Wang, Mingchen Tu, Yin Hua, Zhiqiang Liu, Jiawei Meng, Wen Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00994 2024-08-05 cs.SE cs.AI cs.CL 88%

ArchCode: Incorporating Software Requirements in Code Generation with Large Language Models

Hojae Han, Jaejin Kim, Jaeseok Yoo, Youngwon Lee, Seung-won Hwang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21072 2024-08-01 cs.AI cs.CL 88%

Beyond Metrics: A Critical Analysis of the Variability in Large Language Model Evaluation Frameworks

Marco AF Pimentel, Clément Christophe, Tathagata Raha, Prateek Munjal, Praveen K Kanithi, Shadab Khan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19594 2024-07-31 cs.CL cs.AI 88%

Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Tianhao Wu, Weizhe Yuan, Olga Golovneva, Jing Xu, Yuandong Tian, Jiantao Jiao, Jason Weston, Sainbayar Sukhbaatar

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12068 2024-07-30 cs.LG cs.AI 88%

Learning on Graphs with Large Language Models(LLMs): A Deep Dive into Model Robustness

Kai Guo, Zewen Liu, Zhikai Chen, Hongzhi Wen, Wei Jin, Jiliang Tang, Yi Chang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01686 2024-07-26 cs.CL cs.AI 88%

Automatically Extracting Numerical Results from Randomized Controlled Trials with Large Language Models

Hye Sun Yun, David Pogrebitskiy, Iain J. Marshall, Byron C. Wallace

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 25 pages, 7 figures, 6 tables, MLHC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13463 2024-07-25 cs.CL cs.AI 88%

RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models

Jianhao Yan, Yun Luo, Yue Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2024 final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13105 2024-07-19 cs.CY cs.AI cs.LG 88%

Survey on Plagiarism Detection in Large Language Models: The Impact of ChatGPT and Gemini on Academic Integrity

Shushanta Pudasaini, Luis Miralles-Pechuán, David Lillis, Marisa Llorens Salvador

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03814 2024-07-19 cs.CL cs.AI 88%

Evaluating the Elementary Multilingual Capabilities of Large Language Models with MultiQ

Carolin Holtermann, Paul Röttger, Timm Dill, Anne Lauscher

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12823 2024-07-19 cs.CL cs.AI 88%

WTU-EVAL: A Whether-or-Not Tool Usage Evaluation Benchmark for Large Language Models

Kangyun Ning, Yisong Su, Xueqiang Lv, Yuanzhe Zhang, Jian Liu, Kang Liu, Jinan Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12071 2024-07-18 cs.CL cs.AI 88%

EmoBench: Evaluating the Emotional Intelligence of Large Language Models

Sahand Sabour, Siyang Liu, Zheyuan Zhang, June M. Liu, Jinfeng Zhou, Alvionna S. Sunaryo, Juanzi Li, Tatia M. C. Lee, Rada Mihalcea, Minlie Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10996 2024-07-17 cs.CL cs.AI cs.HC 88%

Visualization Literacy of Multimodal Large Language Models: A Comparative Study

Zhimin Li, Haichao Miao, Valerio Pascucci, Shusen Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08978 2024-07-15 cs.CL cs.LG 88%

Towards Chapter-to-Chapter Context-Aware Literary Translation via Large Language Models

Linghao Jin, Li An, Xuezhe Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13261 2024-07-10 cs.CL cs.AI 88%

BeHonest: Benchmarking Honesty in Large Language Models

Steffi Chern, Zhulin Hu, Yuqing Yang, Ethan Chern, Yuan Guo, Jiahe Jin, Binjie Wang, Pengfei Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21028 2024-07-04 cs.CL cs.AI 88%

LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models

Elias Stengel-Eskin, Peter Hase, Mohit Bansal

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);preference optimization(abstract)

Comments 18 pages. Code: https://github.com/esteng/pragmatic_calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12390 2024-07-04 cs.CV cs.AI cs.CL 88%

BLINK: Multimodal Large Language Models Can See but Not Perceive

Xingyu Fu, Yushi Hu, Bangzheng Li, Yu Feng, Haoyu Wang, Xudong Lin, Dan Roth, Noah A. Smith, Wei-Chiu Ma, Ranjay Krishna

专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI

Comments Multimodal Benchmark, Project Url: https://zeyofu.github.io/blink/, ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01885 2024-07-03 cs.CL cs.AI 88%

Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application

Chuanpeng Yang, Wang Lu, Yao Zhu, Yidong Wang, Qian Chen, Chenlong Gao, Bingjie Yan, Yiqiang Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏