arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2404.05993 2024-09-12 cs.LG cs.CL cs.CY 86%

AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts

Shaona Ghosh, Prasoon Varshney, Erick Galinkin, Christopher Parisien

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15221 2024-09-05 cs.LG cs.CL cs.CR cs.CY 86%

LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet

Nathaniel Li, Ziwen Han, Ian Steneker, Willow Primack, Riley Goodside, Hugh Zhang, Zifan Wang, Cristina Menghini, Summer Yue

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17116 2024-08-27 cs.CL cs.AI 86%

Improving accuracy of GPT-3/4 results on biomedical data using a retrieval-augmented language model

David Soong, Sriram Sridhar, Han Si, Jan-Samuel Wagner, Ana Caroline Costa Sá, Christina Y Yu, Kubra Karagoz, Meijian Guan, Hisham Hamadeh, Brandon W Higgs

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Journal ref PLOS Digit Health, 3(8) , 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05746 2024-08-27 cs.CL cs.AI 86%

Put Your Money Where Your Mouth Is: Evaluating Strategic Planning and Execution of LLM Agents in an Auction Arena

Jiangjie Chen, Siyu Yuan, Rong Ye, Bodhisattwa Prasad Majumder, Kyle Richardson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Project page: https://auction-arena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12076 2024-08-23 cs.CL cs.AI 86%

ConflictBank: A Benchmark for Evaluating the Influence of Knowledge Conflicts in LLM

Zhaochen Su, Jun Zhang, Xiaoye Qu, Tong Zhu, Yanshu Li, Jiashuo Sun, Juntao Li, Min Zhang, Yu Cheng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08808 2024-08-21 cs.LG cs.AI 86%

Constructing Domain-Specific Evaluation Sets for LLM-as-a-judge

Ravi Raju, Swayambhoo Jain, Bo Li, Jonathan Li, Urmish Thakker

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07904 2024-08-16 cs.CL cs.AI 86%

Assessing Language Models' Worldview for Fiction Generation

Aisha Khatun, Daniel G. Brown

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03745 2024-08-13 cs.HC cs.AI cs.CL 86%

Fakes of Varying Shades: How Warning Affects Human Perception and Engagement Regarding LLM Hallucinations

Mahjabin Nahar, Haeseung Seo, Eun-Ju Lee, Aiping Xiong, Dongwon Lee

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20501 2024-08-01 cs.IR cs.AI cs.CL 86%

Neural Retrievers are Biased Towards LLM-Generated Content

Sunhao Dai, Yuqi Zhou, Liang Pang, Weihao Liu, Xiaolin Hu, Yong Liu, Xiao Zhang, Gang Wang, Jun Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments KDD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15050 2024-07-23 cs.LG cs.AI cs.CR cs.MM 86%

Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts

Yi Liu, Chengjun Cai, Xiaoli Zhang, Xingliang Yuan, Cong Wang

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

Comments To be published in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13943 2024-07-22 cs.CL cs.AI 86%

Werewolf Arena: A Case Study in LLM Evaluation via Social Deduction

Suma Bailis, Jane Friedhoff, Feiyang Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10725 2024-07-16 cs.CL cs.AI 86%

CLAVE: An Adaptive Framework for Evaluating Values of LLM Generated Responses

Jing Yao, Xiaoyuan Yi, Xing Xie

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17396 2024-07-12 cs.CL cs.AI cs.NE 86%

Benchmarking GPT-4 on Algorithmic Problems: A Systematic Evaluation of Prompting Strategies

Flavio Petruzzellis, Alberto Testolin, Alessandro Sperduti

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at LREC-COLING 2024. Added acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10516 2024-07-10 cs.CL cs.AI 86%

Language Models can Evaluate Themselves via Probability Discrepancy

Tingyu Xia, Bowen Yu, Yuan Wu, Yi Chang, Chang Zhou

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05015 2024-07-09 cs.CL cs.AI 86%

How do you know that? Teaching Generative Language Models to Reference Answers to Biomedical Questions

Bojana Bašaragin, Adela Ljajić, Darija Medvecki, Lorenzo Cassano, Miloš Košprdić, Nikola Milošević

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at BioNLP Workshop 2024, colocated with ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01910 2024-07-04 cs.LG cs.AI cs.AR 86%

MG-Verilog: Multi-grained Dataset Towards Enhanced LLM-assisted Verilog Generation

Yongan Zhang, Zhongzhi Yu, Yonggan Fu, Cheng Wan, Yingyan Celine Lin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted in ISLAD 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00993 2024-07-02 cs.AI cs.CL 86%

Mobile-Bench: An Evaluation Benchmark for LLM-based Mobile Agents

Shihan Deng, Weikai Xu, Hongda Sun, Wei Liu, Tao Tan, Jianfeng Liu, Ang Li, Jian Luan, Bin Wang, Rui Yan, Shuo Shang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18192 2024-06-28 cs.CL cs.AI 86%

Methodology of Adapting Large English Language Models for Specific Cultural Contexts

Wenjing Zhang, Siqi Xiao, Xuejiao Lei, Ning Wang, Huazheng Zhang, Meijuan An, Bikun Yang, Zhaoxiang Liu, Kai Wang, Shiguo Lian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17789 2024-06-27 cs.CL cs.AI 86%

Spanish and LLM Benchmarks: is MMLU Lost in Translation?

Irene Plaza, Nina Melero, Cristina del Pozo, Javier Conde, Pedro Reviriego, Marina Mayor-Rocher, María Grandury

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16379 2024-06-24 cs.CL cs.AI 86%

TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement

Zhaopeng Feng, Yan Zhang, Hao Li, Bei Wu, Jiayu Liao, Wenqiang Liu, Jun Lang, Yang Feng, Jian Wu, Zuozhu Liu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Our code and data are available at https://github.com/fzp0424/self_correct_mt

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11381 2024-06-21 cs.AI cs.CL 86%

Can LLM-Augmented autonomous agents cooperate?, An evaluation of their cooperative capabilities through Melting Pot

Manuel Mosquera, Juan Sebastian Pinzon, Manuel Rios, Yesid Fonseca, Luis Felipe Giraldo, Nicanor Quijano, Ruben Manrique

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00378 2024-06-18 cs.CL cs.AI cs.CY 86%

ValueDCG: Measuring Comprehensive Human Value Understanding Ability of Language Models

Zhaowei Zhang, Fengshuo Bai, Jun Gao, Yaodong Yang

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06636 2024-06-12 cs.CL cs.LG 86%

LLM Questionnaire Completion for Automatic Psychiatric Assessment

Gony Rosenman, Lior Wolf, Talma Hendler

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04788 2024-06-12 cs.CL cs.AI cs.CV 86%

MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark

Dongping Chen, Ruoxi Chen, Shilin Zhang, Yinuo Liu, Yaochen Wang, Huichi Zhou, Qihui Zhang, Yao Wan, Pan Zhou, Lichao Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ICML 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01030 2024-06-10 cs.CL cs.AI 86%

Executable Code Actions Elicit Better LLM Agents

Xingyao Wang, Yangyi Chen, Lifan Yuan, Yizhe Zhang, Yunzhu Li, Hao Peng, Heng Ji

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICML 2024; Code, data, model, and demo are available at https://github.com/xingyaoww/code-act

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01855 2024-06-05 cs.CL cs.AI 86%

TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability

Aisha Khatun, Daniel G. Brown

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01364 2024-06-04 cs.CR cs.AI cs.CL 86%

BELLS: A Framework Towards Future Proof Benchmarks for the Evaluation of LLM Safeguards

Diego Dorn, Alexandre Variengien, Charbel-Raphaël Segerie, Vincent Corruble

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15784 2024-05-28 cs.IR cs.AI cs.CL 86%

CLARINET: Augmenting Language Models to Ask Clarification Questions for Retrieval

Yizhou Chi, Jessy Lin, Kevin Lin, Dan Klein

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14972 2024-05-22 cs.SE cs.AI cs.LG 86%

Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in Production

Chandra Irugalbandara, Ashish Mahendra, Roland Daynauth, Tharuka Kasthuri Arachchige, Jayanaka Dantanarayana, Krisztian Flautner, Lingjia Tang, Yiping Kang, Jason Mars

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

Comments Updated title, Revised content

Journal ref ISPASS-2024: 2024 IEEE International Symposium on Performance Analysis of Systems and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05610 2024-05-10 cs.CL cs.CR cs.LG 86%

Chain of Attack: a Semantic-Driven Contextual Multi-Turn attacker for LLM

Xikang Yang, Xuehai Tang, Songlin Hu, Jizhong Han

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏