arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2405.04753 2024-05-09 cs.CR cs.AI 90%

AttacKG+:Boosting Attack Knowledge Graph Construction with Large Language Models

Yongheng Zhang, Tingwen Du, Yunshan Ma, Xiang Wang, Yi Xie, Guozheng Yang, Yuliang Lu, Ee-Chien Chang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03695 2024-05-08 cs.CL 90%

Evaluating Large Language Models for Material Selection

Daniele Grandi, Yash Patawari Jain, Allin Groom, Brandon Cramer, Christopher McComb

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments arXiv admin note: text overlap with arXiv:2307.03109 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16859 2024-04-29 cs.CL cs.SI 90%

Rumour Evaluation with Very Large Language Models

Dahlia Shehata, Robin Cohen, Charles Clarke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09129 2024-04-16 cs.CL 90%

When Hindsight is Not 20/20: Testing Limits on Reflective Thinking in Large Language Models

Yanhong Li, Chenghao Yang, Allyson Ettinger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments NAACL 2024 Findings paper (Camera-Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08963 2024-04-08 cs.CL 90%

Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data?

Xiangru Tang, Yiming Zong, Jason Phang, Yilun Zhao, Wangchunshu Zhou, Arman Cohan, Mark Gerstein

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00097 2024-04-04 cs.SE cs.LG 90%

Code-Aware Prompting: A study of Coverage Guided Test Generation in Regression Setting using LLM

Gabriel Ryan, Siddhartha Jain, Mingyue Shang, Shiqi Wang, Xiaofei Ma, Murali Krishna Ramanathan, Baishakhi Ray

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11734 2024-03-26 cs.PL cs.AI cs.SE 90%

Solving Data-centric Tasks using Large Language Models

Shraddha Barke, Christian Poelitz, Carina Suzana Negreanu, Benjamin Zorn, José Cambronero, Andrew D. Gordon, Vu Le, Elnaz Nouri, Nadia Polikarpova, Advait Sarkar, Brian Slininger, Neil Toronto, Jack Williams

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Paper accepted to NAACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15754 2024-02-27 cs.CL 90%

HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition

Yuxuan Liu, Tianchi Yang, Shaohan Huang, Zihan Zhang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13567 2024-02-14 cs.CL 90%

MentaLLaMA: Interpretable Mental Health Analysis on Social Media with Large Language Models

Kailai Yang, Tianlin Zhang, Ziyan Kuang, Qianqian Xie, Jimin Huang, Sophia Ananiadou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Accepted by WWW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06527 2023-12-12 cs.SE cs.AI 90%

An Empirical Evaluation of Using Large Language Models for Automated Unit Test Generation

Max Schäfer, Sarah Nadi, Aryaz Eghbali, Frank Tip

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04118 2023-11-30 cs.CL 90%

Exploring Human-Like Translation Strategy with Large Language Models

Zhiwei He, Tian Liang, Wenxiang Jiao, Zhuosheng Zhang, Yujiu Yang, Rui Wang, Zhaopeng Tu, Shuming Shi, Xing Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To be published in TACL (pre-MIT Press publication version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03214 2023-11-23 cs.CL 90%

FreshLLMs: Refreshing Large Language Models with Search Engine Augmentation

Tu Vu, Mohit Iyyer, Xuezhi Wang, Noah Constant, Jerry Wei, Jason Wei, Chris Tar, Yun-Hsuan Sung, Denny Zhou, Quoc Le, Thang Luong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Preprint, 26 pages, 10 figures, 5 tables; Added FreshEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12320 2023-11-22 cs.AI 90%

A Survey on Multimodal Large Language Models for Autonomous Driving

Can Cui, Yunsheng Ma, Xu Cao, Wenqian Ye, Yang Zhou, Kaizhao Liang, Jintai Chen, Juanwu Lu, Zichong Yang, Kuei-Da Liao, Tianren Gao, Erlong Li, Kun Tang, Zhipeng Cao, Tong Zhou, Ao Liu, Xinrui Yan, Shuqi Mei, Jianguo Cao, Ziran Wang, Chao Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03754 2023-11-08 cs.CL 90%

Which is better? Exploring Prompting Strategy For LLM-based Metrics

Joonghoon Kim, Saeran Park, Kiyoon Jeong, Sangmin Lee, Seung Hun Han, Jiyoon Lee, Pilsung Kang

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments Eval4NLP 2023 shared task winner on both Small and Large model Track for Summarization

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06116 2023-11-01 cs.AI 90%

OptiMUS: Optimization Modeling Using MIP Solvers and large language models

Ali AhmadiTeshnizi, Wenzhi Gao, Madeleine Udell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14283 2023-10-24 cs.CL 90%

Query Rewriting for Retrieval-Augmented Large Language Models

Xinbei Ma, Yeyun Gong, Pengcheng He, Hai Zhao, Nan Duan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments EMNLP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05177 2023-10-10 cs.CL 90%

Do Large Language Models Know about Facts?

Xuming Hu, Junzhe Chen, Xiaochuan Li, Yufei Guo, Lijie Wen, Philip S. Yu, Zhijiang Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06311 2023-10-10 cs.CL 90%

Automatic Evaluation of Attribution by Large Language Models

Xiang Yue, Boshi Wang, Ziru Chen, Kai Zhang, Yu Su, Huan Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12294 2023-09-22 cs.CL 90%

Reranking for Natural Language Generation from Logical Forms: A Study based on Large Language Models

Levon Haroutunian, Zhuang Li, Lucian Galescu, Philip Cohen, Raj Tumuluri, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments IJCNLP-AACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14233 2023-08-03 cs.CL cs.IR 90%

Large Language Models are Strong Zero-Shot Retriever

Tao Shen, Guodong Long, Xiubo Geng, Chongyang Tao, Tianyi Zhou, Daxin Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15005 2023-05-25 cs.CL 90%

Sentiment Analysis in the Era of Large Language Models: A Reality Check

Wenxuan Zhang, Yue Deng, Bing Liu, Sinno Jialin Pan, Lidong Bing

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12203 2023-04-25 cs.CL 90%

Creating Large Language Model Resistant Exams: Guidelines and Strategies

Simon kaare Larsen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10436 2023-04-21 cs.CL 90%

Safety Assessment of Chinese Large Language Models

Hao Sun, Zhexin Zhang, Jiawen Deng, Jiale Cheng, Minlie Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Benchmark website: http://coai.cs.tsinghua.edu.cn/leaderboard/ ; SafetyPrompts repo: https://github.com/thu-coai/Safety-Prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.11214 2022-12-22 cs.AI 90%

Crowd Score: A Method for the Evaluation of Jokes using Large Language Model AI Voters as Judges

Fabricio Goes, Zisen Zhou, Piotr Sawicki, Marek Grzes, Daniel G. Brown

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23037 2026-01-01 cs.AI cs.CL cs.LG 90%

Agentic Large Language Models, a survey

代理大语言模型:综述

Aske Plaat, Max van Duijn, Niki van Stein, Mike Preuss, Peter van der Putten, Kees Joost Batenburg

机构 * Leiden University Leiden Netherlands Leiden University \& AI Lab, Pegasystems Leiden Netherlands Leiden University Leiden University \& AI Lab, Pegasystems

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。

Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/

Journal ref JAIR volume 84, article 29, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01801 2024-05-08 cs.LG cs.AI cs.CL 90%

Large Language Models for Time Series: A Survey

Xiyuan Zhang, Ranak Roy Chowdhury, Rajesh K. Gupta, Jingbo Shang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments GitHub repository: https://github.com/xiyuanzh/awesome-llm-time-series

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15701 2023-10-17 cs.CL cs.AI cs.LG cs.SD eess.AS 90%

HyPoradise: An Open Baseline for Generative Speech Recognition with Large Language Models

Chen Chen, Yuchen Hu, Chao-Han Huck Yang, Sabato Macro Siniscalchi, Pin-Yu Chen, Eng Siong Chng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to NeurIPS 2023, 24 pages. Datasets and Benchmarks Track. Added the first Mandarin and code-switching (zh-cn and en-us) results from the LLM-based generative ASR error correction to Table 8 on Page 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21423 2026-08-25 cs.CL cs.AI cs.CR cs.MA 新提交 90%

Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing

智能体安全:LLM驱动渗透测试的工具、失效模式与设计法则体系化研究

Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) BRAC University(BRAC大学) North South University(北南大学) Missouri State University(密苏里州立大学) Multimedia University(多媒体大学) American International University-Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究对LLM驱动渗透测试的智能体安全相关工具、失效模式等体系化,推导定量规律与设计法则,实现Inspectra平台验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2026-08-25 cs.AI cs.CL 版本更新 90%

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

超越基准:基于拟人化与生命周期导向路线图的大语言模型评估

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM基准分数与实际效用脱节问题,建立诊断本体并提出含IQ、PQ、EQ、VQ的拟人化评估框架,分析200余个基准后为LLM开发提供战略指引。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21074 2026-08-24 cs.CL cs.AI cs.HC cs.SE 新提交 90%

PromptResponse: Optimizing Prompts for LLM Coding Tasks

PromptResponse:优化大语言模型编码任务的提示词

Erik Thureck, Robert Kühnen, Tim Jacobowitz

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) HU Berlin(柏林洪堡大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PromptResponse,通过对HumanEval数据集的5种变体让GPT-4o执行8200次编码任务,发现统一格式(尤其JSON)可提升代码效率与稳定性,LLM调优提示词会降低性能,还发布了相关数据集与评估流程。

Comments 22 pages, 7 figures, 10 listings

详情

展开后加载摘要…

URL PDF HTML 收藏