arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2502.06858 2025-02-12 cs.CL cs.AI 86%

LLM-Supported Natural Language to Bash Translation

Finnian Westenfelder, Erik Hemberg, Miguel Tulla, Stephen Moskal, Una-May O'Reilly, Silviu Chiricescu

机构 * MIT-CSAIL(麻省理工学院计算机科学与人工智能实验室) Draper Laboratory(德雷珀实验室) Charles Stark Draper Laboratory(查尔斯·斯塔克·德雷珀实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages, NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12665 2025-02-12 cs.CL cs.AI 86%

CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis

Saranya Venkatraman, Nafis Irtiza Tripto, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06494 2025-02-11 cs.CL cs.AI 86%

GuideLLM: Exploring LLM-Guided Conversation with Applications in Autobiography Interviewing

Jinhao Duan, Xinyu Zhao, Zhuoxuan Zhang, Eunhye Ko, Lily Boddy, Chenan Wang, Tianhao Li, Alexander Rasgon, Junyuan Hong, Min Kyung Lee, Chenxi Yuan, Qi Long, Ying Ding, Tianlong Chen, Kaidi Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 31 pages; the first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04349 2025-02-10 cs.CL cs.AI 86%

Dynamic benchmarking framework for LLM-based conversational data capture

Pietro Alessandro Aluffi, Patrick Zietkiewicz, Marya Bazzi, Matt Arderne, Vladimirs Murevics

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14202 2025-02-06 cs.CL cs.AI 86%

Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs

SeongYeub Chu, JongWoo Kim, Bryan Wong, MunYong Yi

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) Department of Industrial & Systems Engineering, KAIST(韩国科学技术院工业与系统工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02573 2025-02-05 cs.CL cs.AI 86%

Are Language Models Up to Sequential Optimization Problems? From Evaluation to a Hegelian-Inspired Enhancement

Soheil Abbasloo

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02009 2025-02-05 cs.SE cs.AI cs.CR cs.LG 86%

LLMSecConfig: An LLM-Based Approach for Fixing Software Container Misconfigurations

Ziyang Ye, Triet Huynh Minh Le, M. Ali Babar

机构 * CREST - The Centre for Research on Engineering Software Technologies(工程软件技术研究中心(CREST))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17183 2025-02-04 cs.CL cs.AI 86%

LLM Evaluation Based on Aerospace Manufacturing Expertise: Automated Generation and Multi-Model Question Answering

Beiming Liu, Zhizhuo Cui, Siteng Hu, Xiaohua Li, Haifeng Lin, Zhengxin Zhang

机构 * Chengdu Aircraft Industrial (Group) Co., Ltd.(成都飞机工业(集团)有限责任公司) School of Computer Science, Beihang University(北京航空航天大学计算机学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18243 2025-01-31 stat.AP cs.CL cs.LG 86%

Statistical multi-metric evaluation and visualization of LLM system predictive performance

Samuel Ackerman, Eitan Farchi, Orna Raz, Assaf Toledo

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17200 2025-01-30 cs.CL cs.AI stat.AP 86%

Improving LLM Leaderboards with Psychometrical Methodology

Denis Federiakin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 53 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15247 2025-01-29 cs.CL cs.AI 86%

Prompting ChatGPT for Chinese Learning as L2: A CEFR and EBCL Level Study

Miao Lin-Zucker, Joël Bellassen, Jean-Daniel Zucker

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments 35 pages, 1 figure, 5 tables, 7 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03518 2025-01-24 cs.CL cs.AI 86%

Improving LLM Abilities in Idiomatic Translation

Sundesh Donthi, Maximilian Spencer, Om Patel, Joon Doh, Eid Rodan, Kevin Zhu, Sean O'Brien

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Preprint for LoResLM Workshop at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11051 2025-01-22 cs.CV cs.AI cs.CL cs.RO 86%

FLAME: Learning to Navigate with Multimodal LLM in Urban Environments

Yunzhe Xu, Yiyuan Pan, Zhe Liu, Hesheng Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10729 2025-01-17 cs.LG cs.AI cs.CV 86%

A Comprehensive Survey of Foundation Models in Medicine

Wasif Khan, Seowung Leem, Kyle B. See, Joshua K. Wong, Shaoting Zhang, Ruogu Fang

机构 * Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·沃特海姆工程学院) Norman Fixel Institute for Neurological Diseases, University of Florida(佛罗里达大学诺曼·菲克塞尔神经疾病研究所) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) McKnight Brain Institute, University of Florida(佛罗里达大学麦克奈特脑科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Currently under review in IEEE REVIEWS IN BIOMEDICAL ENGINEERING

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08200 2025-01-15 cs.SE cs.CL cs.LG 86%

CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation

Jinjun Peng, Leyi Cui, Kele Huang, Junfeng Yang, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments to be published in LLM4Code 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11120 2025-01-10 cs.LG cs.AI 86%

Latent Reward: LLM-Empowered Credit Assignment in Episodic Reinforcement Learning

Yun Qu, Yuhang Jiang, Boyuan Wang, Yixiu Mao, Cheems Wang, Chang Liu, Xiangyang Ji

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13226 2025-01-08 cs.CL cs.LG 86%

Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum

Hadi Pouransari, Chun-Liang Li, Jen-Hao Rick Chang, Pavan Kumar Anasosalu Vasu, Cem Koc, Vaishaal Shankar, Oncel Tuzel

机构 * Apple(苹果公司) Anthropic

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00684 2025-01-03 cs.LG cs.CL 86%

IGC: Integrating a Gated Calculator into an LLM to Solve Arithmetic Tasks Reliably and Efficiently

Florian Dietz, Dietrich Klakow

机构 * Saarland University(萨尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04424 2024-12-25 cs.CL cs.AI 86%

Bayesian Calibration of Win Rate Estimation with LLM Evaluators

Yicheng Gao, Gonghan Xu, Zhe Wang, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13765 2024-12-20 cs.CL cs.AI 86%

LLM-SEM: A Sentiment-Based Student Engagement Metric Using LLMS for E-Learning Platforms

Ali Hamdi, Ahmed Abdelmoneim Mazrou, Mohamed Shaltout

机构 * aitech(艾泰科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14304 2024-12-20 cs.CL cs.AI 86%

Multi-OphthaLingua: A Multilingual Benchmark for Assessing and Debiasing LLM Ophthalmological QA in LMICs

David Restrepo, Chenwei Wu, Zhengxu Tang, Zitao Shuai, Thao Nguyen Minh Phan, Jun-En Ding, Cong-Tinh Dao, Jack Gallifant, Robyn Gayle Dychiao, Jose Carlo Artiaga, André Hiroshi Bando, Carolina Pelegrini Barbosa Gracitelli, Vincenz Ferrer, Leo Anthony Celi, Danielle Bitterman, Michael G Morley, Luis Filipe Nakayama

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at the AAAI 2025 Artificial Intelligence for Social Impact Track (AAAI-AISI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13578 2024-12-19 cs.CL cs.AI 86%

Socio-Culturally Aware Evaluation Framework for LLM-Based Content Moderation

Shanu Kumar, Gauri Kholkar, Saish Mendke, Anubhav Sadana, Parag Agrawal, Sandipan Dandapat

机构 * Microsoft Corporation(微软公司) Pure Storage(纯存储公司) Relay42

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted in SUMEval Workshop in COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11417 2024-12-18 cs.AI cs.LG 86%

RL-LLM-DT: An Automatic Decision Tree Generation Method Based on RL Evaluation and LLM Enhancement

Junjie Lin, Jian Zhao, Lin Liu, Yue Deng, Youpeng Zhao, Lanxiao Huang, Xia Lin, Wengang Zhou, Houqiang Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Length:10 pages. Figures:10 figures. Additional Notes:In this paper, we have introduced a novel hybrid approach which leverages the strengths of both RL and LLMs to itera- tively refine decision tree tactics, enhancing their performance and adaptability

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09097 2024-12-18 cs.CL cs.AI 86%

Recent advancements in LLM Red-Teaming: Techniques, Defenses, and Ethical Considerations

Tarun Raheja, Nilay Pochhi, F. D. C. M. Curie

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09056 2024-12-18 cs.CL cs.AI 86%

Towards Reliable Detection of LLM-Generated Texts: A Comprehensive Evaluation Framework with CUDRT

Zhen Tao, Yanfang Chen, Dinghao Xi, Zhiyu Li, Wei Xu

机构 * Renmin University of China(中国人民大学) Shanghai University of Finance and Economics(上海财经大学) Institute for Advanced Algorithms Research(高级算法研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11376 2024-12-17 cs.CL cs.LG 86%

ChatTime: A Unified Multimodal Time Series Foundation Model Bridging Numerical and Textual Data

Chengsen Wang, Qi Qi, Jingyu Wang, Haifeng Sun, Zirui Zhuang, Jinming Wu, Lei Zhang, Jianxin Liao

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11261 2024-12-17 cs.CL cs.AI 86%

CATER: Leveraging LLM to Pioneer a Multidimensional, Reference-Independent Paradigm in Translation Quality Evaluation

Kurando IIDA, Kenjiro MIMURA

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 17pages,1sample prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01002 2024-12-17 cs.CL cs.AI 86%

Attribute Structuring Improves LLM-Based Evaluation of Clinical Text Summaries

Zelalem Gero, Chandan Singh, Yiqing Xie, Sheng Zhang, Praveen Subramanian, Paul Vozila, Tristan Naumann, Jianfeng Gao, Hoifung Poon

机构 * Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学) Microsoft Health and Life Sciences(微软健康与生命科学部门)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in ML4H Findings 2024, 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17196 2024-12-12 cs.CL cs.AI cs.SD eess.AS 86%

VoiceBench: Benchmarking LLM-Based Voice Assistants

Yiming Chen, Xianghu Yue, Chen Zhang, Xiaoxue Gao, Robby T. Tan, Haizhou Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Work in progress. Data is available at https://github.com/MatthewCYM/VoiceBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12027 2024-12-06 cs.CL cs.AI cs.CV 86%

From Pixels to Insights: A Survey on Automatic Chart Understanding in the Era of Large Foundation Models

Kung-Hsiang Huang, Hou Pong Chan, Yi R. Fung, Haoyi Qiu, Mingyang Zhou, Shafiq Joty, Shih-Fu Chang, Heng Ji

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Capital One(第一资本金融公司) NTU(南洋理工大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏