arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32207 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32207 篇

2507.00718 2025-07-02 cs.CL 88%

AI Analyst: Framework and Comprehensive Evaluation of Large Language Models for Financial Time Series Report Generation

Elizabeth Fons, Elena Kochkina, Rachneet Kaur, Zhen Zeng, Berowne Hlavaty, Charese Smiley, Svitlana Vyetrenko, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23288 2025-07-01 cs.CL 88%

Two Spelling Normalization Approaches Based on Large Language Models

Miguel Domingo, Francisco Casacuberta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23107 2025-07-01 cs.AI 88%

Can Large Language Models Capture Human Risk Preferences? A Cross-Cultural Study

Bing Song, Jianing Liu, Sisi Jian, Chenyang Wu, Vinayak Dixit

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of Aeronautics(航空学院) Northwestern Polytechnical University(西北工业大学) Urban System Laboratory(城市系统实验室) Imperial College London(伦敦帝国理工学院) National Key Laboratory of Aircraft Configuration Design(航空配置设计国家重点实验室) School of Civil and Environmental Engineering(土木与环境工程系) The University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21812 2025-06-30 cs.CL cs.CV 88%

Towards Transparent AI: A Survey on Explainable Large Language Models

Avash Palikhe, Zhenyu Yu, Zichong Wang, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) Universiti Malaya(马来亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12644 2025-06-30 cs.CL 88%

iPrOp: Interactive Prompt Optimization for Large Language Models with a Human in the Loop

Jiahui Li, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆堡大学,德国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21343 2025-06-27 cs.LG 88%

DynamicBench: Evaluating Real-Time Report Generation in Large Language Models

Jingyao Li, Hao Sun, Zile Qiao, Yong Jiang, Pengjun Xie, Fei Huang, Hong Xu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba Group(阿里巴巴集团) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04386 2025-06-27 cs.CL 88%

Learning Evaluation Models from Large Language Models for Sequence Generation

Chenglong Wang, Hang Zhou, Kaiyan Chang, Tongran Liu, Chunliang Zhang, Quan Du, Tong Xiao, Yue Zhang, Jingbo Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by TASLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19483 2025-06-25 cs.CL 88%

Commonsense Generation and Evaluation for Dialogue Systems using Large Language Models

Marcos Estecha-Garitagoitia, Chen Zhang, Mario Rodríguez-Cantelar, Luis Fernando D'Haro

机构 * ETSI de Telecomunicación, Universidad Politécnica de Madrid(电信工程系,马德里理工大学) National University of Singapore(新加坡国立大学) Centre for Automation and Robotics UPM-CSIC(自动化与机器人中心 UPM-CSIC) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01799 2025-06-25 cs.CL cs.CY 88%

PATCH! {P}sychometrics-{A}ssis{T}ed Ben{CH}marking of Large Language Models against Human Populations: A Case Study of Proficiency in 8th Grade Mathematics

Qixiang Fang, Daniel L. Oberski, Dong Nguyen

机构 * Utrecht University(乌特雷赫大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

Comments Accepted to GEM2 Workshop: Generation, Evaluation & Metrics - ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00839 2025-06-24 cs.RO cs.AI 88%

Context-Aware Human Behavior Prediction Using Multimodal Large Language Models: Challenges and Insights

Yuchen Liu, Lino Lerch, Luigi Palmieri, Andrey Rudenko, Sebastian Koch, Timo Ropinski, Marco Aiello

机构 * Corporate Sector Research and Advance Engineering, Robert Bosch GmbH(罗伯特博世集团企业部门研究与先进工程) Service Computing Department, Institute of Architecture of Application Systems, University of Stuttgart(斯图加特大学应用系统研究所服务计算部门) Visual Computing Group, Ulm University(乌尔姆大学视觉计算组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06967 2025-06-23 cs.CV cs.AI eess.IV 88%

Dual Thinking and Logical Processing -- Are Multi-modal Large Language Models Closing the Gap with Human Vision ?

Kailas Dayanandan, Nikhil Kumar, Anand Sinha, Brejesh Lall

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15568 2025-06-19 cs.CL 88%

Gender Inclusivity Fairness Index (GIFI): A Multilevel Framework for Evaluating Gender Diversity in Large Language Models

Zhengyang Shan, Emily Ruth Diana, Jiawei Zhou

机构 * Boston University(波士顿大学) Carnegie Mellon University(卡内基梅隆大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14224 2025-06-18 cs.AI 88%

From Black Boxes to Transparent Minds: Evaluating and Enhancing the Theory of Mind in Multimodal Large Language Models

Xinyang Li, Siqi Liu, Bochao Zou, Jiansheng Chen, Huimin Ma

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 24 pages, 22 figures, accepted at ICML 2025, project page: see https://annaisavailable.github.io/GridToM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13977 2025-06-18 cs.SE cs.CL 88%

CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios

Shiting Huang, Zhen Fang, Zehui Chen, Siyu Yuan, Junjie Ye, Yu Zeng, Lin Chen, Qi Mao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Communication University of China(中国传媒大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19563 2025-06-18 cs.CL 88%

Ensemble Watermarks for Large Language Models

Georg Niess, Roman Kern

机构 * Graz University of Technology(格拉茨技术大学) Know Center Research GmbH

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL 2025 main conference. This article extends our earlier work arXiv:2405.08400 by introducing an ensemble of stylometric watermarking features and alternative experimental analysis. Code and data are available at http://github.com/CommodoreEU/ensemble-watermark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13055 2025-06-17 cs.CL 88%

CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model

Jiangtong Li, Yiyun Zhu, Dawei Cheng, Zhijun Ding, Changjun Jiang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12495 2025-06-17 cs.AI cs.SY eess.SY 88%

Automated Heuristic Design for Unit Commitment Using Large Language Models

Junjin Lv, Chenggang Cui, Shaodi Zhang, Hui Chen, Chunyang Gong, Jiaming Liu

机构 * Shanghai University of Electric Power(上海电力大学) Shanghai Electrical Appliances Research Institute (Group) Co(上海电气 appliances 研究院(集团)公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09992 2025-06-16 cs.CL 88%

Large Language Models for Toxic Language Detection in Low-Resource Balkan Languages

Amel Muminovic, Amela Kadric Muminovic

机构 * Faculty of Engineering International Balkan University(工程学院国际巴尔干大学) School of Electrical Engineering University of Belgrade(电气工程学院贝尔格莱德大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10495 2025-06-16 cs.SE cs.AI 88%

How Well Do Large Language Models Serve as End-to-End Secure Code Agents for Python?

Jianian Gong, Nachuan Duan, Ziheng Tao, Zhaohui Gong, Yuan Yuan, Minlie Huang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12378 2025-06-13 cs.CL 88%

Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges

Bolei Ma, Yuting Li, Wei Zhou, Ziwei Gong, Yang Janet Liu, Katja Jasinskaja, Annemarie Friedrich, Julia Hirschberg, Frauke Kreuter, Barbara Plank

机构 * LMU Munich & Munich Center for Machine Learning(慕尼黑大学及慕尼黑机器学习中心) University of Cologne(科隆大学) University of Augsburg(奥格斯堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Columbia University(哥伦比亚大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21025 2025-06-12 cs.CL 88%

Durghotona GPT: A Web Scraping and Large Language Model Based Framework to Generate Road Accident Dataset Automatically in Bangladesh

MD Thamed Bin Zaman Chowdhury, Moazzem Hossain, Md. Ridwanul Islam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments It has been accepted in IEEE 27th International Conference on Computer and Information Technology (ICCIT). Now, we are waiting for it to get published in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20715 2025-06-11 cs.CL 88%

From Annotation to Adaptation: Metrics, Synthetic Data, and Aspect Extraction for Aspect-Based Sentiment Analysis with Large Language Models

Nikita Neveditsin, Pawan Lingras, Vijay Mago

机构 * Saint Mary’s University(圣玛丽大学) York University(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07818 2025-06-10 cs.CL 88%

WebUIBench: A Comprehensive Benchmark for Evaluating Multimodal Large Language Models in WebUI-to-Code

Zhiyu Lin, Zhengda Zhou, Zhiyuan Zhao, Tianrui Wan, Yilun Ma, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信) Northwestern Polytechnical University(西北工业大学) Beijing Jiaotong University(北京交通大学) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07695 2025-06-10 cs.SE cs.LG 88%

Towards a Small Language Model Lifecycle Framework

Parsa Miraghaei, Sergio Moreschini, Antti Kolehmainen, David Hästbacka

机构 * Tampere University(塔尔皮奥大学) University of Oulu(奥卢大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07202 2025-06-10 cs.AI 88%

Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation

Ming Liu, Wensheng Zhang

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20811 2025-06-10 cs.CV cs.CL cs.MM 88%

HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models

Xiao Wang, Jingyun Hua, Weihong Lin, Yuanxing Zhang, Fuzheng Zhang, Jianlong Wu, Di Zhang, Liqiang Nie

机构 * Kuaishou Technology(快手科技) Shandong University(山东省大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06242 2025-06-09 cs.CV cs.AI 88%

Visual Graph Arena: Evaluating Visual Conceptualization of Vision and Multimodal Large Language Models

Zahra Babaiee, Peyman M. Kiasari, Daniela Rus, Radu Grosu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01819 2025-06-09 cs.CL cs.CY 88%

Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor

Mohammadamin Shafiei, Hamidreza Saffari

机构 * University of Milan(米兰大学) Politecnico di Milano(米兰理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05379 2025-06-09 cs.GT cs.AI cs.CY 88%

Designing DSIC Mechanisms for Data Sharing in the Era of Large Language Models

Seyed Moein Ayyoubzadeh, Kourosh Shahnazari, Mohammmadali Keshtparvar, MohammadAmin Fazli

机构 * Sharif University of Technology(谢里夫理工学院) Amirkabir University of Technology(阿米尔卡比尔理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20645 2025-06-05 cs.CL 88%

STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models

Kai Chen, Zihao He, Taiwei Shi, Kristina Lerman

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏