arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2506.15617 2025-06-19 cs.CL cs.AI cs.LG 90%

The Compositional Architecture of Regret in Large Language Models

Xiangxiang Cui, Shu Yang, Tianjin Huang, Wanyu Lin, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析实验室) King Abdullah University of Science and Technology(卡瓦尔大学科学与技术大学) State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知神经科学与学习国家重点实验室,北京师范大学) University of Exeter(埃克塞特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13186 2025-06-17 cs.SE 90%

Empirical Evaluation of Large Language Models in Automated Program Repair

Jiajun Sun, Fengjie Li, Xinzhu Qi, Hongyu Zhang, Jiajun Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12992 2025-06-17 cs.CV 90%

SmartHome-Bench: A Comprehensive Benchmark for Video Anomaly Detection in Smart Homes Using Multi-Modal Large Language Models

Xinyi Zhao, Congjing Zhang, Pei Guo, Wei Li, Lin Chen, Chaoyue Zhao, Shuai Huang

机构 * University of Washington(华盛顿大学) Wyze Labs, Inc.(Wyze实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments CVPR 2025 Workshop: VAND 3.0 - Visual Anomaly and Novelty Detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11110 2025-06-16 cs.CL cs.AI cs.LG 90%

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

Jaeho Lee, Atharv Chowdhary

机构 * Brown University(布朗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures, appendix contains 2 additional figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11050 2025-06-13 cs.SE 90%

An Empirical Evaluation of Pre-trained Large Language Models for Repairing Declarative Formal Specifications

Mohannad Alhanahnah, Md Rashedul Hasan, Lisong Xu, Hamid Bagheri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13948 2025-06-03 cs.AI cs.CL cs.LG 90%

CityGPT: Empowering Urban Spatial Cognition of Large Language Models

Jie Feng, Tianhui Liu, Yuwei Du, Siqi Guo, Yuming Lin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Department of Electronic Engineering, Tsinghua University(电子工程系、清华大学) Department of Urban Planning, Tsinghua University(城市规划系、清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 Research Track, https://github.com/tsinghua-fib-lab/CityGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01012 2025-05-27 cs.IR cs.AI cs.CL cs.LG 90%

Query Performance Prediction using Relevance Judgments Generated by Large Language Models

Chuan Meng, Negar Arabzadeh, Arian Askari, Mohammad Aliannejadi, Maarten de Rijke

机构 * University of Amsterdam(阿姆斯特丹大学) University of Waterloo(滑铁卢大学) Leiden University(莱顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by ACM Transactions on Information Systems (TOIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18488 2025-05-27 cs.LG cs.AI cs.CL 90%

Synthesizing and Adapting Error Correction Data for Mobile Large Language Model Applications

Yanxiang Zhang, Zheng Xu, Shanshan Wu, Yuanbo Zhang, Daniel Ramage

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11665 2025-05-20 cs.CL cs.AI cs.LG 90%

Multilingual Prompt Engineering in Large Language Models: A Survey Across NLP Tasks

Shubham Vatsal, Harsh Dubey, Aditi Singh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09831 2025-05-12 cs.LG cs.AI cs.CL cs.NE 90%

Recent Advances in Federated Learning Driven Large Language Models: A Survey on Architecture, Performance, and Security

Youyang Qu, Ming Liu, Tianqing Zhu, Longxiang Gao, Shui Yu, Wanlei Zhou

机构 * Big Data Mining and Analytics(大数据挖掘与分析)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19612 2025-04-29 cs.IR 90%

Keyword-driven Retrieval-Augmented Large Language Models for Cold-start User Recommendations

Hai-Dang Kieu, Minh Duc Nguyen, Thanh-Son Nguyen, Dung D. Le

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02810 2025-04-28 cs.CL cs.AI cs.LG 90%

Generative Evaluation of Complex Reasoning in Large Language Models

Haowei Lin, Xiangyu Wang, Ruilin Yan, Baizhou Huang, Haotian Ye, Jianhua Zhu, Zihao Wang, James Zou, Jianzhu Ma, Yitao Liang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17975 2025-04-10 cs.CL cs.AI cs.HC cs.LG 90%

Automating Customer Needs Analysis: A Comparative Study of Large Language Models in the Travel Industry

Simone Barandoni, Filippo Chiarello, Lorenzo Cascone, Emiliano Marrale, Salvatore Puccio

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23213 2025-04-01 cs.CL cs.AI cs.LG 90%

RECALL-MM: A Multimodal Dataset of Consumer Product Recalls for Risk Analysis using Computational Methods and Large Language Models

Diana Bolanos, Mohammadmehdi Ataei, Daniele Grandi, Kosa Goucher-Lambert

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16458 2025-03-25 q-fin.RM cs.AI cs.CL cs.LG 90%

Credit Risk Meets Large Language Models: Building a Risk Indicator from Loan Descriptions in P2P Lending

Mario Sanz-Guerrero, Javier Arroyo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Inteligencia Artificial, 28(75) (2025), 220-247

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05788 2025-03-17 cs.LG cs.AI cs.CL 90%

Emergent Abilities in Large Language Models: A Survey

Leonardo Berti, Flavio Giorgi, Gjergji Kasneci

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17055 2025-03-11 cs.CL cs.AI cs.CY cs.LG 90%

Large Language Models Assume People are More Rational than We Really are

Ryan Liu, Jiayi Geng, Joshua C. Peterson, Ilia Sucholutsky, Thomas L. Griffiths

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06263 2025-03-11 cs.CY cs.AI cs.CL cs.LG 90%

Critical Foreign Policy Decisions (CFPD)-Benchmark: Measuring Diplomatic Preferences in Large Language Models

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Michael Garcia, Austin Woo, Anthony Chen, Trevor Howarth

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17504 2025-03-07 q-bio.BM cs.AI cs.CE cs.CL cs.LG 90%

Protein Large Language Models: A Comprehensive Survey

Yijia Xiao, Wanjia Zhao, Junkai Zhang, Yiqiao Jin, Han Zhang, Zhicheng Ren, Renliang Sun, Haixin Wang, Guancheng Wan, Pan Lu, Xiao Luo, Yu Zhang, James Zou, Yizhou Sun, Wei Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00591 2025-03-04 cs.CV 90%

AesthetiQ: Enhancing Graphic Layout Design via Aesthetic-Aware Preference Alignment of Multi-modal Large Language Models

Sohan Patnaik, Rishabh Jain, Balaji Krishnamurthy, Mausoom Sarkar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

Comments Accepted for publication in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18479 2025-03-04 cs.HC 90%

ChatGPT as an inventor: Eliciting the strengths and weaknesses of current large language models against humans in engineering design

Daniel Nygård Ege, Henrik H. Øvrebø, Vegar Stubberud, Martin Francis Berg, Christer Elverum, Martin Steinert, Håvard Vestad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08587 2025-03-03 cs.CL cs.AI cs.LG 90%

CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery

Xiaoshuai Song, Muxi Diao, Guanting Dong, Zhengyang Wang, Yujia Fu, Runqi Qiao, Zhexu Wang, Dayuan Fu, Huangxuan Wu, Bin Liang, Weihao Zeng, Yejie Wang, Zhuoma GongQue, Jianing Yu, Qiuna Tan, Weiran Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02969 2025-02-24 cs.LG cs.AI cs.CL q-fin.CP q-fin.MF 90%

Filtered not Mixed: Stochastic Filtering-Based Online Gating for Mixture of Large Language Models

Raeid Saqur, Anastasis Kratsios, Florian Krach, Yannick Limmer, Jacob-Junqi Tian, John Willes, Blanka Horvath, Frank Rudzicz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 5 Appendix sections

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14318 2025-02-21 cs.CL cs.AI cs.LG 90%

Line Goes Up? Inherent Limitations of Benchmarks for Evaluating Large Language Models

James Fodor

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16176 2025-02-18 cs.AI cs.CL cs.LG 90%

GraphEval36K: Benchmarking Coding and Reasoning Capabilities of Large Language Models on Graph Datasets

Qiming Wu, Zichen Chen, Will Corcoran, Misha Sra, Ambuj K. Singh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The first two authors contributed equally to this work. This paper has been accepted by NAACL 2025. GraphEval36K is available at https://grapheval36k.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10263 2025-02-17 cs.CL cs.AI cs.CY cs.DB cs.LG 90%

Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers

Aivin V. Solatorio, Rafael Macalaba, James Liounis

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project GitHub repository at https://github.com/worldbank/ai4data-use

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04040 2025-02-11 cs.CL cs.AI cs.LG cs.NE 90%

A Survey on Large Language Models with some Insights on their Capabilities and Limitations

Andrea Matarazzo, Riccardo Torlone

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 174 pages, to be submitted to a journal in a shorter version. It includes figures taken from papers by other authors. All the sources have been referenced. arXiv admin note: text overlap with arXiv:2303.18223 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12924 2025-02-11 eess.SP cs.AI cs.CL cs.LG cs.SD eess.AS 90%

Wavelet GPT: Wavelet Inspired Large Language Models

Prateek Verma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 4 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01524 2025-02-05 cs.CV cs.AI cs.CL cs.LG 90%

Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective

Xiaorui Ma, Haoran Xie, S. Joe Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03112 2025-01-30 cs.CL cs.AI cs.CY cs.LG 90%

LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases

Dylan Bouchard, Mohit Singh Chauhan, David Skarbrevik, Viren Bajaj, Zeya Ahmad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Journal of Open Source Software; LangFair repository: https://github.com/cvs-health/langfair

Journal ref Journal of Open Source Software, 10(105), 7570 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏