arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2411.01271 2025-05-27 cs.LG cs.AI cs.ET cs.MA cs.SY eess.SY 88%

Interacting Large Language Model Agents. Interpretable Models and Social Learning

Adit Jain, Vikram Krishnamurthy

机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments 41 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17149 2025-05-26 cs.CL cs.AI 88%

Large Language Models for Predictive Analysis: How Far Are They?

Qin Chen, Yuanyi Ren, Xiaojun Ma, Yuyang Shi

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17065 2025-05-26 cs.CL cs.LG 88%

Decoding Rarity: Large Language Models in the Diagnosis of Rare Diseases

Valentina Carbonari, Pierangelo Veltri, Pietro Hiram Guzzi

机构 * University of Catanzaro(卡塔尼扎罗大学) University of Calabria(卡拉布里亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16003 2025-05-23 cs.CL cs.AI 88%

SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models

Roland Daynauth, Christopher Clarke, Krisztian Flautner, Lingjia Tang, Jason Mars

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13176 2025-05-23 cs.CL cs.AI 88%

ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models

Zihao Cheng, Hongru Wang, Zeming Liu, Yuhang Guo, Yuanfang Guo, Yunhong Wang, Haifeng Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) University of Science and Technology Beijing(北京科技大学) The Chinese University of Hong Kong(香港中文大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11436 2025-05-22 cs.CL cs.AI 88%

GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art

Yiming Lei, Chenkai Zhang, Zeming Liu, Haitao Leng, Shaoguo Liu, Tingting Gao, Qingjie Liu, Yunhong Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 69 pages, 66 figures, accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13559 2025-05-21 cs.CL cs.LG 88%

CS-Sum: A Benchmark for Code-Switching Dialogue Summarization and the Limits of Large Language Models

Sathya Krishnan Suresh, Tanmay Surana, Lim Zhi Hao, Eng Siong Chng

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 17 pages, 5 figures and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13484 2025-05-21 cs.AI cs.CL 88%

Evaluating Large Language Models for Real-World Engineering Tasks

Rene Heesch, Sebastian Eilermann, Alexander Windmann, Alexander Diedrich, Philipp Rosenthal, Oliver Niggemann

机构 * Helmut Schmidt University(海德堡-哈雷大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11916 2025-05-21 cs.CL cs.AI 88%

EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models

Jiamin Su, Yibo Yan, Fangteng Fu, Han Zhang, Jingheng Ye, Xiang Liu, Jiahao Huo, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Guangxi Zhuang Autonomous Region Big Data Research Institute(广西壮族自治区大数据研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12900 2025-05-20 cs.SE cs.AI cs.CG cs.CL cs.DB 88%

AutoGEEval: A Multimodal and Automated Framework for Geospatial Code Generation on GEE with Large Language Models

Shuyang Hou, Zhangxiao Shen, Huayi Wu, Jianyuan Liang, Haoyue Jiao, Yaxian Qing, Xiaopu Zhang, Xu Li, Zhipeng Gui, Xuefeng Guan, Longgang Xiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01976 2025-05-20 cs.CL cs.AI cs.MM 88%

A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding

Jinghui Lu, Haiyang Yu, Yanjie Wang, Yongjie Ye, Jingqun Tang, Ziwei Yang, Binghong Wu, Qi Liu, Hao Feng, Han Wang, Hao Liu, Can Huang

机构 * ByteDance Inc.(字节跳动公司) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accept to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12287 2025-05-20 cs.CL cs.AI 88%

The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models

Linghan Huang, Haolin Jin, Zhaoge Bi, Pengyue Yang, Peizhou Zhao, Taozhao Chen, Xiongfei Wu, Lei Ma, Huaming Chen

机构 * School of Electrical and Computer Engineering, University of Sydney(电子与计算机工程学院,悉尼大学) The University of Tokyo, Japan(东京大学,日本)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11983 2025-05-19 cs.LG cs.AI 88%

Leveraging Large Language Models for Effective Label-free Node Classification in Text-Attributed Graphs

Taiyan Zhang, Renchi Yang, Yurui Lai, Mingyu Yan, Xiaochun Ye, Dongrui Fan

机构 * ShanghaiTech University(上海科技大学) Hong Kong Baptist University(香港 Baptist 大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13338 2025-05-16 cs.CL cs.AI 88%

Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time

David Herel, Vojtech Bartek, Jiri Jirak, Tomas Mikolov

机构 * FEE, CTU in Prague(布拉格捷克技术大学电子工程系) CIIRC, Czech Technical University in Prague(布拉格捷克技术大学信息与通信研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07865 2025-05-14 q-bio.QM cs.AI cs.CL q-bio.CB 88%

CellVerse: Do Large Language Models Really Understand Cell Biology?

Fan Zhang, Tianyu Liu, Zhihong Zhu, Hao Wu, Haixin Wang, Donghao Zhou, Yefeng Zheng, Kun Wang, Xian Wu, Pheng-Ann Heng

机构 * CUHK(香港中文大学) Yale University(耶鲁大学) Peking University(北京大学) Tsinghua University(清华大学) UCLA(加州大学洛杉矶分校) Westlake University(西湖大学) NTU(南洋理工大学) Tencent(腾讯)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17888 2025-05-14 eess.SP cs.AI cs.LG 88%

RadioLLM: Introducing Large Language Model into Cognitive Radio via Hybrid Prompt and Token Reprogrammings

Shuai Chen, Yong Zu, Zhixi Feng, Shuyuan Yang, Mengchang Li

机构 * School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments This work has been submitted to the IEEE JSAC for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05063 2025-05-09 cs.LG cs.CL 88%

CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts

Manik Sheokand, Parth Sawant

机构 * Department of Computer Science(计算机科学系) Chandigarh University Punjab(昌迪加尔大学旁遮普) Department of Technology Management and Innovation(技术管理与创新系) New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16646 2025-05-07 cs.CL cs.AI 88%

Incoherent Probability Judgments in Large Language Models

Jian-Qiao Zhu, Thomas L. Griffiths

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Department of Psychology and Computer Science(心理学与计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Journal ref CogSci 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11455 2025-05-06 cs.CL cs.AI 88%

Towards Better Multi-task Learning: A Framework for Optimizing Dataset Combinations in Large Language Models

Zaifu Zhan, Rui Zhang

机构 * Department of Electrical and Computer Engineering, University of Minnesota(电气与计算机工程系,明尼苏达大学) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(计算健康科学部,外科系,明尼苏达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures, 4 tables

Journal ref Findings of the Association for Computational Linguistics: NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05314 2025-05-06 cs.IT cs.AI cs.LG math.IT 88%

Tele-LLMs: A Series of Specialized Large Language Models for Telecommunications

Ali Maatouk, Kenny Chirino Ampudia, Rex Ying, Leandros Tassiulas

机构 * Yale University(耶鲁大学) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03302 2025-05-06 cs.CL cs.AI 88%

Noise Augmented Fine Tuning for Mitigating Hallucinations in Large Language Models

Afshin Khadangi, Amir Sartipi, Igor Tchappi, Ramin Bahmani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07452 2025-05-06 q-fin.RM cs.AI cs.CE cs.LG q-fin.PM 88%

RiskLabs: Predicting Financial Risk Using Large Language Model based on Multimodal and Multi-Sources Data

Yupeng Cao, Zhi Chen, Prashant Kumar, Qingyun Pei, Yangyang Yu, Haohang Li, Fabrizio Dimino, Lorenzo Ausiello, K. P. Subbalakshmi, Papa Momar Ndiaye

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13947 2025-05-02 cs.CL cs.AI 88%

A Comprehensive Survey on Integrating Large Language Models with Knowledge-Based Methods

Wenli Yang, Lilian Some, Michael Bain, Byeong Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02911 2025-04-29 cs.CL cs.AI 88%

Noiser: Bounded Input Perturbations for Attributing Large Language Models

Mohammad Reza Ghasemi Madani, Aryo Pradipta Gema, Gabriele Sarti, Yu Zhao, Pasquale Minervini, Andrea Passerini

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) CLCG, University of Groningen(格罗宁根大学CLCG中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08813 2025-04-24 cs.CL cs.LG 88%

Comparative Performance Evaluation of Large Language Models for Extracting Molecular Interactions and Pathway Knowledge

Gilchan Park, Byung-Jun Yoon, Xihaier Luo, Vanessa López-Marrero, Shinjae Yoo, Shantenu Jha

机构 * Computing and Data Sciences(计算与数据科学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21131 2025-04-23 cs.AI cs.CL 88%

Towards Unifying Evaluation of Counterfactual Explanations: Leveraging Large Language Models for Human-Centric Assessments

Marharyta Domnich, Julius Välja, Rasmus Moorits Veski, Giacomo Magnifico, Kadi Tulver, Eduard Barbu, Raul Vicente

机构 * AAAI-25

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments This paper extends the AAAI-2025 version by including the Appendix

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(15), 16308-16316, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14690 2025-04-22 cs.CL cs.AI 88%

FarsEval-PKBETS: A new diverse benchmark for evaluating Persian large language models

Mehrnoush Shamsfard, Zahra Saaberi, Mostafa Karimi manesh, Seyed Mohammad Hossein Hashemi, Zahra Vatankhah, Motahareh Ramezani, Niki Pourazin, Tara Zare, Maryam Azimi, Sarina Chitsaz, Sama Khoraminejad, Morteza Mahdavi Mortazavi, Mohammad Mahdi Chizari, Sahar Maleki, Seyed Soroush Majd, Mostafa Masumi, Sayed Ali Musavi Khoeini, Amir Mohseni, Sogol Alipour

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 24 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12911 2025-04-22 cs.CL cs.AI 88%

Benchmarking Multi-National Value Alignment for Large Language Models

Weijie Shi, Chengyi Ju, Chengzhong Liu, Jiaming Ji, Jipeng Zhang, Ruiyuan Zhang, Jia Zhu, Jiajie Xu, Yaodong Yang, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11986 2025-04-22 cs.CL cs.AI 88%

Large Language Models as Quasi-crystals: Coherence Without Repetition in Generative Text

Jose Manuel Guevara-Vela

机构 * School of Engineering and Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments The discussion was restructured to add limitations to the analogy and other clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13186 2025-04-21 eess.IV cs.AI cs.CV cs.LG 88%

Advanced Deep Learning and Large Language Models: Comprehensive Insights for Cancer Detection

Yassine Habchi, Hamza Kheddar, Yassine Himeur, Adel Belouchrani, Erchin Serpedin, Fouad Khelifi, Muhammad E. H. Chowdhury

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Journal ref Image and Vision Computing, Elsevier, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏