arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2507.05123 2025-07-08 cs.CL cs.AI 88%

An Evaluation of Large Language Models on Text Summarization Tasks Using Prompt Engineering Techniques

Walid Mohamed Aly, Taysir Hassan A. Soliman, Amr Mohamed AbdelAziz

机构 * Information Systems Department, Faculty of Computers and Information, Assiut University(计算机与信息学院信息系统系,阿西乌特大学) Information Systems Department, Faculty of Computers and Artificial Intelligence, Beni-Suef University(计算机与人工智能学院信息系统系,班伊-苏夫大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments This manuscript is an extended version of the work accepted for publication in the International Journal of Advanced Computer Science and Applications (IJACSA), Volume 16, Issue 6, June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03811 2025-07-08 cs.AI cs.CY cs.LG 88%

Leveraging Large Language Models for Tacit Knowledge Discovery in Organizational Contexts

Gianlucca Zuin, Saulo Mastelini, Túlio Loures, Adriano Veloso

机构 * Universidade Federal de Minas Gerais (UFMG)(巴西联邦大学矿务学院) Instituto de Ciências Matemáticas e de Computação, Universidade de São Paulo (ICMC-USP)(圣保罗大学数学与计算机科学研究所) Kunumi(Kunumi公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments 8 pages, 4 figures, accepted to International Joint Conference on Neural Networks (IJCNN) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23101 2025-07-08 cs.CL cs.AI cs.CY 88%

From Individuals to Interactions: Benchmarking Gender Bias in Multimodal Large Language Models from the Lens of Social Relationship

Yue Xu, Wenjie Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03543 2025-07-08 cs.CL cs.AI 88%

H2HTalk: Evaluating Large Language Models as Emotional Companion

Boyang Wang, Yalun Wu, Hongcheng Guo, Zhoujun Li

机构 * CCSE, Beihang University, Beijing, China(计算机科学与电子学院,北航,北京,中国) SCST, Beihang University, Beijing, China(软件学院,北航,北京,中国) Shenzhen Intelligent Strong Technology Co.,Ltd.(深圳智能强科技有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03056 2025-07-08 cs.LG cs.AI 88%

Automated Grading of Students' Handwritten Graphs: A Comparison of Meta-Learning and Vision-Large Language Models

Behnam Parsaeifard, Martin Hlosta, Per Bergamin

机构 * Institute for Research in Open-, Distance- and eLearning, Swiss Distance University of Applied Sciences(开放、远程和e学习研究学院,瑞士应用科学远程大学) North-West University(北开普敦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11764 2025-07-08 cs.CL cs.AI 88%

Towards Universal Semantics With Large Language Models

Raymond Baartmans, Matthew Raffel, Rahul Vikram, Aiden Deringer, Lizhong Chen

机构 * Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17352 2025-07-03 cs.CL cs.AI 88%

Towards Safety Evaluations of Theory of Mind in Large Language Models

Tatsuhiro Aoshima, Mitsuaki Akiyama

机构 * NTT(日本电报电话株式会社)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05443 2025-07-03 cs.CL cs.AI 88%

A survey of textual cyber abuse detection using cutting-edge language models and large language models

Jose A. Diaz-Garcia, Joao Paulo Carvalho

机构 * Department of Computer Science and A.I, University of Granada(计算机科学与人工智能系,格拉纳达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 37 pages, under review in WIREs Data Mining and Knowledge Discovery

Journal ref Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery (2025), 15(3), e70029

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19753 2025-07-01 cs.CL cs.AI 88%

Arabic Dialect Classification using RNNs, Transformers, and Large Language Models: A Comparative Analysis

Omar A. Essameldin, Ali O. Elbeih, Wael H. Gomaa, Wael F. Elsersy

机构 * Faculty of Computer Science MSA Univeristy(计算机科学学院 MSA大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Email Typo Update

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22496 2025-07-01 cs.CY cs.AI cs.CL 88%

Mitigating Gambling-Like Risk-Taking Behaviors in Large Language Models: A Behavioral Economics Approach to AI Safety

Y. Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21783 2025-06-30 cs.CL cs.AI 88%

Evaluating List Construction and Temporal Understanding capabilities of Large Language Models

Alexandru Dumitru, V Venktesh, Adam Jatowt, Avishek Anand

机构 * Prosus Delft University of Technology(代尔夫特理工大学) University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ICTIR 2025 co-located with SIGIR 2025, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21578 2025-06-30 cs.CL cs.AI 88%

HealthQA-BR: A System-Wide Benchmark Reveals Critical Knowledge Gaps in Large Language Models

Andrew Maranhão Ventura D'addario

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04931 2025-06-30 cs.CR cs.AI cs.CL 88%

Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency

Shiji Zhao, Ranjie Duan, Fengxiang Wang, Chi Chen, Caixin Kang, Shouwei Ruan, Jialing Tao, YueFeng Chen, Hui Xue, Xingxing Wei

机构 * Institution1(机构1) Institution2(机构2)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13214 2025-06-30 q-fin.CP cs.AI cs.CE cs.CL 88%

EUR-USD Exchange Rate Forecasting Based on Information Fusion with Large Language Models and Deep Learning Methods

Hongcheng Ding, Xuanze Zhao, Ruiting Deng, Shamsul Nahar Abdullah, Deshinta Arrova Dewi

机构 * INTI International University(INTI国际大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19468 2025-06-25 cs.CL cs.AI 88%

MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages

Wenhan Han, Yifan Zhang, Zhixun Chen, Binbin Liu, Haobin Lin, Bingni Zhang, Taifeng Wang, Mykola Pechenizkiy, Meng Fang, Yin Zheng

机构 * Eindhoven University of Technology(埃因霍温理工大学) ByteDance(字节跳动) University of Liverpool(利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18045 2025-06-24 cs.CY cs.AI cs.CL 88%

The Democratic Paradox in Large Language Models' Underestimation of Press Freedom

I. Loaiza, R. Vestrelli, A. Fronzetti Colladon, R. Rigobon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14911 2025-06-23 cs.CL cs.AI 88%

Batayan: A Filipino NLP benchmark for evaluating Large Language Models

Jann Railey Montalan, Jimson Paulo Layacan, David Demitri Africa, Richell Isaiah Flores, Michael T. Lopez, Theresa Denise Magsajo, Anjanette Cayabyab, William Chandra Tjhi

机构 * AI Singapore(AI新加坡) National University of Singapore(新加坡国立大学) Ateneo de Manila University(马尼拉大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10604 2025-06-18 cs.CV cs.AI cs.CL 88%

When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis

Ruixuan Zhang, Beichen Wang, Juexiao Zhang, Zilin Bian, Chen Feng, Kaan Ozbay

机构 * New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13313 2025-06-17 cs.CL cs.AI econ.GN q-fin.EC 88%

Large Language Models as 'Hidden Persuaders': Fake Product Reviews are Indistinguishable to Humans and Machines

Weiyao Meng, John Harvey, James Goulding, Chris James Carter, Evgeniya Lukinova, Andrew Smith, Paul Frobisher, Mina Forrest, Georgiana Nica-Avram

机构 * N/LAB, Nottingham University Business School, University of Nottingham, UK(N/LAB,诺丁汉大学商学院,诺丁汉大学,英国) Haydn Green Institute for Entrepreneurship and Innovation, University of Nottingham, UK(创业与创新研究院,诺丁汉大学,英国) Strategic Innovation Ltd, UK(战略创新有限公司,英国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12538 2025-06-17 cs.CL cs.AI 88%

RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking

Shuo Yang, Yuqin Dai, Guoqing Wang, Xinran Zheng, Jinfeng Xu, Jinze Li, Zhenzhe Ying, Weiqiang Wang, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20947 2025-06-17 cs.CL cs.AI 88%

OR-Bench: An Over-Refusal Benchmark for Large Language Models

Justin Cui, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025, we thank everyone for their valuable suggestions and feedback!

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11114 2025-06-16 cs.CL cs.AI 88%

KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations

Junyu Liu, Kaiqi Yan, Tianyang Wang, Qian Niu, Momoko Nagai-Tanima, Tomoki Aoyama

机构 * Kyoto University(京都大学) The Hong Kong University of Science and Technology(香港科技大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11017 2025-06-16 cs.CL cs.AI cs.PF 88%

TeleEval-OS: Performance evaluations of large language models for operations scheduling

Yanyan Wang, Yingying Wang, Junli Liang, Yin Xu, Yunlong Liu, Yiming Xu, Zhengwang Jiang, Zhehe Li, Fei Li, Long Zhao, Kuang Xu, Qi Song, Xiangyang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00598 2025-06-12 cs.CL cs.CR cs.CY cs.LG 88%

Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Bang An, Sicheng Zhu, Ruiyi Zhang, Michael-Andrei Panaitescu-Liess, Yuancheng Xu, Furong Huang

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Adobe Research(Adobe 研究院) Capital One(Capital One 公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06528 2025-06-10 cs.CL cs.AI cs.HC 88%

Epistemic Integrity in Large Language Models

Bijean Ghafouri, Shahrad Mohammadzadeh, James Zhou, Pratheeksha Nair, Jacob-Junqi Tian, Hikaru Tsujimura, Mayank Goel, Sukanya Krishna, Reihaneh Rabbany, Jean-François Godbout, Kellin Pelrine

机构 * University of Southern California(南加州大学) McGill University(麦吉尔大学) UC Berkeley(加州大学伯克利分校) Vector Institute(向量研究所) Cardiff University(卡迪夫大学) University College London(伦敦大学学院) IIIT Hyderabad(海得拉巴印度理工学院) Harvard University(哈佛大学) Université de Montréal(蒙特利尔大学) Mila

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11682 2025-06-10 cs.CL cs.AI cs.CR 88%

Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models

Shangqing Tu, Zhuoran Pan, Wenxuan Wang, Zhexin Zhang, Yuliang Sun, Jifan Yu, Hongning Wang, Lei Hou, Juanzi Li

机构 * Tsinghua Univerisity(清华大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港理工大学) Beihang Univerisity(北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD 2025 research track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10477 2025-06-10 cs.LG cond-mat.mtrl-sci cs.AI 88%

Benchmarking large language models for materials synthesis: the case of atomic layer deposition

Angel Yanguas-Gil, Matthew T. Dearing, Jeffrey W. Elam, Jessica C. Jones, Sungjoon Kim, Adnan Mohammad, Chi Thang Nguyen, Bratin Sengupta

机构 * Applied Materials Division, Argonne National Laboratory(阿贡国家实验室应用材料部门) Business and Information Systems, Argonne National Laboratory(阿贡国家实验室商业与信息系统部门) Northwestern Center for Water Research, Northwestern University(西北大学水研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05984 2025-06-09 eess.AS cs.AI cs.CL 88%

Audio-Aware Large Language Models as Judges for Speaking Styles

Cheng-Han Chiang, Xiaofei Wang, Chung-Ching Lin, Kevin Lin, Linjie Li, Radu Kopetz, Yao Qian, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08811 2025-06-09 cs.CR cs.AI cs.CL 88%

PoisonBench: Assessing Large Language Model Vulnerability to Data Poisoning

Tingchen Fu, Mrinank Sharma, Philip Torr, Shay B. Cohen, David Krueger, Fazl Barez

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at ICML 2025. Tingchen Fu and Fazl Barez are core research contributors

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11014 2025-06-09 cs.LG cs.AI cs.AR cs.PL cs.SE 88%

CoopetitiveV: Leveraging LLM-powered Coopetitive Multi-Agent Prompting for High-quality Verilog Generation

Zhendong Mi, Renming Zheng, Haowen Zhong, Yue Sun, Seth Kneeland, Sayan Moitra, Ken Kutzer, Zhaozhuo Xu Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Washington(华盛顿大学) Amazon(亚马逊) SambaNova Systems(SambaNova系统)

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏