arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2506.02838 2025-06-04 cs.AI econ.GN q-fin.EC 88%

TaxAgent: How Large Language Model Designs Fiscal Policy

Jizhou Wang, Xiaodan Fang, Lei Huang, Yongfeng Huang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) Jiangxi Normal University(江西师范大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted as oral presentation at ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02073 2025-06-04 cs.SE cs.AI 88%

Flow2Code: Evaluating Large Language Models for Flowchart-based Code Generation Capability

Mengliang He, Jiayi Zeng, Yankai Jiang, Wei Zhang, Zeming Liu, Xiaoming Shi, Aimin Zhou

机构 * East China Normal University(华东师范大学) Shanghai AI Lab(上海人工智能实验室) Beihang University(北航大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12562 2025-06-04 cs.CL cs.CR cs.MM 88%

SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings

Weikai Lu, Hao Peng, Huiping Zhuang, Cen Chen, Ziqian Zeng

机构 * South China University of Technology, China(华南理工大学) Beihang University, China(北航) Pazhou Laboratory, China(琶洲实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted in ACL 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15762 2025-06-04 cs.CL 88%

XTRUST: On the Multilingual Trustworthiness of Large Language Models

Yahan Li, Yi Wang, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学(广州)) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University, China(未来科学国际中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15587 2025-06-04 cs.AI 88%

Large language models for crowd decision making based on prompt design strategies using ChatGPT: models, analysis and challenges

David Herrera-Poyatos, Cristina Zuheros, Rosana Montes, Francisco Herrera

机构 * Department of Computer Sciences and Artificial Intelligence, and the Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(计算机科学与人工智能系,加泰罗尼亚数据科学与计算智能研究所(DaSCI)格拉纳达大学) Department of Software Engineering, and the Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(软件工程系,加泰罗尼亚数据科学与计算智能研究所(DaSCI)格拉纳达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00973 2025-06-03 cs.CL 88%

XGUARD: A Graded Benchmark for Evaluating Safety Failures of Large Language Models on Extremist Content

Vadivel Abishethvarman, Bhavik Chandna, Pratik Jalan, Usman Naseem

机构 * Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) UC San Diego(圣地亚哥大学) Macquarie University(麦考瑞大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16167 2025-06-03 cs.SE cs.CL 88%

CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models

Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments The paper is published in Findings of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16166 2025-06-03 cs.CL 88%

Robust Privacy Amidst Innovation with Large Language Models Through a Critical Assessment of the Risks

Yao-Shun Chuang, Atiquer Rahman Sarkar, Yu-Chun Hsu, Noman Mohammed, Xiaoqian Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 13 pages, 4 figures, 1 table, 1 supplementary, under review

Journal ref Journal of the American Medical Informatics Association, Volume 32, Issue 5, May 2025, Pages 885-892

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02157 2025-06-03 cs.CL 88%

Personalized Graph-Based Retrieval for Large Language Models

Steven Au, Cameron J. Dimacali, Ojasmitha Pedirappagari, Namyong Park, Franck Dernoncourt, Yu Wang, Nikos Kanakaris, Hanieh Deilamsalehy, Ryan A. Rossi, Nesreen K. Ahmed

机构 * University of California Santa Cruz(加州大学圣克ruz分校) Meta AI Adobe Research(Adobe研究) University of Oregon(俄勒冈大学) University of Southern California(南加州大学) Cisco AI Research(思科人工智能研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13533 2025-06-03 cs.CL 88%

Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models

Jinyang Wu, Shuai Zhang, Feihu Che, Mingkuan Feng, Chuyuan Zhang, Pengpeng Shao, Jianhua Tao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24712 2025-06-02 cs.CL cs.CY 88%

HESEIA: A community-based dataset for evaluating social biases in large language models, co-designed in real school settings in Latin America

Guido Ivetta, Marcos J. Gomez, Sofía Martinelli, Pietro Palombini, M. Emilia Echeveste, Nair Carolina Mazzeo, Beatriz Busaniche, Luciana Benotti

机构 * First Author Affiliation(第一作者机构) Second Author Affiliation(第二作者机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24258 2025-06-02 cs.AI 88%

FABLE: A Novel Data-Flow Analysis Benchmark on Procedural Text for Large Language Model Evaluation

Vishal Pallagani, Nitin Gupta, John Aydin, Biplav Srivastava

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00222 2025-06-02 cs.CL 88%

Can Large Language Models Address Open-Target Stance Detection?

Abu Ubaida Akash, Ahmed Fahmy, Amine Trabelsi

机构 * Department of Computer Science, Université de Sherbrooke(计算机科学系,Sherbrooke大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted; ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23793 2025-06-02 cs.CR cs.AI 88%

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Baolin Zheng, Guanlin Chen, Hongqiong Zhong, Qingyang Teng, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23713 2025-05-30 cs.CL 88%

SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models

Zixiang Xu, Yanbo Wang, Yue Huang, Jiayi Ye, Haomin Zhuang, Zirui Song, Lang Gao, Chenxi Wang, Zhaorun Chen, Yujun Zhou, Sixian Li, Wang Pan, Yue Zhao, Jieyu Zhao, Xiangliang Zhang, Xiuying Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Code available at https://github.com/xzx34/SocialMaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23140 2025-05-30 cs.CL 88%

Enhancing Large Language Models'Machine Translation via Dynamic Focus Anchoring

Qiuyu Ding, Zhiqiang Cao, Hailong Cao, Tiejun Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16555 2025-05-30 cs.CL 88%

Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

Yanxu Mao, Peipei Liu, Tiehan Cui, Zhaoteng Yan, Congying Liu, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05701 2025-05-28 cs.RO cs.AI cs.HC 88%

Are Large Language Models Aligned with People's Social Intuitions for Human-Robot Interactions?

Lennart Wachowiak, Andrew Coles, Oya Celiktutan, Gerard Canal

机构 * King’s College London(伦敦国王学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19973 2025-05-27 cs.CR cs.AI 88%

DFIR-Metric: A Benchmark Dataset for Evaluating Large Language Models in Digital Forensics and Incident Response

Bilel Cherif, Tamas Bisztray, Richard A. Dubniczky, Aaesha Aldahmani, Saeed Alshehhi, Norbert Tihanyi

机构 * Technology Innovation Institute(技术创新研究所) University of Oslo(奥斯陆大学) Eötvös Loránd University(埃斯特哈兹洛朗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19402 2025-05-27 cs.AI cs.CY 88%

Recalibrating the Compass: Integrating Large Language Models into Classical Research Methods

Tai-Quan Peng, Xuzhen Yang

机构 * Department of Communication(通讯系) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14744 2025-05-27 cs.CV cs.AI 88%

RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models

Junyao Ge, Xu Zhang, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University(电子工程学院,西安电子科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Published on ISPRS, minor typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13211 2025-05-27 cs.CL 88%

Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation

Dongjin Kang, Sunghwan Kim, Taeyoon Kwon, Seungjun Moon, Hyunsouk Cho, Youngjae Yu, Dongha Lee, Jinyoung Yeo

机构 * Yonsei University(延世大学) Ajou University(安江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL 2024, Outstanding Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18168 2025-05-27 cs.LG cs.GR 88%

Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation

Feifan Wang, Tengfei Song, Minggui He, Chang Su, Zhanglin Wu, Hao Yang, Wenming Zheng, Osamu Yoshie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15234 2025-05-23 cs.AI 88%

Bias Amplification: Large Language Models as Increasingly Biased Media

Ze Wang, Zekun Wu, Jeremy Zhang, Xin Guan, Navya Jain, Skylar Lu, Saloni Gupta, Adriano Koshiyama

机构 * Holistic AI University College London(伦敦大学学院) Emory University(埃默里大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Submitted to ACL ARR May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06957 2025-05-22 eess.AS cs.CL cs.CY 88%

Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models

Yi-Cheng Lin, Tzu-Quan Lin, Chih-Kai Yang, Ke-Han Lu, Wei-Chih Chen, Chun-Yi Kuan, Hung-yi Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref 2024 IEEE Spoken Language Technology Workshop (SLT), Macao, 2024, pp. 439-446

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21277 2025-05-22 cs.AI 88%

Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models

Guanghao Zhou, Panjia Qiu, Cen Chen, Jie Wang, Zheming Yang, Jian Xu, Minghui Qiu

机构 * East China Normal University(东华师范大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07179 2025-05-22 cs.CL cs.IR 88%

Prompt Perturbation in Retrieval-Augmented Generation based Large Language Models

Zhibo Hu, Chen Wang, Yanfeng Shu, Helen, Paik, Liming Zhu

机构 * The University of New South Wales(新南威尔士大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 12 pages, 9 figures

Journal ref KDD '24: The 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining Barcelona Spain August 25 - 29, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14438 2025-05-21 cs.SD cs.CL eess.AS 88%

S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models

Yuanbo Fang, Haoze Sun, Jun Liu, Tao Zhang, Zenan Zhou, Weipeng Chen, Xiaofen Xing, Xiangmin Xu

机构 * South China University of Technology(华南理工大学) Baichuan Inc(百川科技)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02506 2025-05-21 cs.CL 88%

ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Junjie Ye, Zhengyin Du, Xuesong Yao, Weijian Lin, Yufei Xu, Zehui Chen, Zaiyuan Wang, Sining Zhu, Zhiheng Xi, Siyu Yuan, Tao Gui, Qi Zhang, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学) ByteDance(字节跳动) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11936 2025-05-21 cs.CL 88%

A Survey of Mathematical Reasoning in the Era of Multimodal Large Language Model: Benchmark, Method & Challenges

Yibo Yan, Jiamin Su, Jianxiang He, Fangteng Fu, Xu Zheng, Yuanhuiyi Lyu, Kun Wang, Shen Wang, Qingsong Wen, Xuming Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by The 63rd Annual Meeting of the Association for Computational Linguistics (ACL Findings 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏