arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-06 至 2025-08-06 共收录 55 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2502.09053 2025-08-06 cs.AI cs.GT cs.LG 90%

Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers

Haoran Sun, Yusen Wu, Peng Wang, Wei Chen, Yukun Cheng, Xiaotie Deng, Xu Chu

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学) School of Business, Jiangnan University(商学院,江南大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments A shorter conference version is published in IJCAI 2025, titled 'Game Theory Meets Large Language Models: A Systematic Survey'

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03470 2025-08-06 cs.SE 90%

On the Evaluation of Large Language Models in Multilingual Vulnerability Repair

Dong wang, Junji Yu, Honglin Shu, Michael Fu, Chakkrit Tantithamthavorn, Yasutaka Kamei, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03406 2025-08-06 cs.AI 89%

Multi-Objective Infeasibility Diagnosis for Routing Problems Using Large Language Models

Kai Li, Ruihao Zheng, Xinye Hao, Zhenkun Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05286 2025-08-06 cs.PL cs.CL 89%

LLM4Decompile: Decompiling Binary Code with Large Language Models

Hanzhuo Tan, Qi Luo, Jing Li, Yuqun Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系) Department of Computing, The Hong Kong Polytechnic University, HKSAR, China(香港理工大学计算机系) Research Centre for Data Science & Artificial Intelligence(数据科学与人工智能研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04543 2025-08-06 cs.HC 89%

The Impostor is Among Us: Can Large Language Models Capture the Complexity of Human Personas?

Christopher Lazik, Christopher Katins, Charlotte Kauter, Jonas Jakob, Caroline Jay, Lars Grunske, Thomas Kosch

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03558 2025-08-06 cs.PL 87%

SAGE-HLS: Syntax-Aware AST-Guided LLM for High-Level Synthesis Code Generation

M Zafir Sadik Khan, Nowfel Mashnoor, Mohammad Akyash, Kimia Azar, Hadi Kamali

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to the IEEE International Conference on Computer Design (ICCD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03426 2025-08-06 cs.CV cs.AI cs.LG 86%

R2GenKG: Hierarchical Multi-modal Knowledge Graph for LLM-based Radiology Report Generation

Futian Wang, Yuhan Qiao, Xiao Wang, Fuling Wang, Yuxiang Zhang, Dengdi Sun

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03262 2025-08-06 cs.CL cs.AI 86%

Pay What LLM Wants: Can LLM Simulate Economics Experiment with 522 Real-human Persona?

Junhyuk Choi, Hyeonchu Park, Haemin Lee, Hyebeen Shin, Hyun Joung Jin, Bugeun Kim

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03092 2025-08-06 cs.AI cs.CL 86%

Toward Verifiable Misinformation Detection: A Multi-Tool LLM Agent Framework

Zikun Cui, Tianyi Huang, Chia-En Chiang, Cuiqianhe Du

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05653 2025-08-06 cs.HC cs.AI 85%

The influence of persona and conversational task on social interactions with a LLM-controlled embodied conversational agent

Leon O. H. Kroczek, Alexander May, Selina Hettenkofer, Andreas Ruider, Bernd Ludwig, Andreas Mühlberger

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03097 2025-08-06 cs.CR cs.AI 85%

VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs

Zixuan Gu, Qiufeng Fan, Long Sun, Yang Liu, Xiaojun Ye

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 10 figures, published in KDD2025

Journal ref In Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD'25), August 3-7, 2025, Toronto, ON, Canada. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02827 2025-08-06 cs.SE cs.AI 85%

Automated Validation of LLM-based Evaluators for Software Engineering Artifacts

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Rami Katan, Alice Podolsky, Orna Raz, Avi Ziv

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14220 2025-08-06 cs.LG 85%

Enhancing Spectral Graph Neural Networks with LLM-Predicted Homophily

Kangkang Lu, Yanhua Yu, Zhiyong Huang, Tat-Seng Chua

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15882 2025-08-06 cs.CV cs.AI cs.CL cs.LG 85%

Document Haystack: A Long Context Multimodal Image/Document Understanding Vision LLM Benchmark

Goeric Huybrechts, Srikanth Ronanki, Sai Muralidhar Jayanthi, Jack Fitzgerald, Srinivasan Veeravanallur

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03292 2025-08-06 cs.CL cs.AI 84%

Investigating Gender Bias in LLM-Generated Stories via Psychological Stereotypes

Shahed Masoudian, Gustavo Escobedo, Hannah Strauss, Markus Schedl

机构 * Johannes Kepler University (JKU)(约翰内斯·开普勒大学) Linz Institute of Technology (LIT)(林茨技术研究所) University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19177 2025-08-06 cs.LG cs.CL cs.CY 84%

Evidence Is All You Need: Ordering Imaging Studies via Language Model Alignment with the ACR Appropriateness Criteria

Michael S. Yao, Allison Chae, Charles E. Kahn, Walter R. Witschey, James C. Gee, Hersh Sagreiya, Osbert Bastani

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 15 pages main text, 4 figures, 1 table

Journal ref Commun Med 5, 332 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03622 2025-08-06 cs.AI 83%

Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework

Jialin Li, Jinzhe Li, Gengxu Li, Yi Chang, Yuan Wu

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02886 2025-08-06 cs.CL 83%

Coherent Multimodal Reasoning with Iterative Self-Evaluation for Vision-Language Models

Wenjie Luo, Ruocheng Li, Shanshan Zhu, Julian Perry

机构 * Fujian University of Technology(福建工程大学) Delta University for Science and Technology(科技大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09672 2025-08-06 cs.CV cs.AI 83%

CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models

Alexis Roger, Prateek Humane, Daniel Z. Kaplan, Kshitij Gupta, Qi Sun, George Adamopoulos, Jonathan Siu Chi Lim, Quentin Anthony, Edwin Fennell, Irina Rish

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Tokyo Institute of Technology(东京技术大学) McGill University(麦吉尔大学) EleutherAI University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03488 2025-08-06 cs.AI cs.SE 81%

VQA support to Arabic Language Learning Educational Tool

Khaled Bachir Delassi, Lakhdar Zeggane, Hadda Cherroun, Abdelhamid Haouhat, Kaoutar Bouzouad

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03215 2025-08-06 cs.SE 80%

A System Model Generation Benchmark from Natural Language Requirements

Dongming Jin, Zhi Jin, Linyu Li, Zheng Fang, Jia Li, Xiaohong Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02808 2025-08-06 cs.CL cs.AI cs.LG 80%

Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation

Radhika Dua, Young Joon, Kwon, Siddhant Dogra, Daniel Freedman, Diana Ruan, Motaz Nashawaty, Danielle Rigau, Daniel Alexander Alber, Kang Zhang, Kyunghyun Cho, Eric Karl Oermann

机构 * New York University(纽约大学) NYU Langone Health(纽约大学兰格医学中心) Genentech(基因泰克) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Wenzhou Medical University(温州医科大学) Macau University of Science and Technology(澳门科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02890 2025-08-06 cs.CV cs.CL 79%

VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction

Rongxin Jiang, Robert Long, Chenghao Gu, Mingrui Yan

机构 * Heilongjiang University of Science and Technology(黑龙江科技大学) University of Padua(帕多瓦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09882 2025-08-06 cs.LG 79%

AdaBrain-Bench: Benchmarking Brain Foundation Models for Brain-Computer Interface Applications

Jiamin Wu, Zichen Ren, Junyu Wang, Pengyu Zhu, Yonghao Song, Mianxin Liu, Qihao Zheng, Lei Bai, Wanli Ouyang, Chunfeng Song

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) North China Electric Power University(华北电力大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23350 2025-08-06 cs.AI 79%

A Survey of WebAgents: Towards Next-Generation AI Agents for Web Automation with Large Foundation Models

Liangbo Ning, Ziran Liang, Zhuohang Jiang, Haohao Qu, Yujuan Ding, Wenqi Fan, Xiao-yong Wei, Shanru Lin, Hui Liu, Philip S. Yu, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) Michigan State University(密歇根州立大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments This is the long version of the corresponding survey paper accepted by KDD 2025. The tutorial and corresponding slides are available at https://biglemon-ning.github.io/WebAgents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11859 2025-08-06 cs.CV cs.CL 79%

Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics

Wenrui Xu, Dalin Lyu, Weihang Wang, Jie Feng, Chen Gao, Yong Li

机构 * School of Architecture, Tsinghua University(清华大学建筑学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. Volume 1: Long Papers (2025) 11571-11590

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01131 2025-08-06 cs.CL 79%

A Comprehensive Evaluation of Semantic Relation Knowledge of Pretrained Language Models and Humans

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Takenobu Tokunaga

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Journal ref Language Resources & Evaluation (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04856 2025-08-06 cs.CL cs.AI 79%

M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs

Junwoo Ha, Hyunjun Kim, Sangyoon Yu, Haon Park, Ashkan Yousefpour, Yuna Park, Suhyun Kim

机构 * AIM Intelligence(AIM智能研究所) University of Seoul(首尔大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University(首尔国立大学) Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) Kyung Hee University(庆熙大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 (Main Track). Camera-ready version

Journal ref Proc. ACL 2025 (Vol. 1: Long Papers), pp. 16489-16507, Vienna, Austria, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03298 2025-08-06 cs.SE 78%

GUI-ReRank: Enhancing GUI Retrieval with Multi-Modal LLM-based Reranking

Kristian Kolthoff, Felix Kretzer, Christian Bartelt, Alexander Maedche, Simone Paolo Ponzetto

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03194 2025-08-06 cs.LG 77%

Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies

Yi Ma, Hongyao Tang, Chenjun Xiao, Yaodong Yang, Wei Wei, Jianye Hao, Jiye Liang

机构 * School of Computer and Information Technology, Shanxi University(山西大学计算机与信息技术学院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) School of Data Science, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)数据科学学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏