arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32599 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32599 篇

2508.06225 2025-08-19 cs.AI 85%

Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution

Zailong Tian, Zhuoheng Han, Yanzhe Chen, Haozhe Xu, Xi Yang, Richeng Xuan, Houfeng Wang, Lizi Liao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11707 2025-08-19 cs.CY cs.AI 85%

Listening with Language Models: Using LLMs to Collect and Interpret Classroom Feedback

Sai Siddartha Maram, Ulia Zaman, Magy Seif El-Nasr

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11061 2025-08-18 cs.CL 85%

BIPOLAR: Polarization-based granular framework for LLM bias evaluation

Martin Pavlíček, Tomáš Filip, Petr Sosík

机构 * Institute for Research and Applications of Fuzzy Modeling, University of Ostrava(模糊建模研究与应用研究所,奥斯特拉瓦大学) Institute of Computer Science, Faculty of Philosophy and Science, Silesian University in Opava(计算机科学研究所,哲学与科学学院,奥帕瓦西里西亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11736 2025-08-18 cs.CL 85%

Personalized LLM for Generating Customized Responses to the Same Query from Different Users

Hang Zeng, Chaoyue Niu, Fan Wu, Chengfei Lv, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by CIKM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09515 2025-08-14 cs.CL 85%

LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data Augmentation

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS – New Technologies for the Information Society University of West Bohemia in Pilsen, Faculty of Applied Sciences(新信息技术社会大学西波希米亚大学皮尔森分校应用科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics; Volume 1: Long Papers (ACL 2025). Official version: https://aclanthology.org/2025.acl-long.41/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09124 2025-08-13 cs.CL 85%

OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows

Weixuan Wang, Dongge Han, Daniel Madrigal Diaz, Jin Xu, Victor Rühle, Saravan Rajmohan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17066 2025-08-12 cs.CR cs.AI 85%

Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration

Tatia Tsmindashvili, Ana Kolkhidashvili, Dachi Kurtskhalia, Nino Maghlakelidze, Elene Mekvabishvili, Guram Dentoshvili, Orkhan Shamilov, Zaal Gachechiladze, Steven Saporta, David Dachi Choladze

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref IEEE Access, vol. 13, pp. 134976-134988, Jul. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06467 2025-08-11 cs.LG 85%

LLM Unlearning using Gradient Ratio-Based Influence Estimation and Noise Injection

Ameya Anjarlekar, Sandeep Pombra

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 Pages, 3 Figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04720 2025-08-08 cs.AI 85%

Who is a Better Player: LLM against LLM

Yingjie Zhou, Jiezhang Cao, Farong Wen, Li Xu, Yanwei Jiang, Jun Jia, Ronghui Li, Xiaohong Liu, Yu Zhou, Xiongkuo Min, Jie Guo, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) PengCheng Laboratory(鹏城实验室) Harvard Medical School(哈佛医学院) Shanghai AI Laboratory(上海人工智能实验室) China University of Mining and Technology(中国矿业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03751 2025-08-08 cs.CL cs.SD eess.AS 85%

Recent Advances in Speech Language Models: A Survey

Wenqian Cui, Dianzhi Yu, Xiaoqi Jiao, Ziqiao Meng, Guangyan Zhang, Qichao Wang, Yiwen Guo, Irwin King

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) LIGHTSPEED STUDIOS National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments The reduced version of this paper has been accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02096 2025-08-07 cs.IR cs.AI cs.HC 85%

Evaluating User Experience in Conversational Recommender Systems: A Systematic Review Across Classical and LLM-Powered Approaches

Raj Mahmud, Yufeng Wu, Abdullah Bin Sawad, Shlomo Berkovsky, Mukesh Prasad, A. Baki Kocaballi

机构 * School of Computer Science, University of Technology Sydney(技术科技大学计算机科学学院) The Applied College, King Abdulaziz University(国王阿卜杜勒阿齐兹大学应用学院) Australian Institute of Health Innovation, Macquarie University(麦考瑞大学健康创新研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at OzCHI 2025. 23 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23989 2025-08-07 cs.SE cs.AI 85%

Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics

Aditya Pathak, Rachit Gandhi, Vaibhav Uttam, Arnav Ramamoorthy, Pratyush Ghosh, Aaryan Raj Jindal, Shreyash Verma, Aditya Mittal, Aashna Ased, Chirag Khatri, Yashwanth Nakka, Devansh, Jagat Sesh Challa, Dhruv Kumar

机构 * BITS Pilani(比特斯理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted in ICER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05653 2025-08-06 cs.HC cs.AI 85%

The influence of persona and conversational task on social interactions with a LLM-controlled embodied conversational agent

Leon O. H. Kroczek, Alexander May, Selina Hettenkofer, Andreas Ruider, Bernd Ludwig, Andreas Mühlberger

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03097 2025-08-06 cs.CR cs.AI 85%

VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs

Zixuan Gu, Qiufeng Fan, Long Sun, Yang Liu, Xiaojun Ye

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 10 figures, published in KDD2025

Journal ref In Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD'25), August 3-7, 2025, Toronto, ON, Canada. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02827 2025-08-06 cs.SE cs.AI 85%

Automated Validation of LLM-based Evaluators for Software Engineering Artifacts

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Rami Katan, Alice Podolsky, Orna Raz, Avi Ziv

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14220 2025-08-06 cs.LG 85%

Enhancing Spectral Graph Neural Networks with LLM-Predicted Homophily

Kangkang Lu, Yanhua Yu, Zhiyong Huang, Tat-Seng Chua

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01178 2025-08-05 cs.SD cs.AI cs.IR eess.AS 85%

Advancing the Foundation Model for Music Understanding

Yi Jiang, Wei Wang, Xianwen Guo, Huiyun Liu, Hanrui Wang, Youri Xu, Haoqi Gu, Zhongqian Xie, Chuanjiang Luo

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01370 2025-08-05 cs.CL cs.IR 85%

MaRGen: Multi-Agent LLM Approach for Self-Directed Market Research and Analysis

Roman Koshkin, Pengyu Dai, Nozomi Fujikawa, Masahito Togami, Marco Visentini-Scarzanella

机构 * Okinawa Institute of Science and Technology(冲绳科学技术研究所) Institute of Science Tokyo(东京科学研究所) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01203 2025-08-05 cs.AI 85%

Importance Sampling is All You Need: Predict LLM's performance on new benchmark by reusing existing benchmark

Junjie Shi, Wei Ma, Shi Ying, Lingxiao Jiang, Yang liu, Bo Du

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23087 2025-08-01 cs.SE cs.AI 85%

On LLM-Assisted Generation of Smart Contracts from Business Processes

Fabian Stiehle, Hans Weytjens, Ingo Weber

机构 * Technical University of Munich, School of CIT, Germany(慕尼黑技术大学计算机信息学院) Fraunhofer Gesellschaft, Munich, Germany(弗劳恩霍夫协会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the Workshop on Distributed Ledger Technologies in Business Process Management, At the International Conference for Business Process Management (BPM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22447 2025-07-31 cs.CR cs.LG 85%

Breaking Obfuscation: Cluster-Aware Graph with LLM-Aided Recovery for Malicious JavaScript Detection

Zhihong Liang, Xin Wang, Zhenhuang Hu, Liangliang Song, Lin Chen, Jingjing Guo, Yanbin Wang, Ye Tian

机构 * Electric Power Research Institute, CSG(电力研究院,中国南方电网) Guangdong Provincial Key Laboratory of Power System Network Security(广东省电力系统网络安全重点实验室) Hangzhou Institute of Technology, Xidian University(杭州理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22133 2025-07-31 cs.CR cs.CL 85%

Prompt Optimization and Evaluation for LLM Automated Red Teaming

Michael Freenor, Lauren Alvarez, Milton Leal, Lily Smith, Joel Garrett, Yelyzaveta Husieva, Madeline Woodruff, Ryan Miller, Erich Kummerfeld, Rafael Medeiros, Sander Schulhoff

机构 * Fuel iX Applied Research(Fuel iX应用研究) North Carolina State University(北卡罗来纳州立大学) University of Minnesota(明尼苏达大学) TELUS Digital(TELUS数字) Learn Prompting

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 5 Figures, and 1 Appendix item

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21974 2025-07-30 cs.AI cs.NI 85%

Reasoning Language Models for Root Cause Analysis in 5G Wireless Networks

Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Yibin Kang, Haozhe Zhang, Merouane Debbah, Fadhel Ayed

机构 * Huawei, France(华为,法国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21017 2025-07-29 cs.AI 85%

MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them

Weichen Zhang, Yiyou Sun, Pohao Huang, Jiayue Pu, Heyue Lin, Dawn Song

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Code and data: https://github.com/sunblaze-ucb/mirage-bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20395 2025-07-29 cs.AI 85%

MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models

Hafsteinn Einarsson

机构 * University of Iceland(爱沙尼亚大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19962 2025-07-29 cs.CL 85%

KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models

Seorin Kim, Dongyoung Lee, Jaejin Lee

机构 * Dept. of Data Science, Seoul National University(数据科学系,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06774 2025-07-29 cs.CL 85%

Checklist Engineering Empowers Multilingual LLM Judges

Mohammad Ghiasvand Mohammadkhani, Hamid Beigy

机构 * Amirkabir University of Technology(阿姆irkabir技术大学) Sharif University of Technology(沙里夫技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19399 2025-07-28 cs.CR cs.AI 85%

Running in CIRCLE? A Simple Benchmark for LLM Code Interpreter Security

Gabriel Chua

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17795 2025-07-25 cs.LG 85%

LSDM: LLM-Enhanced Spatio-temporal Diffusion Model for Service-Level Mobile Traffic Prediction

Shiyuan Zhang, Tong Li, Zhu Xiao, Hongyang Du, Kaibin Huang

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) Department of Electrical and Electronic Engineering, University of Hong Kong(电气与电子工程系,香港大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18489 2025-07-24 cs.AI cs.ET cs.RO cs.SE 85%

LLM as a code generator in Agile Model Driven Development

Ahmed R. Sadik, Sebastian Brulin, Markus Olhofer

机构 * Honda Research Institute Europe(本田欧洲研究机构)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏