arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2508.17155 2025-08-26 cs.CR cs.AI 85%

Mind the Gap: Time-of-Check to Time-of-Use Vulnerabilities in LLM-Enabled Agents

Derek Lilienthal, Sanghyun Hong

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17710 2025-08-26 cs.CR cs.AI 85%

Optimization-based Prompt Injection Attack to LLM-as-a-Judge

Jiawen Shi, Zenghui Yuan, Yinuo Liu, Yue Huang, Pan Zhou, Lichao Sun, Neil Zhenqiang Gong

机构 * Huazhong University of Science and Technology(华中科技大学) University of Notre Dame(圣母大学) Lehigh University(莱文森大学) Duke University(杜克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments To appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16757 2025-08-26 cs.CL cs.IR 85%

How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models

Abdelrahman Abdallah, Bhawna Piryani, Jamshid Mozafari, Mohammed Ali, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16835 2025-08-25 eess.AS cs.CL 85%

Evaluating Speech-to-Text x LLM x Text-to-Speech Combinations for AI Interview Systems

Rumi Allbert, Nima Yazdani, Ali Ansari, Aruj Mahajan, Amirhossein Afsharrad, Seyed Shahabeddin Mousavi

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13092 2025-08-22 cs.CR cs.AI 85%

VerilogLAVD: LLM-Aided Rule Generation for Vulnerability Detection in Verilog

Xiang Long, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14716 2025-08-22 cs.LG 85%

Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation

Tuhina Tripathi, Manya Wadhwa, Greg Durrett, Scott Niekum

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15526 2025-08-22 cs.CL 85%

SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

Xiangyang Zhu, Yuan Tian, Chunyi Li, Kaiwei Zhang, Wei Sun, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Code and dataset are available at https://github.com/yangyangyang127/SafetyFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15429 2025-08-22 cs.CL 85%

Pub-Guard-LLM: Detecting Retracted Biomedical Articles with Reliable Explanations

Lihu Chen, Shuojie Fu, Gabriel Freedman, Cemre Zor, Guy Martin, James Kinross, Uddhav Vaghela, Ovidiu Serban, Francesca Toni

机构 * Imperial College London(伦敦帝国学院) Amazon Web Services(亚马逊网络服务) National Health Service(国家健康服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments long paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13774 2025-08-20 cs.SE cs.AI 85%

Agentic DraCor and the Art of Docstring Engineering: Evaluating MCP-empowered LLM Usage of the DraCor API

Peer Trilcke, Ingo Börner, Henny Sluyter-Gäthje, Daniil Skorinkin, Frank Fischer, Carsten Milling

机构 * University of Potsdam, Germany(波恩大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint, submitted to the 2nd Workshop on Computational Drama Analysis at DraCor Summit 2025, September 03, 2025, Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13162 2025-08-20 cs.AR cs.LG 85%

FedChip: Federated LLM for Artificial Intelligence Accelerator Chip Design

Mahmoud Nazzal, Khoa Nguyen, Deepak Vungarala, Ramtin Zand, Shaahin Angizi, Hai Phan, Abdallah Khreishah

机构 * New Jersey Institute of Technology(新泽西理工学院) University of South Carolina(南卡罗来纳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06225 2025-08-19 cs.AI 85%

Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution

Zailong Tian, Zhuoheng Han, Yanzhe Chen, Haozhe Xu, Xi Yang, Richeng Xuan, Houfeng Wang, Lizi Liao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11707 2025-08-19 cs.CY cs.AI 85%

Listening with Language Models: Using LLMs to Collect and Interpret Classroom Feedback

Sai Siddartha Maram, Ulia Zaman, Magy Seif El-Nasr

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11061 2025-08-18 cs.CL 85%

BIPOLAR: Polarization-based granular framework for LLM bias evaluation

Martin Pavlíček, Tomáš Filip, Petr Sosík

机构 * Institute for Research and Applications of Fuzzy Modeling, University of Ostrava(模糊建模研究与应用研究所,奥斯特拉瓦大学) Institute of Computer Science, Faculty of Philosophy and Science, Silesian University in Opava(计算机科学研究所,哲学与科学学院,奥帕瓦西里西亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11736 2025-08-18 cs.CL 85%

Personalized LLM for Generating Customized Responses to the Same Query from Different Users

Hang Zeng, Chaoyue Niu, Fan Wu, Chengfei Lv, Guihai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by CIKM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09515 2025-08-14 cs.CL 85%

LACA: Improving Cross-lingual Aspect-Based Sentiment Analysis with LLM Data Augmentation

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS – New Technologies for the Information Society University of West Bohemia in Pilsen, Faculty of Applied Sciences(新信息技术社会大学西波希米亚大学皮尔森分校应用科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Published in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics; Volume 1: Long Papers (ACL 2025). Official version: https://aclanthology.org/2025.acl-long.41/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09124 2025-08-13 cs.CL 85%

OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows

Weixuan Wang, Dongge Han, Daniel Madrigal Diaz, Jin Xu, Victor Rühle, Saravan Rajmohan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17066 2025-08-12 cs.CR cs.AI 85%

Improving LLM Outputs Against Jailbreak Attacks with Expert Model Integration

Tatia Tsmindashvili, Ana Kolkhidashvili, Dachi Kurtskhalia, Nino Maghlakelidze, Elene Mekvabishvili, Guram Dentoshvili, Orkhan Shamilov, Zaal Gachechiladze, Steven Saporta, David Dachi Choladze

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref IEEE Access, vol. 13, pp. 134976-134988, Jul. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06467 2025-08-11 cs.LG 85%

LLM Unlearning using Gradient Ratio-Based Influence Estimation and Noise Injection

Ameya Anjarlekar, Sandeep Pombra

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 Pages, 3 Figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04720 2025-08-08 cs.AI 85%

Who is a Better Player: LLM against LLM

Yingjie Zhou, Jiezhang Cao, Farong Wen, Li Xu, Yanwei Jiang, Jun Jia, Ronghui Li, Xiaohong Liu, Yu Zhou, Xiongkuo Min, Jie Guo, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) PengCheng Laboratory(鹏城实验室) Harvard Medical School(哈佛医学院) Shanghai AI Laboratory(上海人工智能实验室) China University of Mining and Technology(中国矿业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03751 2025-08-08 cs.CL cs.SD eess.AS 85%

Recent Advances in Speech Language Models: A Survey

Wenqian Cui, Dianzhi Yu, Xiaoqi Jiao, Ziqiao Meng, Guangyan Zhang, Qichao Wang, Yiwen Guo, Irwin King

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) LIGHTSPEED STUDIOS National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments The reduced version of this paper has been accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02096 2025-08-07 cs.IR cs.AI cs.HC 85%

Evaluating User Experience in Conversational Recommender Systems: A Systematic Review Across Classical and LLM-Powered Approaches

Raj Mahmud, Yufeng Wu, Abdullah Bin Sawad, Shlomo Berkovsky, Mukesh Prasad, A. Baki Kocaballi

机构 * School of Computer Science, University of Technology Sydney(技术科技大学计算机科学学院) The Applied College, King Abdulaziz University(国王阿卜杜勒阿齐兹大学应用学院) Australian Institute of Health Innovation, Macquarie University(麦考瑞大学健康创新研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at OzCHI 2025. 23 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23989 2025-08-07 cs.SE cs.AI 85%

Rubric Is All You Need: Enhancing LLM-based Code Evaluation With Question-Specific Rubrics

Aditya Pathak, Rachit Gandhi, Vaibhav Uttam, Arnav Ramamoorthy, Pratyush Ghosh, Aaryan Raj Jindal, Shreyash Verma, Aditya Mittal, Aashna Ased, Chirag Khatri, Yashwanth Nakka, Devansh, Jagat Sesh Challa, Dhruv Kumar

机构 * BITS Pilani(比特斯理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted in ICER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05653 2025-08-06 cs.HC cs.AI 85%

The influence of persona and conversational task on social interactions with a LLM-controlled embodied conversational agent

Leon O. H. Kroczek, Alexander May, Selina Hettenkofer, Andreas Ruider, Bernd Ludwig, Andreas Mühlberger

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03097 2025-08-06 cs.CR cs.AI 85%

VFLAIR-LLM: A Comprehensive Framework and Benchmark for Split Learning of LLMs

Zixuan Gu, Qiufeng Fan, Long Sun, Yang Liu, Xiaojun Ye

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 10 figures, published in KDD2025

Journal ref In Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD'25), August 3-7, 2025, Toronto, ON, Canada. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02827 2025-08-06 cs.SE cs.AI 85%

Automated Validation of LLM-based Evaluators for Software Engineering Artifacts

Ora Nova Fandina, Eitan Farchi, Shmulik Froimovich, Rami Katan, Alice Podolsky, Orna Raz, Avi Ziv

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14220 2025-08-06 cs.LG 85%

Enhancing Spectral Graph Neural Networks with LLM-Predicted Homophily

Kangkang Lu, Yanhua Yu, Zhiyong Huang, Tat-Seng Chua

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01178 2025-08-05 cs.SD cs.AI cs.IR eess.AS 85%

Advancing the Foundation Model for Music Understanding

Yi Jiang, Wei Wang, Xianwen Guo, Huiyun Liu, Hanrui Wang, Youri Xu, Haoqi Gu, Zhongqian Xie, Chuanjiang Luo

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01370 2025-08-05 cs.CL cs.IR 85%

MaRGen: Multi-Agent LLM Approach for Self-Directed Market Research and Analysis

Roman Koshkin, Pengyu Dai, Nozomi Fujikawa, Masahito Togami, Marco Visentini-Scarzanella

机构 * Okinawa Institute of Science and Technology(冲绳科学技术研究所) Institute of Science Tokyo(东京科学研究所) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01203 2025-08-05 cs.AI 85%

Importance Sampling is All You Need: Predict LLM's performance on new benchmark by reusing existing benchmark

Junjie Shi, Wei Ma, Shi Ying, Lingxiao Jiang, Yang liu, Bo Du

机构 * Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23087 2025-08-01 cs.SE cs.AI 85%

On LLM-Assisted Generation of Smart Contracts from Business Processes

Fabian Stiehle, Hans Weytjens, Ingo Weber

机构 * Technical University of Munich, School of CIT, Germany(慕尼黑技术大学计算机信息学院) Fraunhofer Gesellschaft, Munich, Germany(弗劳恩霍夫协会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at the Workshop on Distributed Ledger Technologies in Business Process Management, At the International Conference for Business Process Management (BPM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏