arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-14 至 2025-10-14 共收录 399 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 78 篇

2510.06343 2025-10-14 cs.SE cs.AI cs.CR 89%

Leveraging Large Language Models for Cybersecurity Risk Assessment -- A Case from Forestry Cyber-Physical Systems

Fikret Mert Gultekin, Oscar Lilja, Ranim Khojah, Rebekka Wohlrab, Marvin Damschen, Mazen Mohamad

机构 * Chalmers University of Technology(楚德斯技术大学) University of Gothenburg(哥德堡大学) Carnegie Mellon University(卡内基梅隆大学) RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted at Autonomous Agents in Software Engineering (AgenticSE) Workshop, co-located with ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13272 2025-10-14 cs.SE 89%

An Empirical Study of Python Library Migration Using Large Language Models

Md Mohayeminul Islam, Ajay Kumar Jha, May Mahmoud, Ildar Akhmetov, Sarah Nadi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01386 2025-10-14 cs.SE 89%

Can Large Language Models Serve as Data Analysts? A Multi-Agent Assisted Approach for Qualitative Data Analysis

Zeeshan Rasheed, Muhammad Waseem, Aakash Ahmad, Kai-Kristian Kemell, Wang Xiaofeng, Anh Nguyen Duc, Pekka Abrahamsson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 34 pages and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03014 2025-10-14 cs.HC 89%

Survey of Large Language Models in Extended Reality: Technical Paradigms and Application Frontiers

Jingyan Wang, Yang Zhao, Haotian Mao, Xubo Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Withdrawn by the authors after identifying improper reuse of illustrative materials and partial omission of citations in certain sections. A revised version will be prepared to ensure accurate attribution, and comprehensive citation coverage

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10991 2025-10-14 cs.CV cs.AI cs.CL 88%

A Survey on Agentic Multimodal Large Language Models

Huanjin Yao, Ruifei Zhang, Jiaxing Huang, Jingyi Zhang, Yibo Wang, Bo Fang, Ruolin Zhu, Yongcheng Jing, Shunyu Liu, Guanbin Li, Dacheng Tao

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Research Institute of Big Data, China(大数据研究 institute) Sun Yat-sen University, China(中山大学) City University of Hong Kong, China(香港城市大学) Communication University of China, China(通信大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21360 2025-10-14 cs.CL 88%

A Survey on Automatic Credibility Assessment Using Textual Credibility Signals in the Era of Large Language Models

Ivan Srba, Olesya Razuvayevskaya, João A. Leite, Robert Moro, Ipek Baris Schlicht, Sara Tonelli, Francisco Moreno García, Santiago Barrio Lottmann, Denis Teyssou, Valentin Porcellini, Carolina Scarton, Kalina Bontcheva, Maria Bielikova

机构 * Kempelen Institute of Intelligent Technologies(智能技术研究所) The University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACM Transactions on Intelligent Systems and Technology (ACM TIST)

Journal ref ACM Transactions on Intelligent Systems and Technology. 2025. 81 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17990 2025-10-14 cs.CY cs.CL 88%

Extracting Affect Aggregates from Longitudinal Social Media Data with Temporal Adapters for Large Language Models

Georg Ahnert, Max Pellert, David Garcia, Markus Strohmaier

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Proceedings of the Nineteenth International AAAI Conference on Web and Social Media (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10762 2025-10-14 cs.CL stat.AP 88%

Large Language Models for Full-Text Methods Assessment: A Case Study on Mediation Analysis

Wenqing Zhang, Trang Nguyen, Elizabeth A. Stuart, Yiqun T. Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02359 2025-10-14 cs.CL 88%

Add-One-In: Incremental Sample Selection for Large Language Models via a Choice-Based Greedy Paradigm

Zhuo Li, Yuhao Du, Xiaoqi Jiao, Yiwen Guo, Yuege Feng, Xiang Wan, Anningzhe Gao, Jinpeng Hu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳工业与应用数学国际中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) LIGHTSPEED STUDIOS Birmingham City University(伯明翰城市大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11131 2025-10-14 cs.SI cs.CY 88%

SocioBench: Modeling Human Behavior in Sociological Surveys with Large Language Models

Jia Wang, Ziyu Zhao, Tingjuntao Ni, Zhongyu Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00975 2025-10-14 cs.AI cs.CL cs.LG 87%

Self-Exploring Language Models for Explainable Link Forecasting on Temporal Graphs via Reinforcement Learning

Zifeng Ding, Shenyang Huang, Zeyu Cao, Emma Kondrup, Zachary Yang, Xingyue Huang, Yuan Sui, Zhangdie Yuan, Yuqicheng Zhu, Xianglong Hu, Yuan He, Farimah Poursafaei, Michael Bronstein, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of Stuttgart(斯图加特大学) Amazon(亚马逊公司) AITHYRA

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05423 2025-10-14 cs.CL cs.AI 86%

LiTransProQA: an LLM-based Literary Translation evaluation metric with Professional Question Answering

Ran Zhang, Wei Zhao, Lieve Macken, Steffen Eger

机构 * Natural Language Learning Group (NLLG) School of Business Informatics and Mathematics University of Mannheim(曼海姆大学商业信息学与数学学院自然语言学习组) University of Aberdeen, Department of Computing Science(阿伯丁大学计算机科学系) University of Gent, Department of Translation, Interpreting and Communication(根特大学翻译、口译与传播系) University of Technology Nuremberg (UTN), Department Engineering(纽伦堡技术大学工程系) Natural Language Learning and Generation (NLLG) Lab(自然语言学习与生成(NLLG)实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted as a main paper at EMNLP 2025. CR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09738 2025-10-14 cs.CL cs.AI 86%

Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement

Steve Han, Gilberto Titericz Junior, Tom Balough, Wenfei Zhou

机构 * NVIDIA Corporation(NVIDIA公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 1 figure, 4 tables, under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09732 2025-10-14 cs.LG cs.AI 86%

Evaluating LLM-Based Process Explanations under Progressive Behavioral-Input Reduction

P. van Oerle, R. H. Bemthuis, F. A. Bukhsh

机构 * University of Twente(特文特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 2 figures, 3 tables; to appear in Enterprise Design, Operations, and Computing. EDOC 2025 Workshops, Lecture Notes in Business Information Processing (LNBIP), Springer, 2025. Part of 29th International Conference on Enterprise Design, Operations, and Computing (EDOC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11509 2025-10-14 cs.CV 86%

Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model

Ruiping Liu, Junwei Zheng, Yufan Chen, Zirui Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Marc Pollefeys, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11434 2025-10-14 cs.CL 85%

Who are you, ChatGPT? Personality and Demographic Style in LLM-Generated Content

Dana Sotto Porat, Ella Rabinovich

机构 * The Academic College of Tel Aviv--Yaffo(特拉维夫-亚法夫学术学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ECAI2025 (Identity-Aware AI workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17214 2025-10-14 cs.SE cs.AI 85%

Output Format Biases in the Evaluation of Large Language Models for Code Translation

Marcos Macedo, Yuan Tian, Filipe R. Cogo, Bram Adams

机构 * School of Computing, Queen's University, ON, Canada(计算学院,皇后大学,加拿大) Centre for Software Excellence, Huawei Canada(软件卓越中心,华为加拿大)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI;foundation model(comments)

Comments This version (v2) is a journal extension of our previous conference submission that was accepted into the 2024 IEEE/ACM First International Conference on AI Foundation Models and Software Engineering (Forge 2024), which includes new experiments and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14028 2025-10-14 cs.CL 84%

MultiFinBen: Benchmarking Large Language Models for Multilingual and Multimodal Financial Application

Xueqing Peng, Lingfei Qian, Yan Wang, Ruoyu Xiang, Yueru He, Yang Ren, Mingyang Jiang, Vincent Jim Zhang, Yuqing Guo, Jeff Zhao, Huan He, Yi Han, Yun Feng, Yuechen Jiang, Yupeng Cao, Haohang Li, Yangyang Yu, Xiaoyu Wang, Penglei Gao, Shengyuan Lin, Keyi Wang, Shanshan Yang, Yilun Zhao, Zhiwei Liu, Peng Lu, Jerry Huang, Suyuchen Wang, Triantafillos Papadopoulos, Polydoros Giannouris, Efstathia Soufleri, Nuo Chen, Zhiyang Deng, Heming Fu, Yijia Zhao, Mingquan Lin, Meikang Qiu, Kaleb E Smith, Arman Cohan, Xiao-Yang Liu, Jimin Huang, Guojun Xiong, Alejandro Lopez-Lira, Xi Chen, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou, Qianqian Xie

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05195 2025-10-14 cs.LG cs.AI 84%

Train-before-Test Harmonizes Language Model Rankings

Guanhua Zhang, Ricardo Dominguez-Olmedo, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen and Tübingen AI Center(马克斯·普朗克智能系统研究所,图宾根和图宾根人工智能中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11631 2025-10-14 cs.CV cs.AI cs.NE 83%

EvoCAD: Evolutionary CAD Code Generation with Vision Language Models

Tobias Preintner, Weixuan Yuan, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * Institute of Advanced Computer Science, Leiden University, Leiden, The Netherlands(先进计算机科学研究所,莱顿大学,莱顿,荷兰)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments Accepted to IEEE ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11558 2025-10-14 cs.AI 83%

Zero Data Retention in LLM-based Enterprise AI Assistants: A Comparative Study of Market Leading Agentic AI Products

Komal Gupta, Aditya Shrivastava

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10320 2025-10-14 cs.CL cs.AI cs.LG 82%

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

Chenxi Whitehouse, Tianlu Wang, Ping Yu, Xian Li, Jason Weston, Ilia Kulikov, Swarnadeep Saha

机构 * FAIR at Meta(Meta 公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 13 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10390 2025-10-14 cs.CL cs.AI cs.LG 82%

RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models

Aashiq Muhamed, Leonardo F. R. Ribeiro, Markus Dreyer, Virginia Smith, Mona T. Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09615 2025-10-14 cs.CR 82%

A Biosecurity Agent for Lifecycle LLM Biosecurity Alignment

Meiyin Meng, Zaixi Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10983 2025-10-14 cs.LG cs.AI cs.CR 81%

GenoArmory: A Unified Evaluation Framework for Adversarial Attacks on Genomic Foundation Models

Haozheng Luo, Chenghao Qiu, Yimin Wang, Shang Wu, Jiahao Yu, Zhenyu Pan, Weian Mao, Haoyang Fang, Hao Xu, Han Liu, Binghui Wang, Yan Chen

机构 * Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Computer Science and Engineering, Texas A&M University(德克萨斯农工大学计算机科学与工程系) Department of Computer Science, Illinois Institute of Technology(伊利诺伊理工学院计算机科学系) Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Department of Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Department of Medicine at Brigham and Women’s Hospital and Harvard Medical School(布里格姆和妇女医院及哈佛医学院医学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24000 2025-10-14 cs.LG cs.CV 79%

The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models

Lijun Sheng, Jian Liang, Ran He, Zilei Wang, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments NeurIPS 2025 Datasets and Benchmarks Track. Github link: https://github.com/TomSheng21/tta-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12575 2025-10-14 cs.CR cs.AI 79%

DemonAgent: Dynamically Encrypted Multi-Backdoor Implantation Attack on LLM-based Agent

Pengyu Zhu, Zhenhong Zhou, Yuanhe Zhang, Shilinlu Yan, Kun Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11277 2025-10-14 cs.CL cs.AI 79%

Towards Real-Time Fake News Detection under Evidence Scarcity

Guangyu Wei, Ke Han, Yueming Lyu, Yu Luo, Yue Jiang, Caifeng Shan, Nicu Sebe

机构 * Nanjing University(南京大学) Ocean University of China(海洋大学) University of Trento(特伦托大学) Chinese Academy of Sciences(中国科学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11246 2025-10-14 cs.CR 78%

Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems

Pengyu Zhu, Lijun Li, Yaxing Lyu, Li Sun, Sen Su, Jing Shao

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11203 2025-10-14 cs.CR 78%

TraceAegis: Securing LLM-Based Agents via Hierarchical and Behavioral Anomaly Detection

Jiahao Liu, Bonan Ruan, Xianglin Yang, Zhiwei Lin, Yan Liu, Yang Wang, Tao Wei, Zhenkai Liang

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏