arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-28 至 2025-10-28 共收录 412 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2505.09252 2025-10-28 cs.CV 88%

Zero-Shot Multi-modal Large Language Model v.s. Supervised Deep Learning: A Comparative Study on CT-Based Intracranial Hemorrhage Subtyping

Yinuo Wang, Yue Zeng, Kai Chen, Cai Meng, Chao Pan, Zhouping Tang

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程与自动化学院) Department of Neurology, Tongji Hospital, Tongji Medical College, Huazhong University of Science and Technology(华中科技大学同济医学院神经内科,同济医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12520 2025-10-28 cs.CV 88%

SafeEraser: Enhancing Safety in Multimodal Large Language Models through Multimodal Machine Unlearning

Junkai Chen, Zhijie Deng, Kening Zheng, Yibo Yan, Shuliang Liu, PeiJun Wu, Peijie Jiang, Jia Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Ant Group, Alibaba(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23358 2025-10-28 cs.CL 87%

How AI Forecasts AI Jobs: Benchmarking LLM Predictions of Labor Market Changes

Sheri Osborn, Rohit Valecha, H. Raghav Rao, Dan Sass, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 8 pages + Limitations + References

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07759 2025-10-28 cs.IR 87%

A Survey of Long-Document Retrieval in the PLM and LLM Era

Minghan Li, Miyang Luo, Tianrui Lv, Yishuai Zhang, Siqi Zhao, Ercong Nie, Guodong Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11593 2025-10-28 cs.CV cs.AI cs.CL cs.DB cs.LG 87%

Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion

Luigi Celona, Simone Bianco, Marco Donzella, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication(信息学、系统与通信系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This manuscript has been accepted for publication in Springer Neural Computing and Applications

Journal ref Neural Computer & Application 37, 27279-27299 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23040 2025-10-28 cs.LG cond-mat.mtrl-sci cs.AI 86%

LLM Meets Diffusion: A Hybrid Framework for Crystal Material Generation

Subhojyoti Khastagir, Kishalay Das, Pawan Goyal, Seung-Cheol Lee, Satadeep Bhattacharjee, Niloy Ganguly

机构 * Indian Institute of Technology, Kharagpur, India(印度理工学院,克哈格普尔分校) Indo Korea Science and Technology Center, Bangalore, India(印韩科学技术中心,班加罗尔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14668 2025-10-28 cs.AI cs.CL cs.HC 86%

ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory Perceptions

Bufang Yang, Lilin Xu, Liekang Zeng, Kaiwei Liu, Siyang Jiang, Wenrui Lu, Hongkai Chen, Xiaofan Jiang, Guoliang Xing, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22559 2025-10-28 cs.CL 85%

A Closed-Loop Personalized Learning Agent Integrating Neural Cognitive Diagnosis, Bounded-Ability Adaptive Testing, and LLM-Driven Feedback

Zhifeng Wang, Xinyue Zheng, Chunyan Zeng

机构 * Faculty of Artificial Intelligence in Education(人工智能教育学院) Central China Normal University(中国中部师范大学) School of Electrical and Electronic Engineering(电气与电子工程学院) Hubei University of Technology(湖北工业大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23988 2025-10-28 cs.AI cs.DB 85%

LLM/Agent-as-Data-Analyst: A Survey

Zirui Tang, Weizheng Wang, Zihang Zhou, Yang Jiao, Bangrui Xu, Boyu Niu, Dayou Zhou, Xuanhe Zhou, Guoliang Li, Yeye He, Wei Zhou, Yitong Song, Cheng Tan, Xue Yang, Chunwei Liu, Bin Wang, Conghui He, Xiaoyang Wang, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 31 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21713 2025-10-28 cs.IR cs.LG 85%

asLLR: LLM based Leads Ranking in Auto Sales

Yin Sun, Yiwen Liu, Junjie Song, Chenyu Zhang, Xinyuan Zhang, Lingjie Liu, Siqi Chen, Yuji Cao

机构 * Li Auto Inc.(利自动公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22593 2025-10-28 cs.CL cs.AI 84%

AutoBench: Automating LLM Evaluation through Reciprocal Peer Assessment

Dario Loi, Elena Maria Muià, Federico Siciliano, Giovanni Trappolini, Vincenzo Crisà, Peter Kruger, Fabrizio Silvestri

机构 * Department of Computer Science, Sapienza University of Rome(计算机科学系,罗马萨皮恩扎大学) Department of Computer, Control, and Management Engineering, Sapienza University of Rome(计算机、控制与管理工程系,罗马萨皮恩扎大学) eZecute S.R.L.(eZecute公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23558 2025-10-28 cs.SD cs.CL eess.AS 83%

ISA-Bench: Benchmarking Instruction Sensitivity for Large Audio Language Models

Bohan Li, Wenbin Huang, Yuhang Qiu, Yiwei Guo, Hankun Wang, Zhihan Li, Jing Peng, Ziyang Ma, Xie Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments submitted to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19674 2025-10-28 cs.CR cs.AI 83%

SAGE: A Generic Framework for LLM Safety Evaluation

Madhur Jindal, Hari Shrawgi, Parag Agrawal, Sandipan Dandapat

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14225 2025-10-28 cs.CL 82%

Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale

Bowen Jiang, Zhuoqun Hao, Young-Min Cho, Bryan Li, Yuan Yuan, Sihao Chen, Lyle Ungar, Camillo J. Taylor, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软)

专题命中 评测与基准 :language model(abstract,comments);LLM(abstract);large language model(abstract);prompting(abstract)

Comments The 2025 Conference on Language Modeling (COLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04209 2025-10-28 cs.IR cs.AI cs.LG 81%

To Judge or not to Judge: Using LLM Judgements for Advertiser Keyphrase Relevance at eBay

Soumik Dey, Hansi Wu, Binbin Li

机构 * eBay Advertising(eBay广告) eBay Inc.(eBay公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

Journal ref Frontiers in Artificial Intelligence and Applications, Volume 413: ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22376 2025-10-28 cs.LG cs.CL 81%

Label Smoothing Improves Gradient Ascent in LLM Unlearning

Zirui Pang, Hao Zheng, Zhijie Deng, Ling Li, Zixin Zhong, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10281 2025-10-28 cs.CR cs.AI cs.CL cs.CV cs.LG 80%

ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test

Guan-Yan Yang, Tzu-Yu Cheng, Ya-Wen Teng, Farn Wanga, Kuo-Hui Yeh

机构 * Department of Electrical Engineering, National Taiwan University(国立台湾大学电子工程系) GARMIN (ASIA) CORPORATION(GARMIN(亚洲)公司) Institute of Artificial Intelligence Innovation, National Yang Ming Chiao Tung University(国家阳明交通大学人工智能创新研究所) Department of Information Management, National Dong Hwa University(国立东吴大学资讯管理系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 22 figures. This preprint has been accepted for publication in Elsevier JOURNAL OF NETWORK AND COMPUTER APPLICATIONS (JNCA)

Journal ref Journal of Network and Computer Applications, Vol. 244, (2025) 104356

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05965 2025-10-28 cs.LG cs.CY cs.HC 79%

Validating LLM-as-a-Judge Systems under Rating Indeterminacy

Luke Guerdan, Solon Barocas, Kenneth Holstein, Hanna Wallach, Zhiwei Steven Wu, Alexandra Chouldechova

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22787 2025-10-28 cs.SE cs.AI 79%

Collaborative LLM Agents for C4 Software Architecture Design Automation

Kamil Szczepanik, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments This paper has been accepted for the upcoming 59th Hawaii International Conference on System Sciences (HICSS-59), 2026, Hawaii, USA. The final published version will appear in the official conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22571 2025-10-28 cs.CV cs.AI cs.MM 79%

STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models

Mahiro Ukai, Shuhei Kurita, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20119 2025-10-28 cs.SE cs.LG 79%

LLM Agents for Generating Microservice-based Applications: how complex is your specification?

Daniel M. Yellin

机构 * post.runi.ac.il(runi学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments 24 pages + 5 pages appendices. 7 Figures. 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09732 2025-10-28 cs.LG q-bio.PE stat.AP 79%

Continental-scale habitat distribution modelling with multimodal earth observation foundation models

Sara Si-Moussi, Stephan Hennekens, Sander Mucher, Stan Los, Yoann Cartier, Borja Jiménez-Alfaro, Fabio Attorre, Jens-Christian Svenning, Wilfried Thuiller

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05657 2025-10-28 eess.AS cs.AI cs.SD 79%

Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing

Tianchi Liu, Duc-Tuan Truong, Rohan Kumar Das, Kong Aik Lee, Haizhou Li

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系) LIGHTSPEED, Singapore(新加坡LIGHTSPEED公司) Nanyang Technological University, Singapore(南洋理工大学) Fortemedia Singapore, Singapore(新加坡Fortemedia公司) Department of Electrical and Electronic Engineering and the Research Centre for Data Science & Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系及数据科学与人工智能研究中心) Shenzhen Research Institute of Big Data, School of Artificial Intelligence, School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)大数据研究院、人工智能学院、数据科学学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments Accepted to IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13657 2025-10-28 cs.AI 79%

Why Do Multi-Agent LLM Systems Fail?

Mert Cemri, Melissa Z. Pan, Shuyi Yang, Lakshya A. Agrawal, Bhavya Chopra, Rishabh Tiwari, Kurt Keutzer, Aditya Parameswaran, Dan Klein, Kannan Ramchandran, Matei Zaharia, Joseph E. Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Intesa Sanpaolo

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments ArXiv v3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21866 2025-10-28 cs.AI 79%

Capability Ceilings in Autoregressive Language Models: Empirical Evidence from Knowledge-Intensive Tasks

Javier Marín

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments The experiments in this paper were performed in January 2024. Current model architectures are considerably more complex than those presented here

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22242 2025-10-28 cs.IR cs.AI cs.CL 79%

PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading

Yutao Wu, Xiao Liu, Yunhao Feng, Jiale Ding, Xingjun Ma

机构 * Deakin University(德肯大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17883 2025-10-28 cs.CR cs.AI cs.LG 79%

From Flows to Words: Can Zero-/Few-Shot LLMs Detect Network Intrusions? A Grammar-Constrained, Calibrated Evaluation on UNSW-NB15

Mohammad Abdul Rehman, Syed Imad Ali Shah, Abbas Anwar, Noor Islam

机构 * Future Data Minds Research Lab(未来数据思维研究实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15550 2025-10-28 cs.LG cs.AI physics.soc-ph 79%

PhysGym: Benchmarking LLMs in Interactive Physics Discovery with Controlled Priors

Yimeng Chen, Piotr Piȩkos, Mateusz Ostaszewski, Firas Laakom, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(生成人工智能卓越中心,KAUST) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室,IDSIA-USI/SUPSI) NNAISENSE Principia-AI/PhysGym(NNAISENSE 原初人工智能/PhysGym)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 31 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19940 2025-10-28 cs.CL cs.AI cs.MA 79%

Assessing the Potential of Generative Agents in Crowdsourced Fact-Checking

Luigia Costabile, Gian Marco Orlando, Valerio La Gatta, Vincenzo Moscato

机构 * Department of Electrical Engineering and Information Technology (DIETI), University of Naples Federico II(那不勒斯费德里科二世大学电气工程与信息技术系) Northwestern University, Department of Computer Science, McCormick School of Engineering and Applied Science(西北大学计算机科学系,麦科马克工程与应用科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments This paper has been published in Online Social Networks and Media (https://doi.org/10.1016/j.osnem.2025.100326). Please cite the published version accordingly

Journal ref Online Social Networks and Media, Volume 48, September 2025, 100326

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01436 2025-10-28 cs.LG cs.AI 79%

Graph Neural Architecture Search with GPT-4

Haishuai Wang, Yang Gao, Xin Zheng, Peng Zhang, Jiajun Bu, Philip S. Yu

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Public Health, Zhejiang University(浙江大学公共卫生学院) Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref Science China Information Sciences 2025

详情

展开后加载摘要…

URL PDF HTML 收藏