arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-20 至 2025-08-20 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 30 篇

2508.13257 2025-08-20 cs.AR cs.AI 89%

ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models

Wenhao Lv, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 88%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13206 2025-08-20 cs.CL 88%

BQA: Body Language Question Answering Dataset for Video Large Language Models

Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05668 2025-08-20 cs.IR cs.AI cs.CL 86%

A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges

Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13196 2025-08-20 cs.LG cs.AI cs.IR 86%

Contextual Attention-Based Multimodal Fusion of LLM and CNN for Sentiment Analysis

Meriem Zerkouk, Miloud Mihoubi, Belkacem Chikhaoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments The 38th Canadian Conference on Artificial Intelligence ( 2025 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13774 2025-08-20 cs.SE cs.AI 85%

Agentic DraCor and the Art of Docstring Engineering: Evaluating MCP-empowered LLM Usage of the DraCor API

Peer Trilcke, Ingo Börner, Henny Sluyter-Gäthje, Daniil Skorinkin, Frank Fischer, Carsten Milling

机构 * University of Potsdam, Germany(波恩大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint, submitted to the 2nd Workshop on Computational Drama Analysis at DraCor Summit 2025, September 03, 2025, Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13162 2025-08-20 cs.AR cs.LG 85%

FedChip: Federated LLM for Artificial Intelligence Accelerator Chip Design

Mahmoud Nazzal, Khoa Nguyen, Deepak Vungarala, Ramtin Zand, Shaahin Angizi, Hai Phan, Abdallah Khreishah

机构 * New Jersey Institute of Technology(新泽西理工学院) University of South Carolina(南卡罗来纳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13543 2025-08-20 cs.HC 85%

"Can You See Me Think?" Grounding LLM Feedback in Keystrokes and Revision Patterns

Samra Zafar, Shifa Yousaf, Muhammad Shaheer Minhas

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages, 4 figures, 6 tables, Submitted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13757 2025-08-20 cs.SE cs.AI 84%

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

James Meaden, Michał Jarosz, Piotr Jodłowski, Grigori Melnik

机构 * Codility

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13524 2025-08-20 cs.CV cs.AI 79%

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

Vamsi Krishna Mulukutla, Sai Supriya Pavarala, Srinivasa Raju Rudraraju, Sridevi Bonthu

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Journal ref EAI Endorsed Transactions on AI and Robotics, 4, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04125 2025-08-20 cs.SE cs.CR cs.LG 77%

VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs

Seyed Shayan Daneshvar, Yu Nong, Xu Yang, Shaowei Wang, Haipeng Cai

机构 * University of Manitoba(曼尼托巴大学) Washington State University(华盛顿州立大学) University at Buffalo(布法罗大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by TOSEM; 26 pages, 6 figures, 8 tables, 3 prompt templates, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13214 2025-08-20 cs.CR cs.AI 77%

Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions

Xuyang Guo, Zekai Huang, Zhao Song, Jiahao Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10736 2025-08-20 cs.CL 77%

Model Performance-Guided Evaluation Data Selection for Effective Prompt Optimization

Ximing Dong, Shaowei Wang, Dayi Lin, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei, Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21447 2025-08-20 cs.SE cs.ET 75%

LLM4VV: Evaluating Cutting-Edge LLMs for Generation and Evaluation of Directive-Based Parallel Programming Model Compiler Tests

Zachariah Sollenberger, Rahul Patel, Saieda Ali Zada, Sunita Chandrasekaran

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05064 2025-08-20 cs.GR cs.CL cs.CV 70%

A Study of the Framework and Real-World Applications of Language Embedding for 3D Scene Understanding

Mahmoud Chick Zaouali, Todd Charter, Yehor Karpichev, Brandon Haworth, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science, University of Victoria(工程与计算机科学学院,维多利亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13701 2025-08-20 eess.IV cs.CV 67%

subCellSAM: Zero-Shot (Sub-)Cellular Segmentation for Hit Validation in Drug Discovery

Jacob Hanimann, Daniel Siegismund, Mario Wieser, Stephan Steigele

机构 * University of Bern, Bern, Switzerland(伯尔尼大学) Genedata AG, Basel, Switzerland(基因数据公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

Comments Accepted at DAGM German Conference on Pattern Recognition (GCPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13833 2025-08-20 cs.CL cs.AI 62%

Extracting Structured Requirements from Unstructured Building Technical Specifications for Building Information Modeling

Insaf Nahri, Romain Pinquié, Philippe Véron, Nicolas Bus, Mathieu Thorel

机构 * LISPEN EA 7515, Arts et Métiers Institute of Technology(LISPEN EA 7515,艺术与技术理工学院) Information System and Applications Division, CSTB(信息系统与应用部门,CSTB) Univ. Grenoble Alpes, CNRS, Grenoble INP, G-SCOP(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,G-SCOP)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13816 2025-08-20 cs.CL cs.AI 62%

The illusion of a perfect metric: Why evaluating AI's words is harder than it looks

Maria Paz Oliva, Adriana Correia, Ivan Vankov, Viktor Botev

机构 * Iris AI Borgen, Norway(Iris AI 布尔根,挪威) Iris AI Neurobiology BAS Sofia, Bulgaria(Iris AI 神经生物学 BAS 萨福ia,保加利亚) Iris AI Sofia, Bulgaria(Iris AI 萨福ia,保加利亚)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 figure. Accepted to RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06627 2025-08-20 cs.LG cs.AI 62%

Early Detection of Pancreatic Cancer Using Multimodal Learning on Electronic Health Records

Mosbah Aouad, Anirudh Choudhary, Awais Farooq, Steven Nevers, Lusine Demirkhanyan, Bhrandon Harris, Suguna Pappu, Christopher Gondi, Ravishankar Iyer

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of Machine Learning for Healthcare (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13180 2025-08-20 cs.AI cs.LG 62%

Search-Time Data Contamination

Ziwen Han, Meher Mankikar, Julian Michael, Zifan Wang

机构 * Scale AI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13428 2025-08-20 cs.CV cs.AI cs.MM 57%

Mitigating Easy Option Bias in Multiple-Choice Question Answering

Hao Zhang, Chen Li, Basura Fernando

机构 * Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,科学、技术及研究局,新加坡) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(前沿人工智能研究中心,科学、技术及研究局,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20988 2025-08-20 cs.CV cs.AI 57%

Segment Anything in Pathology Images with Natural Language

Zhixuan Chen, Junlin Hou, Liqi Lin, Yihui Wang, Yequan Bie, Xi Wang, Yanning Zhou, Ronald Cheong Kin Chan, Hao Chen

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Hong Kong University of Science and Technology(香港科学与技术大学) School of Electronic Engineering and Information Science(电子工程与信息科学学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Tencent AI Platform Department(腾讯人工智能平台部门) Department of Anatomical and Cellular Pathology(解剖与细胞病理学部) Department of Chemical and Biological Engineering(化学与生物工程系) Division of Life Science(生命科学系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院) State Key Laboratory of Nervous System Disorders(神经系统疾病国家重点实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01642 2025-08-20 cs.SE cs.AI 57%

"I see models being a whole other thing": An Empirical Study of Pre-Trained Model Naming Conventions and A Tool for Enhancing Naming Consistency

Wenxin Jiang, Mingyu Kim, Chingwo Cheung, Heesoo Kim, George K. Thiruvathukal, James C. Davis

机构 * Purdue University(普渡大学) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

Comments Published at EMSE'25

Journal ref Empirical Software Engineering 30, 155 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.12958 2025-08-20 cs.CL 57%

Composition, Attention, or Both?

Ryo Yoshida, Yohei Oseki

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted by Findings of EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13223 2025-08-20 cs.CV cs.AI 57%

MIRAGE: Towards AI-Generated Image Detection in the Wild

Cheng Xia, Manxi Lin, Jiexiang Tan, Xiaoxiong Du, Yang Qiu, Junjun Zheng, Xiangheng Kong, Yuning Jiang, Bo Zheng

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13936 2025-08-20 eess.IV cs.CV 50%

MMIS-Net for Retinal Fluid Segmentation and Detection

Nchongmaje Ndipenocha, Alina Mirona, Kezhi Wanga, Yongmin Li

机构 * Brunel University London(布鲁内尔大学伦敦分校)

专题命中 评测与基准 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13713 2025-08-20 cs.CV 50%

Hierarchical Vision-Language Retrieval of Educational Metaverse Content in Agriculture

Ali Abdari, Alex Falcon, Giuseppe Serra

机构 * University of Udine(乌迪大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 评测与基准 :language model(abstract)

Comments Accepted for publication at the 23rd International Conference on Image Analysis and Processing (ICIAP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14647 2025-08-20 cs.SD eess.AS 50%

Multi-Sampling-Frequency Naturalness MOS Prediction Using Self-Supervised Learning Model with Sampling-Frequency-Independent Layer

Go Nishikawa, Wataru Nakata, Yuki Saito, Kanami Imamura, Hiroshi Saruwatari, Tomohiko Nakamura

机构 * The University of Tokyo, Japan(东京大学) National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 评测与基准 :pretraining(abstract)

Comments 4 pages, 2 figures; Accepted to ASRU 2025 Challenge track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05985 2025-08-20 cs.HC cs.CY 50%

Exploring LLMs for Automated Generation and Adaptation of Questionnaires

Divya Mani Adhikari, Alexander Hartland, Ingmar Weber, Vikram Kamath Cannanure

专题命中 评测与基准 :LLM(abstract)

Comments Published in the Proceedings of the 7th ACM Conference on Conversational User Interfaces (CUI '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04678 2025-08-20 eess.IV cs.CV 50%

RadGPT: Constructing 3D Image-Text Tumor Datasets

Pedro R. A. S. Bassi, Mehmet Can Yavuz, Kang Wang, Xiaoxi Chen, Wenxuan Li, Sergio Decherchi, Andrea Cavalli, Yang Yang, Alan Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Italian Institute of Technology(意大利理工学院) University of California, San Francisco(加州大学旧金山分校) Istanbul Medipol University(伊斯坦布尔Medipol大学) University of Zurich(苏黎世大学) ETH AI Center(ETH人工智能中心) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏