arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-26 至 2025-09-26 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 34 篇

2509.21104 2025-09-26 cs.CL 89%

PerHalluEval: Persian Hallucination Evaluation Benchmark for Large Language Models

Mohammad Hosseini, Kimia Hosseini, Shayan Bali, Zahra Zanjani, Saeedeh Momtazi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20367 2025-09-26 cs.CL cs.AI cs.CY 88%

Interpreting Public Sentiment in Diplomacy Events: A Counterfactual Analysis Framework Using Large Language Models

Leyi Ouyang

机构 * South China Agricultural University Zhujiang College(华南农业大学珠江学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 2 Figures, 7 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19096 2025-09-26 cs.CV cs.SE 88%

Investigating Traffic Accident Detection Using Multimodal Large Language Models

Ilhan Skender, Kailin Tong, Selim Solmaz, Daniel Watzenig

机构 * Embedded Systems Group (Dept.-E)(嵌入式系统组) Virtual Vehicle Research GmbH(虚拟车辆研究公司) Control Systems Group (Dept.-E)(控制系统组) Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20680 2025-09-26 cs.LG cs.CL cs.CR 86%

Can Federated Learning Safeguard Private Data in LLM Training? Vulnerabilities, Attacks, and Defense Evaluation

Wenkai Guo, Xuefeng Liu, Haolin Wang, Jianwei Niu, Shaojie Tang, Jing Yuan

机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学) Hangzhou Innovation Institute of Beihang University, Zhejiang Key Laboratory of Industrial Big Data and Robot Intelligent Systems, Hangzhou, China(北京航空航天大学杭州创新研究院,浙江省工业大数据与机器人智能系统重点实验室) Center for AI Business Innovation, Department of Management Science and Systems, University at Buffalo, Buffalo, New York, USA(人工智能商业创新中心,管理科学与系统系,布法罗大学) University of North Texas, Denton, Texas, USA(德克萨斯大学达文波特分校) Zhongguancun Laboratory, Beijing, China(中关村实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 28 pages, 32 figures, accepted to the Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20617 2025-09-26 cs.IR 85%

DELM: a Python toolkit for Data Extraction with Language Models

Eric Fithian, Kirill Skobelev

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20552 2025-09-26 cs.SE 85%

Enhancing LLM-based Fault Localization with a Functionality-Aware Retrieval-Augmented Generation Framework

Xinyu Shi, Zhenhao Li, An Ran Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20497 2025-09-26 cs.SE 85%

PromptDebt: A Comprehensive Study of Technical Debt Across LLM Projects

Ahmed Aljohani, Hyunsook Do

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted at Proceedings of the 2025 Evaluation and Assessment in Software Engineering (EASE '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03558 2025-09-26 cs.CL 84%

ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch

Jiawei Chen, Xinyan Guan, Qianhao Yuan, Guozhao Mo, Weixiang Zhou, Yaojie Lu, Hongyu Lin, Ben He, Le Sun, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所中文信息处理实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

Comments EMNLP 2025 Main Conference (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21051 2025-09-26 cs.CL 83%

When Instructions Multiply: Measuring and Estimating LLM Capabilities of Multiple Instructions Following

Keno Harada, Yudai Yamazaki, Masachika Taniguchi, Edison Marrese-Taylor, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) Kyoto University(京都大学) University of the Ryukyus(冲绳大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18174 2025-09-26 cs.CV cs.CL 83%

Baseer: A Vision-Language Model for Arabic Document-to-Markdown OCR

Khalil Hennara, Muhammad Hreden, Mohamed Motasim Hamed, Ahmad Bastati, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21271 2025-09-26 cs.LG cs.DC 79%

SuperOffload: Unleashing the Power of Large-Scale LLM Training on Superchips

Xinyu Lian, Masahiro Tanaka, Olatunji Ruwase, Minjia Zhang

机构 * SSAIL Lab, University of Illinois(伊利诺伊大学SSAIL实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21125 2025-09-26 cs.CL 79%

Acoustic-based Gender Differentiation in Speech-aware Language Models

Junhyuk Choi, Jihwan Seol, Nayeon Kim, Chanhee Cho, EunBin Cho, Bugeun Kim

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21108 2025-09-26 cs.CL 79%

VoiceBBQ: Investigating Effect of Content and Acoustics in Social Bias of Spoken Language Model

Junhyuk Choi, Ro-hoon Oh, Jihwan Seol, Bugeun Kim

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20857 2025-09-26 cs.CV cs.AI 79%

TasselNetV4: A vision foundation model for cross-scene, cross-scale, and cross-species plant counting

Xiaonan Hu, Xuebing Li, Jinyu Xu, Abdulkadir Duran Adan, Letian Zhou, Xuhui Zhu, Yanan Li, Wei Guo, Shouyang Liu, Wenzhong Liu, Hao Lu

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation(multispectral information intelligent processing technology, school of artificial intelligence and automation) China-Poland Joint Laboratory on Measurement and Control Technology, School of Artificial Intelligence and Automation School of Cyber Science and Engineering School of Computer Science and Engineering Wuhan Institute of Technology Graduate School of Agricultural and Life Sciences Engineering Research Center of Plant Phenotyping, Ministry of Education, Jiangsu Collaborative Innovation Center for Modern Crop Production, Academy for Advanced Interdisciplinary Studies

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments 13 figures, 7 tables, code is available at https://github.com/tiny-smart/tasselnetv4

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00827 2025-09-26 cs.CV cs.AI 79%

IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves

Ruofan Wang, Juncheng Li, Yixu Wang, Bo Wang, Xiaosen Wang, Yan Teng, Yingchun Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20982 2025-09-26 cs.CL cs.AI 79%

Analysis of instruction-based LLMs' capabilities to score and judge text-input problems in an academic setting

Valeria Ramirez-Garcia, David de-Fitero-Dominguez, Antonio Garcia-Cabot, Eva Garcia-Lopez

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20768 2025-09-26 cs.LG cs.AI 76%

Measuring LLM Sensitivity in Transformer-based Tabular Data Synthesis

Maria F. Davila R, Azizjon Turaev, Wolfram Wingerath

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20998 2025-09-26 cs.AI 74%

CORE: Full-Path Evaluation of LLM Agents Beyond Final State

Panagiotis Michelakis, Yiannis Hadjiyiannis, Dimitrios Stamoulis

机构 * Synkrasis Labs(Synkrasis实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

Comments Accepted: LAW 2025 Workshop NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20393 2025-09-26 cs.CY cs.AI cs.LG 73%

The Secret Agenda: LLMs Strategically Lie and Our Current Safety Tools Are Blind

Caleb DeLeeuw, Gaurav Chawla, Aniket Sharma, Vanessa Dietze

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages plus citations and appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20375 2025-09-26 cs.CL cs.AI 73%

Assessing Classical Machine Learning and Transformer-based Approaches for Detecting AI-Generated Research Text

Sharanya Parimanoharan, Ruwan D. Nawarathna

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11507 2025-09-26 cs.AI cs.CL 73%

TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains

Wanying Wang, Zeyu Ma, Xuhong Wang, Yangchun Zhang, Pengfei Liu, Mingang Chen

机构 * Shanghai Key Laboratory of Computer Software Testing and Evaluating, Shanghai Development Center of Computer Software Technology(上海软件测试与评估关键实验室、上海计算机软件技术发展中心) Shanghai Normal University(上海师范大学) Shanghai Artificial Intelligence Lab(上海人工智能实验室) Shanghai University(上海大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Wang et al. Copyright 2026 lEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, including reprinting/republishing, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work. DOI will be added upon IEEE Xplore publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21310 2025-09-26 cs.AI 72%

SAGE: A Realistic Benchmark for Semantic Understanding

Samarth Goel, Reagan J. Lee, Kannan Ramchandran

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI;LLM(comments)

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21291 2025-09-26 cs.AI cs.CV 70%

VC-Agent: An Interactive Agent for Customized Video Dataset Collection

Yidan Zhang, Mutian Xu, Yiming Hao, Kun Zhou, Jiahao Chang, Xiaoqiang Liu, Pengfei Wan, Hongbo Fu, Xiaoguang Han

机构 * SSE, The Chinese University of Hong Kong, Shenzhen(深圳中文大学香港科技大学 SSE) The Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Project page: https://allenyidan.github.io/vcagent_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21188 2025-09-26 cs.HC cs.AI cs.CY cs.IR 70%

Adoption, usability and perceived clinical value of a UK AI clinical reference platform (iatroX): a mixed-methods formative evaluation of real-world usage and a 1,223-respondent user survey

Kolawole Tytler

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21151 2025-09-26 cs.CL cs.IR 70%

Retrieval over Classification: Integrating Relation Semantics for Multimodal Relation Extraction

Lei Hei, Tingjing Liao, Yingxin Pei, Yiyang Qi, Jiaqi Wang, Ruiting Li, Feiliang Ren

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(计算机科学与工程学院,东北大学,沈阳110819,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18353 2025-09-26 cs.LG 70%

MolPILE -- large-scale, diverse dataset for molecular representation learning

Jakub Adamczyk, Jakub Poziemski, Franciszek Job, Mateusz Król, Maciej Makowski

机构 * Faculty of Computer Science, AGH University of Krakow(克拉科夫AGH大学计算机科学系) Institute of Biochemistry and Biophysics, Polish Academy of Sciences(波兰科学院生物化学与生物物理学研究所)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01733 2025-09-26 cs.CL 70%

ASCIIEval: Benchmarking Models' Visual Perception in Text Strings via ASCII Art

Qi Jia, Xiang Yue, Shanshan Huang, Ziheng Qin, Yizhu Liu, Bill Yuchen Lin, Yang You, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) Guangzhou University(广州大学) Meituan(美团) University of Washington(华盛顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04713 2025-09-26 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Scaling Rich Style-Prompted Text-to-Speech Datasets

Anuj Diwan, Zhisheng Zheng, David Harwath, Eunsol Choi

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Computer Science and Data Science, New York University(纽约大学计算机科学与数据科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20378 2025-09-26 cs.CL cs.AI 62%

Beyond Global Emotion: Fine-Grained Emotional Speech Synthesis with Dynamic Word-Level Modulation

Sirui Wang, Andong Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20813 2025-09-26 cs.CV cs.AI 57%

Revolutionizing Precise Low Back Pain Diagnosis via Contrastive Learning

Thanh Binh Le, Hoang Nhat Khang Vo, Tan-Ha Mai, Trong Nhan Phan

机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) Ho Chi Minh City University of Technology(胡志明市技术大学) Vietnam National University (HCMUT-VNU)(越南国家大学(HCMUT-VNU)) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏