arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-22 至 2025-09-22 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 37 篇

2509.15957 2025-09-22 cs.AI cs.CL cs.HC cs.IR 90%

EHR-MCP: Real-world Evaluation of Clinical Information Retrieval by Large Language Models via Model Context Protocol

Kanato Masayoshi, Masahiro Hashimoto, Ryoichi Yokoyama, Naoki Toda, Yoshifumi Uwamino, Shogo Fukuda, Ho Namkoong, Masahiro Jinzaki

机构 * Department of Radiology, Keio University Hospital, Tokyo, Japan(Keio大学医院放射科) Division of Infectious Diseases and Infection Control, Keio University Hospital, Tokyo, Japan(Keio大学医院感染病学与感染控制科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18475 2025-09-22 cs.LG cs.AI 90%

A Survey of Large Language Models for Data Challenges in Graphs

Mengran Li, Pengyu Zhang, Wenbin Xing, Yijia Zheng, Klim Zaporojets, Junzhou Chen, Ronghui Zhang, Yong Zhang, Siyuan Gong, Jia Hu, Xiaolei Ma, Zhiyuan Liu, Paul Groth, Marcel Worring

机构 * Guangdong Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区) University of Amsterdam(阿姆斯特丹大学) Aarhus University(阿arhus大学) Beijing Institute of Artificial Intelligence, Beijing University of Technology(北京人工智能研究院,北京工业大学) School of Information and Engineering, Chang’an University(信息工程学院,长安大学) Key Laboratory of Road and Traffic Engineering of the Ministry of Education, Tongji University(交通工程教育部长实验室,同济大学) Key Laboratory of Intelligent Transportation Technology and System, School of Transportation Science and Engineering, Beihang University(智能交通技术与系统重点实验室,交通运输科学与工程学院,北航) Jiangsu Key Laboratory of Urban ITS, Jiangsu Province Collaborative Innovation Center of Modern Urban Traffic Technologies, School of Transportation, Southeast University(江苏城市ITS重点实验室,江苏省现代城市交通技术协同创新中心,交通学院,东南大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments Accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07973 2025-09-22 cs.CR 89%

Unique Security and Privacy Threats of Large Language Models: A Comprehensive Survey

Shang Wang, Tianqing Zhu, Bo Liu, Ming Ding, Dayong Ye, Wanlei Zhou, Philip S. Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 35 pages, 9 tables, 12 figures. To appear in ACM Computing Surveys (CSUR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07584 2025-09-22 cs.CR 88%

SecReEvalBench: A Multi-turned Security Resilience Evaluation Benchmark for Large Language Models

Huining Cui, Wei Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Major rework on the paper that changes the title, content, experiments, story, and etc. All authors agree to withdraw

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12158 2025-09-22 cs.CL 87%

A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages

Tatiana Anikina, Jan Cegin, Jakub Simko, Simon Ostermann

机构 * German Research Institute for Artificial Intelligence (DFKI)(德国人工智能研究所) Faculty of Information Technology, Brno University of Technology(信息科技学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10179 2025-09-22 cs.CL cs.AI 86%

Benchmark of stylistic variation in LLM-generated texts

Jiří Milička, Anna Marklová, Václav Cvrček

机构 * Department of Linguistics, Faculty of Arts, Charles University(语言学系,艺术学院,查尔斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Data and scripts: https://osf.io/hs7xt/. Interactive charts: https://www.korpus.cz/stylisticbenchmark/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00032 2025-09-22 cs.CL cs.AI 86%

KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis

Shinwoo Park, Shubin Kim, Do-Kyung Kim, Yo-Sub Han

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15356 2025-09-22 cs.LG 86%

Predicting Language Models' Success at Zero-Shot Probabilistic Prediction

Kevin Ren, Santiago Cortes-Gomez, Carlos Miguel Patiño, Ananya Joshi, Ruiqi Lyu, Jingjing Tang, Alistair Turcan, Khurram Yamin, Steven Wu, Bryan Wilder

机构 * Cornell Tech(康奈尔科技) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.LG

Comments EMNLP Findings 2025. We release our code at: camera-ready" target="_blank" rel="noopener">https://github.com/kkr36/llm-eval/tree/camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09407 2025-09-22 cs.CL cs.HC 85%

UXAgent: A System for Simulating Usability Testing of Web Design with LLM Agents

Yuxuan Lu, Bingsheng Yao, Hansu Gu, Jing Huang, Jessie Wang, Yang Li, Jiri Gesi, Qi He, Toby Jia-Jun Li, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊) University of Notre Dame(诺特尔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13638 2025-09-22 cs.CV cs.AI 83%

DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models

Zhiyi Shi, Binjie Wang, Chongjie Si, Yichen Wu, Junsik Kim, Hanspeter Pfister

机构 * Harvard University(哈佛大学) City University of Hong Kong(香港城市大学) Amazon(亚马逊) Fudan University(复旦大学) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能关键实验室,上海交通大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16107 2025-09-22 cs.CL 81%

It Depends: Resolving Referential Ambiguity in Minimal Contexts with Commonsense Knowledge

Lukas Ellinger, Georg Groh

机构 * School for Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by UncertaiNLP workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15239 2025-09-22 cs.CL 81%

WangchanThaiInstruct: An instruction-following Dataset for Culture-Aware, Multitask, and Multi-domain Evaluation in Thai

Peerat Limkonchotiwat, Pume Tuchinda, Lalita Lowphansirikul, Surapon Nonesung, Panuthep Tasawong, Alham Fikri Aji, Can Udomcharoenchaikit, Sarana Nutanong

机构 * AI Singapore(AI新加坡) VISTEC MBZUAI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to EMNLP 2025 (Main). Model and Dataset: https://huggingface.co/collections/airesearch/wangchan-thai-instruction-6835722a30b98e01598984fd

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16025 2025-09-22 cs.CL cs.AI 81%

Session-Level Spoken Language Assessment with a Multimodal Foundation Model via Multi-Target Learning

Hong-Yun Lin, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * Department of Computer Science(计算机科学系) Information Engineering, National Taiwan Normal University(信息工程,台湾正常大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

Comments Copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18592 2025-09-22 cs.CV cs.AI cs.LG cs.RO 81%

Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models

Hao Dong, Moru Liu, Kaiyang Zhou, Eleni Chatzi, Juho Kannala, Cyrill Stachniss, Olga Fink

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Project page: https://github.com/donghao51/Awesome-Multimodal-Adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15258 2025-09-22 cs.LG cs.AI eess.SP 81%

Generative AI Meets Wireless Sensing: Towards Wireless Foundation Model

Zheng Yang, Guoxuan Chi, Chenshu Wu, Hanyu Liu, Yuchong Gao, Yunhao Liu, Jie Xu, Tony Xiao Han

机构 * Tsinghua University(清华大学) University of Hong Kong(香港大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Huawei Technology Co. Ltd.(华为技术有限公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18008 2025-09-22 cs.CL cs.NE 79%

Personalized Language Models via Privacy-Preserving Evolutionary Model Merging

Kyuyoung Kim, Jinwoo Shin, Jaehyung Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Yonsei University(延世大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09871 2025-09-22 cs.CL cs.AI 79%

Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case

Bastián González-Bustamante, Nando Verelst, Carla Cisternas

机构 * Universidad Diego Portales(迪亚戈·波特莱斯大学) Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Working paper: 18 pages, 4 tables, 2 figures

Journal ref Empiria Lab Method Series (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07188 2025-09-22 cs.CL cs.AI 79%

DischargeSim: A Simulation Benchmark for Educational Doctor-Patient Communication at Discharge

Zonghai Yao, Michael Sun, Won Seok Jang, Sunjae Kwon, Soie Kwon, Hong Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Equal contribution for the first two authors. To appear in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15432 2025-09-22 cs.IR 78%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16232 2025-09-22 cs.CL 77%

MuseScorer: Idea Originality Scoring At Scale

Ali Sarosh Bangash, Krish Veera, Ishfat Abrar Islam, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing, University of South Florida, USA(贝尔尼人工智能、网络安全与计算学院,佛罗里达州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11096 2025-09-22 cs.CR cs.AI 77%

SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI

Yuzhou Nie, Zhun Wang, Yu Yang, Ruizhe Jiang, Yuheng Tang, Xander Davies, Yarin Gal, Bo Li, Wenbo Guo, Dawn Song

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Berkeley(加州大学伯克利分校) VirtueAI UIUC(伊利诺伊大学香槟分校) UChicago(芝加哥大学) University of Oxford(牛津大学) UK AI Safety Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to NeurIPS D&B track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15932 2025-09-22 cs.LG cs.AI cs.IT math.IT stat.ML 73%

The Alignment Bottleneck

Wenjun Cao

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06947 2025-09-22 cs.AR cs.AI cs.LG cs.PL 73%

PyraNet: A Multi-Layered Hierarchical Dataset for Verilog

Bardia Nadimi, Ghali Omar Boutaib, Hao Zheng

机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04675 2025-09-22 cs.CL cs.AI cs.IR 73%

ConfReady: A RAG based Assistant and Dataset for Conference Checklist Responses

Michael Galarnyk, Rutwik Routu, Vidhyakshaya Kannan, Kosha Bheda, Prasun Banerjee, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Sai University(赛大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17093 2025-09-22 eess.AS cs.CL 70%

P2VA: Converting Persona Descriptions into Voice Attributes for Fair and Controllable Text-to-Speech

Yejin Lee, Jaehoon Kang, Kyuhong Shim

机构 * Department of Artificial Intelligence, Sungkyunkwan University, Korea(人工智能系,成均馆大学,韩国) Department of Computer Science and Engineering, Sungkyunkwan University, Korea(计算机科学与工程系,成均馆大学,韩国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16781 2025-09-22 cs.CL 70%

Evaluating Robustness of LLMs in Question Answering on Multilingual Noisy OCR Data

Bhawna Piryani, Jamshid Mozafari, Abdelrahman Abdallah, Antoine Doucet, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) University of La Rochelle(拉罗谢尔大学) University of Ljubljana(卢布尔雅那大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15366 2025-09-22 cs.AI 70%

Diagnostics of cognitive failures in multi-agent expert systems using dynamic evaluation protocols and subsequent mutation of the processing context

Andrejs Sorstkins, Josh Bailey, Dr Alistair Baron

机构 * School of Computing and Communications(计算与通讯学院) Lancaster University(兰卡斯特大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

Comments Dissertation and research project created in collaboration with JobFair LTD

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16141 2025-09-22 cs.CV 67%

AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models

Vatsal Malaviya, Agneet Chatterjee, Maitreya Patel, Yezhou Yang, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Project Page : https://vatsal-malaviya.github.io/AcT2I/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15221 2025-09-22 cs.CV 67%

ScaleCUA: Scaling Open-Source Computer Use Agents with Cross-Platform Data

Zhaoyang Liu, Jingjing Xie, Zichen Ding, Zehao Li, Bowen Yang, Zhenyu Wu, Xuehui Wang, Qiushi Sun, Shi Liu, Weiyun Wang, Shenglong Ye, Qingyun Li, Xuan Dong, Yue Yu, Chenyu Lu, YunXiang Mo, Yao Yan, Zeyue Tian, Xiao Zhang, Yuan Huang, Yiqian Liu, Weijie Su, Gen Luo, Xiangyu Yue, Biqing Qi, Kai Chen, Bowen Zhou, Yu Qiao, Qifeng Chen, Wenhai Wang

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15690 2025-09-22 cs.AI 57%

CCrepairBench: A High-Fidelity Benchmark and Reinforcement Learning Framework for C++ Compilation Repair

Weixuan Sun, Jucai Zhai, Dengfeng Liu, Xin Zhang, Xiaojun Wu, Qiaobo Hao, AIMgroup, Yang Fang, Jiuyang Tang

机构 * Weixuan Sun 1,2(某机构) Jucai Zhai 1(某机构) Xin Zhang 1, 3(某机构) Dengfeng Liu 1(某机构) Xiaojun Wu 1(某机构) Qiaobo Hao 1(某机构) AIMgroup 1(AIM集团) Yang Fang 2(某机构) Jiuyang Tang 2(某机构)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏