arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-23 至 2025-09-23 共收录 350 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 90 篇

2408.10894 2025-09-23 cs.CV 82%

ViLReF: An Expert Knowledge Enabled Vision-Language Retinal Foundation Model

Shengzhu Yang, Jiawei Du, Jia Guo, Weihang Zhang, Hanruo Liu, Huiqi Li, Ningli Wang

机构 * Beijing Institute of Technology(北京理工大学) Beijing Key Laboratory of Intelligent Diagnosis Technology and Equipment for Optic Nerve-Related Eye Diseases(北京智能诊断技术与设备重点实验室) Tsinghua University(清华大学) Beijing Tongren Hospital, Capital Medical University(北京同仁医院) Henan Academy of Innovations in Medical Science(河南医学创新研究院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23411 2025-09-23 cs.CL cs.CY cs.LG 81%

Datasets for Fairness in Language Models: An In-Depth Survey

Jiale Zhang, Zichong Wang, Avash Palikhe, Zhipeng Yin, Wenbin Zhang

机构 * University of Leeds(利兹大学) Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05309 2025-09-23 cs.MA cs.AI cs.CL 81%

Time to Talk: LLM Agents for Asynchronous Group Communication in Mafia Games

Niv Eckhaus, Uri Berger, Gabriel Stanovsky

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校计算机科学与工程学院) School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16325 2025-09-23 cs.CL cs.AI cs.HC 81%

Overhearing LLM Agents: A Survey, Taxonomy, and Roadmap

Andrew Zhu, Chris Callison-Burch

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16866 2025-09-23 cs.AI cs.CL cs.LG 80%

seqBench: A Tunable Benchmark to Quantify Sequential Reasoning Limits of LLMs

Mohammad Ramezanali, Mo Vazifeh, Paolo Santi

机构 * Salesforce AI Palo Alto(Salesforce AI 巴尔的摩) Capital One MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17566 2025-09-23 cs.CV cs.AI 79%

MRN: Harnessing 2D Vision Foundation Models for Diagnosing Parkinson's Disease with Limited 3D MR Data

Ding Shaodong, Liu Ziyang, Zhou Yijun, Liu Tao

机构 * Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University, Beijing, China(北京生物医学工程创新中心,生物科学与医学工程学院,北京航空航天大学,北京,中国) Beijing Celebrain Technology Co., Ltd.(北京Celebrain技术有限公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments First-place solution of the classification track for MICCAI'2025 PDCADxFoundation Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17488 2025-09-23 cs.CR cs.AI 79%

Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agents

Shouju Wang, Fenglin Yu, Xirui Liu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Wuhan University(武汉大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments To appear at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17418 2025-09-23 cs.CL cs.CV 79%

Vision Language Models Are Not (Yet) Spelling Correctors

Junhong Liang, Bojun Zhang

机构 * MBZUAI Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16876 2025-09-23 cs.CL 79%

Multi-task Pretraining for Enhancing Interpretable L2 Pronunciation Assessment

Jiun-Ting Li, Bi-Cheng Yan, Yi-Cheng Wang, Berlin Chen

机构 * Advanced Technology Laboratory, Chunghwa Telecom Co., Ltd., Taiwan(Chunghwa电信公司高级技术实验室, 台湾) National Taiwan Normal University, Taiwan(台湾国立台湾师范大学) National Taiwan University, Taiwan(台湾国立台湾大学)

专题命中 评测与基准 :pretraining(title,abstract);分类 cs.CL

Comments Accepted by APSIPA-ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16810 2025-09-23 cs.AI 79%

Automated Procedural Analysis via Video-Language Models for AI-assisted Nursing Skills Assessment

Shen Chang, Dennis Liu, Renran Tian, Kristen L. Swartzell, Stacie L. Klingler, Amy M. Nagle, Nan Kong

机构 * Weldon School of Biomedical Engineering, Purdue University(普渡大学生物医学工程学院) Department of Industrial and Operations Engineering, University of Michigan(密歇根大学工业与运作工程系) Edward P. Fitts Department of Industrial and Systems Engineering, North Carolina State University(北卡罗来纳州立大学工业与系统工程系) School of Nursing, Purdue University(普渡大学护理学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00399 2025-09-23 cs.CL cs.CR 79%

Rethinking Backdoor Detection Evaluation for Language Models

Jun Yan, Wenjie Jacky Mo, Xiang Ren, Robin Jia

机构 * University of Southern California(南加州大学) University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16452 2025-09-23 cs.CV cs.AI 79%

KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models

Son Hai Nguyen, Diwei Wang, Jinhyeok Jang, Hyewon Seo

机构 * ETRI(韩国科学技术院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16530 2025-09-23 cs.CL cs.AI 79%

AIPsychoBench: Understanding the Psychometric Differences between LLMs and Humans

Wei Xie, Shuoyoucheng Ma, Zhenhua Wang, Enze Wang, Kai Chen, Xiaobing Sun, Baosheng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科学研究院高性能计算研究所) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Thank you for your attention. This paper was accepted by the CogSci 2025 conference in April and published in August. The location in the proceedings is: https://escholarship.org/uc/item/39k8f46q

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16487 2025-09-23 cs.CL cs.AI 79%

The Oracle Has Spoken: A Multi-Aspect Evaluation of Dialogue in Pythia

Zixun Chen, Petr Babkin, Akshat Gupta, Gopala Anumanchipalli, Xiaomo Liu

机构 * Columbia University(哥伦比亚大学) J.P. Morgan AI Research(摩根大通人工智能研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21105 2025-09-23 cs.IR cs.AI cs.CL 79%

AgentMaster: A Multi-Agent Conversational Framework Using A2A and MCP Protocols for Multimodal Information Retrieval and Analysis

Callie C. Liao, Duoduo Liao, Sai Surya Gadiraju

机构 * Stanford University(斯坦福大学) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16329 2025-09-23 eess.AS cs.SD 78%

Investigating Polyglot Speech Foundation Models for Learning Collective Emotion from Crowds

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Panchal Nayak, Priyabrata Mallick, Swarup Ranjan Behera, Parabattina Bhagath, Pailla Balakrishna Reddy, Arun Balaji Buduru

机构 * IIIT-Delhi(印度德里印度理工学院) UPES(乌普萨拉理工学院) V.B.S.P.U(V.B.S.P.U大学) VIT(瓦拉纳西理工学院) Independent Researcher(独立研究者) L.B.R College of Engineering(L.B.R工程学院) Reliance AI

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted to APSIPA-ASC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11859 2025-09-23 cs.HC cs.CY 78%

SouLLMate: An Adaptive LLM-Driven System for Advanced Mental Health Support and Assessment, Based on a Systematic Application Survey

Qiming Guo, Jinwen Tang, Wenbo Sun, Haoteng Tang, Yi Shang, Wenlu Wang

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11405 2025-09-23 cs.CL 77%

DCR: Quantifying Data Contamination in LLMs Evaluation

Cheng Xu, Nan Yan, Shuhao Guan, Changhong Jin, Yuke Mei, Yibing Guo, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20608 2025-09-23 cs.AI cs.NA math.NA 77%

AI Assistants to Enhance and Exploit the PETSc Knowledge Base

Barry Smith, Junchao Zhang, Hong Zhang, Lois Curfman McInnes, Murat Keceli, Archit Vasan, Satish Balay, Toby Isaac, Le Chen, Venkatram Vishwanath

机构 * Flatiron Institute, Simons Foundation(Flatiron研究所、Simons基金会) Argonne National Laboratory(阿贡国家实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref 54th International Conference on Parallel Processing Companion (ICPP Companion '25), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21693 2025-09-23 cs.CL 77%

MAKIEval: A Multilingual Automatic WiKidata-based Framework for Cultural Awareness Evaluation for LLMs

Raoyuan Zhao, Beiduo Chen, Barbara Plank, Michael A. Hedderich

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings, 33 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17559 2025-09-23 cs.CL 77%

Specification-Aware Machine Translation and Evaluation for Purpose Alignment

Yoko Kayano, Saku Sugawara

机构 * The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学(SOKENDAI)) National Institute of Informatics(信息研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04713 2025-09-23 cs.CL cs.IR 77%

Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts

Yifei Yu, Qian-Wen Zhang, Lingfeng Qiao, Di Yin, Fang Li, Jie Wang, Zengxi Chen, Suncong Zheng, Xiaolong Liang, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12289 2025-09-23 cs.CL 77%

Evaluating Step-by-step Reasoning Traces: A Survey

Jinu Lee, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15640 2025-09-23 cs.CL 77%

AfriMed-QA: A Pan-African, Multi-Specialty, Medical Question-Answering Benchmark Dataset

Tobi Olatunji, Charles Nimo, Abraham Owodunni, Tassallah Abdullahi, Emmanuel Ayodele, Mardhiyah Sanni, Chinemelu Aka, Folafunmi Omofoye, Foutse Yuehgoh, Timothy Faniran, Bonaventure F. P. Dossou, Moshood Yekini, Jonas Kemp, Katherine Heller, Jude Chidubem Omeke, Chidi Asuzu MD, Naome A. Etori, Aimérou Ndiaye, Ifeoma Okoh, Evans Doe Ocansey, Wendy Kinara, Michael Best, Irfan Essa, Stephen Edward Moore, Chris Fourie, Mercy Nyamewaa Asiedu

机构 * Intron Georgia Institute of Technology(佐治亚理工学院) The Ohio State University(俄亥俄州立大学) BioRAMP Masakhane Google Research(谷歌研究) Kenyatta University(肯雅塔大学) University of Cape Coast(科克大学) SisonkeBiotik MILA Quebec(MILA魁北克) University of Minnesota(明尼苏达大学) Brown University(布朗大学) McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025 Main Conference (long paper, Best Social Impact Paper Award)

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 1948-1973, Vienna, Austria. Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16438 2025-09-23 cs.CV cs.CL 77%

AutoArabic: A Three-Stage Framework for Localizing Video-Text Retrieval Benchmarks

Mohamed Eltahir, Osamah Sarraj, Abdulrahman Alfrihidi, Taha Alshatiri, Mohammed Khurd, Mohammed Bremoo, Tanveer Hussain

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at ArabicNLP 2025 (EMNLP 2025 workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16437 2025-09-23 cs.HC cs.AI 77%

SENSE-7: Taxonomy and Dataset for Measuring User Perceptions of Empathy in Sustained Human-AI Conversations

Jina Suh, Lindy Le, Erfan Shayegani, Gonzalo Ramos, Judith Amores, Desmond C. Ong, Mary Czerwinski, Javier Hernandez

机构 * Microsoft Research(微软研究院) University of Michigan(密歇根大学) University of California, Riverside(加州大学河滨分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17548 2025-09-23 cs.SE 75%

Prompts as Software Engineering Artifacts: A Research Agenda and Preliminary Findings

Hugo Villamizar, Jannik Fischbach, Alexander Korn, Andreas Vogelsang, Daniel Mendez

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted for presentation at the 26th International Conference on Product-Focused Software Process Improvement (PROFES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16998 2025-09-23 cs.RO 75%

IDfRA: Self-Verification for Iterative Design in Robotic Assembly

Nishka Khendry, Christos Margadji, Sebastian W. Pattinson

机构 * Institute for Manufacturing, Department of Engineering, University of Cambridge(剑桥大学工程系制造研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16701 2025-09-23 cs.SE 75%

RelRepair: Enhancing Automated Program Repair by Retrieving Relevant Code

Shunyu Liu, Guangdong Bai, Mark Utting, Guowei Yang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages, 5 figures, under review at TSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00137 2025-09-23 cs.CL cs.IR cs.LG 73%

LaMP-QA: A Benchmark for Personalized Long-form Question Answering

Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏