arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-09 至 2025-10-09 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 48 篇

2510.02360 2025-10-09 cs.CL cs.AI 90%

Spiral of Silence in Large Language Model Agents

Mingze Zhong, Meng Fang, Zijing Shi, Yuxuan Huang, Shunfeng Zheng, Yali Du, Ling Chen, Jun Wang

机构 * AAII, University of Technology Sydney(AAII,悉尼大学) University of Liverpool(利物浦大学) King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06931 2025-10-09 astro-ph.IM cs.LG 89%

Textual interpretation of transient image classifications from large language models

Fiorenzo Stoppa, Turan Bulmus, Steven Bloemen, Stephen J. Smartt, Paul J. Groot, Paul Vreeswijk, Ken W. Smith

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments Published in Nature Astronomy (2025). Publisher's Version of Record (CC BY 4.0). DOI: 10.1038/s41550-025-02670-z

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05468 2025-10-09 cs.CL 89%

LatteReview: A Multi-Agent Framework for Systematic Review Automation Using Large Language Models

Pouria Rouzrokh, Bardia Khosravi, Parsa Rouzrokh, Moein Shariatnia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 31 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06826 2025-10-09 cs.CL 89%

Mid-Training of Large Language Models: A Survey

Kaixiang Mo, Yuxin Shi, Weiwei Weng, Zhiqiang Zhou, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09278 2025-10-09 cs.CV cs.AI 88%

Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine

Xiaoshuang Huang, Lingdong Shen, Jia Liu, Fangxin Shang, Hongxiang Li, Haifeng Huang, Yehui Yang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06430 2025-10-09 cs.CL 88%

MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning

Neeraja Kirtane, Yuvraj Khanna, Peter Relan

机构 * Got It Education(Got It 教育)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04155 2025-10-09 cs.CL 88%

GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models

Hengyu Luo, Zihao Li, Joseph Attieh, Sawal Devkota, Ona de Gibert, Xu Huang, Shaoxiong Ji, Peiqin Lin, Bhavani Sai Praneeth Varma Mantina, Ananda Sreenidhi, Raúl Vázquez, Mengjie Wang, Samea Yusofi, Fei Yuan, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Munich(慕尼黑大学) Nanjing University(南京大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP demo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19017 2025-10-09 cs.CL 88%

Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models

Bin Zhu, Yinxuan Gui, Huiyan Qi, Jingjing Chen, Chong-Wah Ngo, Ee-Peng Lim

机构 * Singapore Management University(新加坡管理大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Project website: https://yxg1005.github.io/GaslightingNegationAttacks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20553 2025-10-09 cs.SE 88%

GeoJSEval: An Automated Evaluation Framework for Large Language Models on JavaScript-Based Geospatial Computation and Visualization Code Generation

Guanyu Chen, Haoyue Jiao, Shuyang Hou, Ziqi Liu, Lutong Xie, Shaowen Wu, Huayi Wu, Xuefeng Guan, Zhipeng Gui

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07243 2025-10-09 cs.CL cs.AI 86%

LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation

Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha, Arijit Ghosh Chowdhury, Prashanth Kallur Ramaswamy, Jeremy Roghair, Hannah R Marlowe, Carina Suzana Negreanu, Kitty Boxall, Diana Mincu

机构 * Robin AI Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in Natural Legal Language Processing - EMNLP Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07173 2025-10-09 cs.CL cs.LG 86%

NurseLLM: The First Specialized Language Model for Nursing

Md Tawkat Islam Khondaker, Julia Harrington, Shady Shehata

机构 * Yourika Labs(Yourika实验室) The University of British Columbia(不列颠哥伦比亚大学) Western University(西方大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07083 2025-10-09 cs.CL 85%

All Claims Are Equal, but Some Claims Are More Equal Than Others: Importance-Sensitive Factuality Evaluation of LLM Generations

Miriam Wanner, Leif Azzopardi, Paul Thomas, Soham Dan, Benjamin Van Durme, Nick Craswell

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软) University of Strathclyde(斯特拉思克莱德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14146 2025-10-09 cs.CL 85%

MMReview: A Multidisciplinary and Multimodal Benchmark for LLM-Based Peer Review Automation

Xian Gao, Jiacheng Ruan, Zongyun Zhang, Jingsheng Gao, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06253 2025-10-09 cs.CY cs.AI 85%

LLM-Driven Rubric-Based Assessment of Algebraic Competence in Multi-Stage Block Coding Tasks with Design and Field Evaluation

Yong Oh Lee, Byeonghun Bang, Sejun Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06231 2025-10-09 cs.CV cs.CL 85%

CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation

Mingzhe Zheng, Dingjie Song, Guanyu Zhou, Jun You, Jiahao Zhan, Xuran Ma, Xinyuan Song, Ser-Nam Lim, Qifeng Chen, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Lehigh University(莱斯大学) Fudan University(复旦大学) Emory University(埃默里大学) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04764 2025-10-09 cs.CL 85%

Are BabyLMs Deaf to Gricean Maxims? A Pragmatic Evaluation of Sample-efficient Language Models

Raha Askari, Sina Zarrieß, Özge Alacam, Judith Sieker

机构 * Department of Humanities, University of Turin(都灵大学人文学科系) Computational Linguistics, Department of Linguistics, Bielefeld University(比勒菲尔德大学语言学系计算语言学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted for the BabyLM workshop in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01555 2025-10-09 physics.ao-ph 85%

Structured dataset of reported cloud seeding activities in the United States (2000-2025) using an LLM

Jared Joseph Donohue, Kara D. Lamb

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05763 2025-10-09 cs.CL cs.AI cs.LG 85%

GMLM: Bridging Graph Neural Networks and Language Models for Heterophilic Node Classification

Aarush Sinha

机构 * Department of Computer Science ,University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16765 2025-10-09 cs.CL cs.AI cs.SD eess.AS 84%

The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology

Fagun Patel, Duc Q. Nguyen, Sang T. Truong, Jody Vaynshtok, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Sound Speech and Hearing Clinic(语音与听力诊所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16185 2025-10-09 cs.CL 83%

ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06782 2025-10-09 cs.HC cs.CL cs.CV 83%

GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting

Kaichun Yang, Jian Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06975 2025-10-09 cs.CR cs.AI cs.CL 82%

VelLMes: A high-interaction AI-based deception framework

Muris Sladić, Veronica Valeros, Carlos Catania, Sebastian Garcia

机构 * Czech Technical University in Prague(捷克技术大学布拉格)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 9 pages. 9 figures. 1 table. This is a preprint of a paper that was presented at the Active Defense and Deception Workshop colocated with IEEE EuroS&P 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06263 2025-10-09 cs.CL cs.AI 82%

Dual-stage and Lightweight Patient Chart Summarization for Emergency Physicians

Jiajun Wu, Swaleh Zaidi, Braden Teitge, Henry Leung, Jiayu Zhou, Jessalyn Holodinsky, Steve Drew

机构 * Department of Electrical and Software Engineering, University of Calgary, Calgary, AB, Canada(电气与软件工程系,卡尔加里大学) Department of Emergency Medicine, University of Calgary, Calgary, AB, Canada(急诊医学系,卡尔加里大学) School of Information, University of Michigan, Ann Arbor, MI, USA(信息学院,密歇根大学) Rockview General Hospital, Calgary, AB, Canada(罗克维尔总医院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

Comments Accepted at the IEEE Annual Congress on Artificial Intelligence of Things (IEEE AIoT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00051 2025-10-09 cs.CY 82%

Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe Language Models

Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Amir Abdullah, Jason Hoelscher-Obermaier, Jeff M. Phillips, Joshua Greaves, Clement Neo, Michael Lan, Fazl Barez, Shriyash Upadhyay

专题命中 评测与基准 :language model(title);LLM(abstract);foundation model(abstract)

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06857 2025-10-09 cs.AI 81%

Autoformalizer with Tool Feedback

Qi Guo, Jianing Wang, Jianfei Zhang, Deyang Kong, Xiangzhou Huang, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03487 2025-10-09 cs.LG cs.AI cs.CR q-bio.BM q-bio.QM 81%

SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models

Jigang Fan, Zhenghong Zhou, Ruofan Jin, Le Cong, Mengdi Wang, Zaixi Zhang

机构 * Peking University(北京大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06538 2025-10-09 cs.AI cs.LG 81%

Auto-Prompt Ensemble for LLM Judge

Jiajie Li, Huayi Zhang, Peng Lin, Jinjun Xiong, Wei Xu

机构 * University at Buffalo(布法罗大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20293 2025-10-09 cs.LG cs.AI 81%

When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity

Benjamin Feuer, Chiung-Yi Tseng, Astitwa Sarthak Lathe, Oussama Elachqar, John P Dickerson

机构 * Stanford University(斯坦福大学) SambaNova Mozilla AI(Mozilla人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06743 2025-10-09 cs.CV cs.AI cs.CL 80%

Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities

Maria Levchenko

机构 * Italian Institute of Germanic Studies (IISG)(意大利德语研究学院) University of Bologna(博洛尼亚大学)

专题命中 评测与基准 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments The First Workshop on Natural Language Processing and Language Models for Digital Humanities (LM4DH 2025). RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06997 2025-10-09 cs.CY cs.AI 79%

The Limits of Goal-Setting Theory in LLM-Driven Assessment

Mrityunjay Kumar

机构 * Birla Institute of Technology(巴尔塔理工学院)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

Comments Accepted at T4E 2025 for poster

详情

展开后加载摘要…

URL PDF HTML 收藏