arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-09 至 2025-10-09 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 48 篇

2505.01555 2025-10-09 physics.ao-ph 85%

Structured dataset of reported cloud seeding activities in the United States (2000-2025) using an LLM

Jared Joseph Donohue, Kara D. Lamb

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05763 2025-10-09 cs.CL cs.AI cs.LG 85%

GMLM: Bridging Graph Neural Networks and Language Models for Heterophilic Node Classification

Aarush Sinha

机构 * Department of Computer Science ,University of Copenhagen(计算机科学系,哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16765 2025-10-09 cs.CL cs.AI cs.SD eess.AS 84%

The Sound of Syntax: Finetuning and Comprehensive Evaluation of Language Models for Speech Pathology

Fagun Patel, Duc Q. Nguyen, Sang T. Truong, Jody Vaynshtok, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Sound Speech and Hearing Clinic(语音与听力诊所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16185 2025-10-09 cs.CL 83%

ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06782 2025-10-09 cs.HC cs.CL cs.CV 83%

GPT-5 Model Corrected GPT-4V's Chart Reading Errors, Not Prompting

Kaichun Yang, Jian Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06975 2025-10-09 cs.CR cs.AI cs.CL 82%

VelLMes: A high-interaction AI-based deception framework

Muris Sladić, Veronica Valeros, Carlos Catania, Sebastian Garcia

机构 * Czech Technical University in Prague(捷克技术大学布拉格)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 9 pages. 9 figures. 1 table. This is a preprint of a paper that was presented at the Active Defense and Deception Workshop colocated with IEEE EuroS&P 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06263 2025-10-09 cs.CL cs.AI 82%

Dual-stage and Lightweight Patient Chart Summarization for Emergency Physicians

Jiajun Wu, Swaleh Zaidi, Braden Teitge, Henry Leung, Jiayu Zhou, Jessalyn Holodinsky, Steve Drew

机构 * Department of Electrical and Software Engineering, University of Calgary, Calgary, AB, Canada(电气与软件工程系,卡尔加里大学) Department of Emergency Medicine, University of Calgary, Calgary, AB, Canada(急诊医学系,卡尔加里大学) School of Information, University of Michigan, Ann Arbor, MI, USA(信息学院,密歇根大学) Rockview General Hospital, Calgary, AB, Canada(罗克维尔总医院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)

Comments Accepted at the IEEE Annual Congress on Artificial Intelligence of Things (IEEE AIoT) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00051 2025-10-09 cs.CY 82%

Beyond Monoliths: Expert Orchestration for More Capable, Democratic, and Safe Language Models

Philip Quirke, Narmeen Oozeer, Chaithanya Bandi, Amir Abdullah, Jason Hoelscher-Obermaier, Jeff M. Phillips, Joshua Greaves, Clement Neo, Michael Lan, Fazl Barez, Shriyash Upadhyay

专题命中 评测与基准 :language model(title);LLM(abstract);foundation model(abstract)

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06857 2025-10-09 cs.AI 81%

Autoformalizer with Tool Feedback

Qi Guo, Jianing Wang, Jianfei Zhang, Deyang Kong, Xiangzhou Huang, Xiangyu Xi, Wei Wang, Jingang Wang, Xunliang Cai, Shikun Zhang, Wei Ye

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03487 2025-10-09 cs.LG cs.AI cs.CR q-bio.BM q-bio.QM 81%

SafeProtein: Red-Teaming Framework and Benchmark for Protein Foundation Models

Jigang Fan, Zhenghong Zhou, Ruofan Jin, Le Cong, Mengdi Wang, Zaixi Zhang

机构 * Peking University(北京大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06538 2025-10-09 cs.AI cs.LG 81%

Auto-Prompt Ensemble for LLM Judge

Jiajie Li, Huayi Zhang, Peng Lin, Jinjun Xiong, Wei Xu

机构 * University at Buffalo(布法罗大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20293 2025-10-09 cs.LG cs.AI 81%

When Judgment Becomes Noise: How Design Failures in LLM Judge Benchmarks Silently Undermine Validity

Benjamin Feuer, Chiung-Yi Tseng, Astitwa Sarthak Lathe, Oussama Elachqar, John P Dickerson

机构 * Stanford University(斯坦福大学) SambaNova Mozilla AI(Mozilla人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06743 2025-10-09 cs.CV cs.AI cs.CL 80%

Evaluating LLMs for Historical Document OCR: A Methodological Framework for Digital Humanities

Maria Levchenko

机构 * Italian Institute of Germanic Studies (IISG)(意大利德语研究学院) University of Bologna(博洛尼亚大学)

专题命中 评测与基准 :language model(abstract,comments);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments The First Workshop on Natural Language Processing and Language Models for Digital Humanities (LM4DH 2025). RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06997 2025-10-09 cs.CY cs.AI 79%

The Limits of Goal-Setting Theory in LLM-Driven Assessment

Mrityunjay Kumar

机构 * Birla Institute of Technology(巴尔塔理工学院)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

Comments Accepted at T4E 2025 for poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01213 2025-10-09 cs.CL cs.HC 79%

Show or Tell? Modeling the evolution of request-making in Human-LLM conversations

Shengqi Zhu, Jeffrey M. Rzeszotarski, David Mimno

机构 * Department of Information Science(信息科学系) Cornell University(康奈尔大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01382 2025-10-09 cs.AI cs.CL 79%

An Illusion of Progress? Assessing the Current State of Web Agents

Tianci Xue, Weijian Qi, Tianneng Shi, Chan Hee Song, Boyu Gou, Dawn Song, Huan Sun, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 17 figures, 7 tables

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01655 2025-10-09 eess.AS cs.SD 78%

Self-Supervised Speech Quality Assessment (S3QA): Leveraging Speech Foundation Models for a Scalable Speech Quality Metric

Mattson Ogg, Caitlyn Bishop, Han Yi, Sarah Robinson

专题命中 评测与基准 :foundation model(title,abstract)

Comments 1 table, seven figures, thirteen pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06426 2025-10-09 cs.CL 77%

FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering

Yitao Long, Tiansheng Hu, Yilun Zhao, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06411 2025-10-09 cs.CL 77%

Instructional Goal-Aligned Question Generation for Student Evaluation in Virtual Lab Settings: How Closely Do LLMs Actually Align?

R. Alexander Knipper, Indrani Dey, Souvika Sarkar, Hari Narayanan, Sadhana Puntambekar, Santu Karmaker

机构 * Department of EdPsych, University of Wisconsin-Madison(威斯康星大学麦迪逊分校教育心理学系) Department of CS, Wichita State University(威斯康星州立大学Wichita分校计算机科学系) Department of CSSE, Auburn University(阿伯茨罕大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15397 2025-10-09 cs.SE 75%

Analyzing and Mitigating Surface Bias in Code Evaluation Metrics

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07077 2025-10-09 cs.RO cs.AI cs.CV cs.LG 73%

Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications

Kento Kawaharazuka, Jihoon Oh, Jun Yamada, Ingmar Posner, Yuke Zhu

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE Access, website: https://vla-survey.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12891 2025-10-09 cs.AI cs.CL 73%

TIME: A Multi-level Benchmark for Temporal Reasoning of LLMs in Real-World Scenarios

Shaohang Wei, Wei Li, Feifan Song, Wen Luo, Tianyi Zhuang, Haochen Tan, Zhijiang Guo, Houfeng Wang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06525 2025-10-09 cs.LG cs.CR 72%

Text-to-Image Models Leave Identifiable Signatures: Implications for Leaderboard Security

Ali Naseh, Anshuman Suri, Yuefeng Peng, Harsh Chaudhari, Alina Oprea, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG;LLM(comments)

Comments Accepted at Lock-LLM Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06805 2025-10-09 cs.CL cs.IR 70%

Overview of the Plagiarism Detection Task at PAN 2025

André Greiner-Petter, Maik Fröbe, Jan Philip Wahle, Terry Ruas, Bela Gipp, Akiko Aizawa, Martin Potthast

机构 * National Institute of Informatics(日本信息机构国家研究所) University of Kassel(卡塞尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Working Notes at PAN at CLEF 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06239 2025-10-09 cs.CL 70%

OpenStaxQA: A multilingual dataset based on open-source college textbooks

Pranav Gupta

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07156 2025-10-09 cs.HC 67%

AI for Abolition? A Participatory Design Approach

Carolyn Wang, Avriel Epps, Taylor Ferrari, Ra Ames

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 8 pages, to be published in the Workshop Proceedings of the HHAI 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06872 2025-10-09 cs.HC 67%

Prototyping Multimodal GenAI Real-Time Agents with Counterfactual Replays and Hybrid Wizard-of-Oz

Frederic Gmeiner, Kenneth Holstein, Nikolas Martelaro

专题命中 评测与基准 :LLM(abstract);prompting(abstract)

Comments 18 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06838 2025-10-09 cs.IR cs.CL 57%

Crossing Domains without Labels: Distant Supervision for Term Extraction

Elena Senger, Yuri Campbell, Rob van der Goot, Barbara Plank

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) Fraunhofer Center for International Management and Knowledge Economy IMW(弗劳恩霍夫国际管理与知识经济中心) Department of Computer Science, IT University of Copenhagen(计算机科学系,丹麦技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments Accepted at EMNLP Industry Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02152 2025-10-09 cs.RO 50%

Interleave-VLA: Enhancing Robot Manipulation with Interleaved Image-Text Instructions

Cunxin Fan, Xiaosong Jia, Yihang Sun, Yixiao Wang, Jianglan Wei, Ziyang Gong, Xiangyu Zhao, Masayoshi Tomizuka, Xue Yang, Junchi Yan, Mingyu Ding

机构 * Shanghai Jiao Tong University(上海交通大学) UC Berkeley(伯克利大学) UNC, Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06827 2025-10-09 cs.CV 50%

StyleKeeper: Prevent Content Leakage using Negative Visual Query Guidance

Jaeseok Jeong, Junho Kim, Gayoung Lee, Yunjey Choi, Youngjung Uh

机构 * Yonsei University(延世大学) NAVER AI Lab(NAVER AI实验室)

专题命中 评测与基准 :prompting(abstract)

Comments Accepted to ICCV 2025; CVPRW AI4CC 2024 (Best Paper + Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏