arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-07 至 2025-10-07 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2510.03913 2025-10-07 cs.CL 90%

PsycholexTherapy: Simulating Reasoning in Psychotherapy with Small Language Models in Persian

Mohammad Amin Abbasi, Hassan Naderi

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04400 2025-10-07 cs.CL cs.AI 90%

Large Language Models Preserve Semantic Isotopies in Story Continuations

Marc Cavazza

机构 * University of Stirling(斯特林大学) National Institute of Informatics(日本信息处理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04032 2025-10-07 cs.CL cs.AI 90%

Small Language Models for Emergency Departments Decision Support: A Benchmark Study

Zirui Wang, Jiajun Wu, Braden Teitge, Jessalyn Holodinsky, Steve Drew

机构 * Department of Electrical and Software Engineering, University of Calgary, Calgary, AB, Canada(电气与软件工程系,卡尔加里大学) Department of Emergency Medicine, University of Calgary, Calgary, AB, Canada(急诊医学系,卡尔加里大学) Rockview General Hospital, Calgary, AB, Canada(罗克维尔医院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to 2025 IEEE International Conference on Autonomous and Trusted Computing (ATC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19144 2025-10-07 cs.LG cs.AI 90%

Solar Photovoltaic Assessment with Large Language Model

Muhao Guo, Yang Weng

机构 * Department of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程系,亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20115 2025-10-07 cs.DL cs.AI cs.DB 89%

Flexible metadata harvesting for ecology using large language models

Zehao Lu, Thijs L van der Plas, Parinaz Rashidi, W Daniel Kissling, Ioannis N Athanasiadis

机构 * Wageningen University & Research(瓦赫宁根大学与研究学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04293 2025-10-07 cs.CL 89%

Equipping Retrieval-Augmented Large Language Models with Document Structure Awareness

Lingnan Xu, Chong Feng, Kaiyuan Zhang, Liu Zhengyong, Wenqiang Xu, Fanqing Meng

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学) Ant Group(蚂蚁集团) Southeast Academy of Information Technology, Beijing Institute of Technology(信息科技东南学院,北京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04051 2025-10-07 cs.AI 89%

Toward a unified framework for data-efficient evaluation of large language models

Lele Liao, Qile Zhang, Ruofan Wu, Guanhua Fang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments codes available at https://github.com/Rorschach1989/efficient-lm-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19064 2025-10-07 cs.CL 89%

Can Large Language Models Outperform Non-Experts in Poetry Evaluation? A Comparative Study Using the Consensual Assessment Technique

Piotr Sawicki, Marek Grześ, Dan Brown, Fabrício Góes

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 18 pages, 3 figures. Accepted for publication at the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11625 2025-10-07 cs.CL cs.AI cs.CV cs.LG 89%

MapIQ: Evaluating Multimodal Large Language Models for Map Question Answering

Varun Srivastava, Fan Lei, Srija Mukhopadhyay, Vivek Gupta, Ross Maciejewski

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学) Department of Computer Science(计算机科学系) International Institute of Information Technology(国际信息科技研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23500 2025-10-07 cs.SE cs.CL cs.DL 88%

Identity resolution of software metadata using Large Language Models

Eva Martín del Pico, Josep Lluís Gelpí, Salvador Capella-Gutiérrez

机构 * Barcelona Supercomputing Center, Barcelona, Spain(巴塞罗那超级计算中心) Department of Biochemistry and Molecular Biology, University of Barcelona, Barcelona, Spain(生物化学与分子生物学系,巴塞罗那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04013 2025-10-07 cs.CL 87%

LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization

Jiarui Liu, Jivitesh Jain, Mona Diab, Nishant Subramani

机构 * Carnege Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04950 2025-10-07 cs.CL cs.AI cs.LG cs.NE stat.ME 87%

Mind Your Tone: Investigating How Prompt Politeness Affects LLM Accuracy (short paper)

Om Dobariya, Akhil Kumar

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 5 pages, 3 tables; includes Limitations and Ethical Considerations sections; short paper under submission to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10127 2025-10-07 cs.CL cs.AI cs.LG 87%

Population-Aligned Persona Generation for LLM-based Social Simulation

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Max Xiong, Yuxuan Lei, Tianfu Wang, Kaize Ding, Ziang Xiao, Nicholas Jing Yuan, Xing Xie

机构 * HKUST(香港科技大学) Microsoft Research Asia(微软亚洲研究院) Duke University(杜克大学) Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02089 2025-10-07 cs.LG cs.AI cs.CR 86%

SALAD: Systematic Assessment of Machine Unlearning on LLM-Aided Hardware Design

Zeng Wang, Minghao Shao, Rupesh Karn, Likhitha Mankali, Jitendra Bhandari, Ramesh Karri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03862 2025-10-07 cs.SE cs.AI 85%

Designing Empirical Studies on LLM-Based Code Generation: Towards a Reference Framework

Nathalia Nascimento, Everton Guimaraes, Paulo Alencar

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(多伦多大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03795 2025-10-07 cs.IR cs.CL 85%

Investigating LLM Variability in Personalized Conversational Information Retrieval

Simon Lupart, Daniël van Dijk, Eric Langezaal, Ian van Dort, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 11 pages, 5 figures, SIGIR-AP'25 Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP 2025), December 7--10, 2025, Xi'an, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03719 2025-10-07 cs.CY cs.HC 85%

A Survey of LLM-Based Applications in Programming Education: Balancing Automation and Human Oversight

Griffin Pitts, Anurata Prabha Hridi, Arun-Balajiee Lekshmi-Narayanan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 2025 EMNLP HCI+NLP Workshop Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03641 2025-10-07 cs.SE 85%

Generating High-Level Test Cases from Requirements using LLM: An Industry Study

Satoshi Masuda, Satoshi Kouzawa, Kyousuke Sezai, Hidetoshi Suhara, Yasuaki Hiruta, Kunihiro Kudou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 11pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04023 2025-10-07 cs.AI cs.CL 84%

LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions

Mizanur Rahman, Amran Bhuiyan, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Ridwan Mahbub, Ahmed Masry, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Vector Institute for AI(人工智能矢量研究所) Dialpad Inc.(Dialpad公司) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Survey paper; 45 data science agents; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04997 2025-10-07 cs.SE cs.AI 83%

AutoEmpirical: LLM-Based Automated Research for Empirical Software Fault Analysis

Jiongchi Yu, Weipeng Jiang, Xiaoyu Zhang, Qiang Hu, Xiaofei Xie, Chao Shen

机构 * Singapore Management University(新加坡国立管理学院) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Tianjin University(天津大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22830 2025-10-07 cs.CL cs.AI 82%

What Has Been Lost with Synthetic Evaluation?

Alexander Gill, Abhilasha Ravichander, Ana Marasović

机构 * University of Utah(犹他大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments v3: Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09199 2025-10-07 cs.SE 82%

Back to the Basics: Rethinking Issue-Commit Linking with LLM-Assisted Retrieval

Huihui Huang, Ratnadira Widyasari, Ting Zhang, Ivana Clairine Irsan, Jieke Shi, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, Hong Jin Kang, David Lo

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04009 2025-10-07 cs.AI cs.CL 81%

What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models

Zicong He, Boxuan Zhang, Weihao Liu, Ruixiang Tang, Lu Cheng

机构 * Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09887 2025-10-07 cs.LG cs.AI eess.SP 81%

TolerantECG: A Foundation Model for Imperfect Electrocardiogram

Huynh Dang Nguyen, Trong-Thang Pham, Ngan Le, Van Nguyen

机构 * AI Center, FPT Software(FPT软件人工智能中心) EECS, University of Arkansas(亚利桑那大学电子工程与计算机科学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04721 2025-10-07 cs.AI cs.CL cs.LG 80%

BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs

Ivo Petrov, Jasper Dekoninck, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧布里斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03688 2025-10-07 cs.AI cs.CL cs.LG 80%

AgentBench: Evaluating LLMs as Agents

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) The Ohio State University(俄亥俄州立大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04302 2025-10-07 cs.CL 79%

Measuring Language Model Hallucinations Through Distributional Correctness

Thomas F Burns

机构 * Aleph Alpha Research(Aleph Alpha 研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14574 2025-10-07 cs.CV cs.AI 79%

Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark

Rashid Mushkani

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00534 2025-10-07 cs.CR cs.AI 79%

The Security Threat of Compressed Projectors in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Large Language Model Department, Tencent(腾讯大语言模型部门) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01344 2025-10-07 cs.HC cs.AI cs.CR 79%

Privacy Leakage Overshadowed by Views of AI: A Study on Human Oversight of Privacy in Language Model Agent

Zhiping Zhang, Bingcan Guo, Tianshi Li

机构 * Northeastern University(东北大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏