arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-07 至 2025-10-07 共收录 382 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 82 篇

2510.04950 2025-10-07 cs.CL cs.AI cs.LG cs.NE stat.ME 87%

Mind Your Tone: Investigating How Prompt Politeness Affects LLM Accuracy (short paper)

Om Dobariya, Akhil Kumar

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 5 pages, 3 tables; includes Limitations and Ethical Considerations sections; short paper under submission to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10127 2025-10-07 cs.CL cs.AI cs.LG 87%

Population-Aligned Persona Generation for LLM-based Social Simulation

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Max Xiong, Yuxuan Lei, Tianfu Wang, Kaize Ding, Ziang Xiao, Nicholas Jing Yuan, Xing Xie

机构 * HKUST(香港科技大学) Microsoft Research Asia(微软亚洲研究院) Duke University(杜克大学) Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02089 2025-10-07 cs.LG cs.AI cs.CR 86%

SALAD: Systematic Assessment of Machine Unlearning on LLM-Aided Hardware Design

Zeng Wang, Minghao Shao, Rupesh Karn, Likhitha Mankali, Jitendra Bhandari, Ramesh Karri, Ozgur Sinanoglu, Muhammad Shafique, Johann Knechtel

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03862 2025-10-07 cs.SE cs.AI 85%

Designing Empirical Studies on LLM-Based Code Generation: Towards a Reference Framework

Nathalia Nascimento, Everton Guimaraes, Paulo Alencar

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(多伦多大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03795 2025-10-07 cs.IR cs.CL 85%

Investigating LLM Variability in Personalized Conversational Information Retrieval

Simon Lupart, Daniël van Dijk, Eric Langezaal, Ian van Dort, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 11 pages, 5 figures, SIGIR-AP'25 Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP 2025), December 7--10, 2025, Xi'an, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03719 2025-10-07 cs.CY cs.HC 85%

A Survey of LLM-Based Applications in Programming Education: Balancing Automation and Human Oversight

Griffin Pitts, Anurata Prabha Hridi, Arun-Balajiee Lekshmi-Narayanan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 2025 EMNLP HCI+NLP Workshop Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03641 2025-10-07 cs.SE 85%

Generating High-Level Test Cases from Requirements using LLM: An Industry Study

Satoshi Masuda, Satoshi Kouzawa, Kyousuke Sezai, Hidetoshi Suhara, Yasuaki Hiruta, Kunihiro Kudou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 11pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04023 2025-10-07 cs.AI cs.CL 84%

LLM-Based Data Science Agents: A Survey of Capabilities, Challenges, and Future Directions

Mizanur Rahman, Amran Bhuiyan, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Ridwan Mahbub, Ahmed Masry, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Vector Institute for AI(人工智能矢量研究所) Dialpad Inc.(Dialpad公司) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Survey paper; 45 data science agents; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04997 2025-10-07 cs.SE cs.AI 83%

AutoEmpirical: LLM-Based Automated Research for Empirical Software Fault Analysis

Jiongchi Yu, Weipeng Jiang, Xiaoyu Zhang, Qiang Hu, Xiaofei Xie, Chao Shen

机构 * Singapore Management University(新加坡国立管理学院) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Tianjin University(天津大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22830 2025-10-07 cs.CL cs.AI 82%

What Has Been Lost with Synthetic Evaluation?

Alexander Gill, Abhilasha Ravichander, Ana Marasović

机构 * University of Utah(犹他大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments v3: Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09199 2025-10-07 cs.SE 82%

Back to the Basics: Rethinking Issue-Commit Linking with LLM-Assisted Retrieval

Huihui Huang, Ratnadira Widyasari, Ting Zhang, Ivana Clairine Irsan, Jieke Shi, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, Hong Jin Kang, David Lo

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04009 2025-10-07 cs.AI cs.CL 81%

What Shapes a Creative Machine Mind? Comprehensively Benchmarking Creativity in Foundation Models

Zicong He, Boxuan Zhang, Weihao Liu, Ruixiang Tang, Lu Cheng

机构 * Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09887 2025-10-07 cs.LG cs.AI eess.SP 81%

TolerantECG: A Foundation Model for Imperfect Electrocardiogram

Huynh Dang Nguyen, Trong-Thang Pham, Ngan Le, Van Nguyen

机构 * AI Center, FPT Software(FPT软件人工智能中心) EECS, University of Arkansas(亚利桑那大学电子工程与计算机科学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted at ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04721 2025-10-07 cs.AI cs.CL cs.LG 80%

BrokenMath: A Benchmark for Sycophancy in Theorem Proving with LLMs

Ivo Petrov, Jasper Dekoninck, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧布里斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03688 2025-10-07 cs.AI cs.CL cs.LG 80%

AgentBench: Evaluating LLMs as Agents

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) The Ohio State University(俄亥俄州立大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04302 2025-10-07 cs.CL 79%

Measuring Language Model Hallucinations Through Distributional Correctness

Thomas F Burns

机构 * Aleph Alpha Research(Aleph Alpha 研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14574 2025-10-07 cs.CV cs.AI 79%

Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark

Rashid Mushkani

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00534 2025-10-07 cs.CR cs.AI 79%

The Security Threat of Compressed Projectors in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Large Language Model Department, Tencent(腾讯大语言模型部门) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01344 2025-10-07 cs.HC cs.AI cs.CR 79%

Privacy Leakage Overshadowed by Views of AI: A Study on Human Oversight of Privacy in Language Model Agent

Zhiping Zhang, Bingcan Guo, Tianshi Li

机构 * Northeastern University(东北大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04919 2025-10-07 cs.CL cs.AI cs.DB 79%

Do LLMs Align with My Task? Evaluating Text-to-SQL via Dataset Alignment

Davood Rafiei, Morgan Lindsay Heisler, Weiwei Zhang, Mohammadreza Pourreza, Yong Zhang

机构 * University of Alberta(阿尔伯塔大学) Huawei Tech. Canada(华为技术加拿大)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03636 2025-10-07 cs.LG cs.CL cs.CR 79%

From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse

Rabeya Amin Jhuma, Mostafa Mohaimen Akand Faisal

机构 * University of Information Technology and Sciences (UITS)(信息科技与科学大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22968 2025-10-07 cs.CL cs.AI 79%

C3: A Bilingual Benchmark for Spoken Dialogue Models Exploring Challenges in Complex Conversations

Chengqian Ma, Wei Tao, Yiwen Guo

机构 * Peking University(北京大学) LIGHTSPEED

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 main; Project Page: https://step-out.github.io/C3-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18209 2025-10-07 cs.CL cs.AI 79%

League: Leaderboard Generation on Demand

Jian Wu, Jiayu Zhang, Dongyuan Li, Linyi Yang, Aoxiao Zhong, Renhe Jiang, Qingsong Wen, Yue Zhang

机构 * School of Engineering, Westlake University(西拉丘陵大学工程学院) Peking University(北京大学) University of Tokyo(东京大学) University College London(伦敦大学学院) AI Research Institute, Squirrel AI Learning(Squirrel AI Learning人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10659 2025-10-07 cs.SI cs.AI cs.CL cs.MA 79%

Network Formation and Dynamics Among Multi-LLMs

Marios Papachristou, Yuan Yuan

机构 * Department of Information Systems, W.P. Carey School of Business, Arizona State University, Tempe, AZ, USA(亚利桑那州立大学信息系统系,W.P. Carey商学院,Tempe分校) Department of Computer Science, Cornell University, Ithaca, NY, USA(康奈尔大学计算机科学系) Graduate School of Management, University of California Davis, Davis, CA, USA(加州大学戴维斯分校管理研究生院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at PNAS Nexus

Journal ref PNAS Nexus 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03840 2025-10-07 cs.CV 78%

Mirage: Unveiling Hidden Artifacts in Synthetic Images with Large Vision-Language Models

Pranav Sharma, Shivank Garg, Durga Toshniwal

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥里分校)

专题命中 评测与基准 :language model(title,abstract)

Comments ACM MM'25, MALLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01315 2025-10-07 cs.SE 78%

Wired for Reuse: Automating Context-Aware Code Adaptation in IDEs via LLM-Based Agent

Taiming Wang, Yanjie Jiang, Chunhao Dong, Yuxia Zhang, Hui Liu

专题命中 评测与基准 :LLM(title,abstract)

Comments Accepted by ASE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03376 2025-10-07 cs.CV eess.IV 78%

Visual Language Model as a Judge for Object Detection in Industrial Diagrams

Sanjukta Ghosh

专题命中 评测与基准 :language model(title,abstract)

Comments Pre-review version submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03873 2025-10-07 cs.CV cs.AI 77%

PoseGaze-AHP: A Knowledge-Based 3D Dataset for AI-Driven Ocular and Postural Diagnosis

Saja Al-Dabet, Sherzod Turaev, Nazar Zaki, Arif O. Khan, Luai Eldweik

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments This is a preprint version of a manuscript under review. All rights reserved by the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04519 2025-10-07 cs.SE 75%

Spec2Control: Automating PLC/DCS Control-Logic Engineering from Natural Language Requirements with LLMs - A Multi-Plant Evaluation

Heiko Koziolek, Thilo Braun, Virendra Ashiwal, Sofia Linsbauer, Marthe Ahlgreen Hansen, Karoline Grotterud

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04463 2025-10-07 cs.SD eess.AS 75%

Evaluating Self-Supervised Speech Models via Text-Based LLMS

Takashi Maekaku, Keita Goto, Jinchuan Tian, Yusuke Shinohara, Shinji Watanabe

机构 * LY Corporation(LY公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏