arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-05 至 2025-09-05 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2508.15478 2025-09-05 cs.CL cs.CY cs.PF 92%

SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version

Nghiem Thanh Pham, Tung Kieu, Duc-Manh Nguyen, Son Ha Xuan, Nghia Duong-Trung, Danh Le-Phuoc

机构 * FPT University(FPT大学) Aalborg University(奥尔堡大学) Technische Universität Berlin(柏林技术大学) RMIT University(皇家理工大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) HiveIntel GmbH(HiveIntel公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(title,abstract);分类 cs.CL

Comments 24 pages. An extended version of "SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts" accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01185 2025-09-05 cs.CL cs.AI 89%

Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation

Seganrasan Subramanian, Abhigya Verma

机构 * ServiceNow

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);SFT(abstract);preference optimization(abstract)

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01359 2025-09-05 cs.CL cs.SE 88%

R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models

Ken Deng, Jiaheng Liu, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04007 2025-09-05 cs.AI 85%

AutoPBO: LLM-powered Optimization for Local Search PBO Solvers

Jinyuan Li, Yi Chu, Yiwen Sun, Mengchuan Zou, Shaowei Cai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03312 2025-09-05 cs.CL cs.MA 85%

AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?

Guibin Zhang, Junhao Wang, Junjie Chen, Wangchunshu Zhou, Kun Wang, Shuicheng Yan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09002 2025-09-05 cs.SE cs.AI cs.CR cs.OS 85%

KNighter: Transforming Static Analysis with LLM-Synthesized Checkers

Chenyuan Yang, Zijie Zhao, Zichen Xie, Haoyu Li, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments SOSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05982 2025-09-05 cs.CL 85%

HamRaz: A Culture-Based Persian Conversation Dataset for Person-Centered Therapy Using LLM Agents

Mohammad Amin Abbasi, Farnaz Sadat Mirnezami, Ali Neshati, Hassan Naderi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04198 2025-09-05 cs.CY cs.MA 85%

Are LLM Agents the New RPA? A Comparative Study with RPA Across Enterprise Workflows

Petr Průcha, Michaela Matoušková, Jan Strnad

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01085 2025-09-05 cs.LG cs.CL 84%

Explaining Length Bias in LLM-Based Preference Evaluations

Zhengyu Hu, Linxin Song, Jieyu Zhang, Zheyuan Xiao, Tianfu Wang, Zhengyu Chen, Nicholas Jing Yuan, Jianxun Lian, Kaize Ding, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou), China(人工智能前沿技术部,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(计算机科学与工程系,香港科技大学) University of Southern California(南加州大学) University of Washington(华盛顿大学) MeiTuan(美团) Microsoft(微软) Resideo(Resideo公司) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04191 2025-09-05 cs.CR cs.LG 83%

KubeGuard: LLM-Assisted Kubernetes Hardening via Configuration Files and Runtime Logs Analysis

Omri Sgan Cohen, Ehud Malul, Yair Meidan, Dudu Mimran, Yuval Elovici, Asaf Shabtai

机构 * Department of Software and Information Systems Engineering(软件与信息系统工程系) Ben-Gurion University of The Negev(贝内杰尔大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03800 2025-09-05 cs.CV 82%

MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting

Yuheng Li, Yenho Chen, Yuxiang Lai, Jike Zhong, Vanessa Wildman, Xiaofeng Yang

机构 * Department of Biomedical Engineering(生物医学工程系) Georgia Institute of Technology(佐治亚理工学院) Department of Machine Learning(机器学习系) Department of Radiation Oncology(放射肿瘤科) Emory University School of Medicine(埃默里大学医学院) University of Southern California(南加州大学)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04292 2025-09-05 cs.CL 81%

Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?

Qinyan Zhang, Xinping Lei, Ruijie Miao, Yu Fu, Haojie Fan, Le Chang, Jiafan Hou, Dingling Zhang, Zhongfei Hou, Ziqiang Yang, Changxin Pu, Fei Hu, Jingkai Liu, Mengyun Liu, Yang Liu, Xiang Gao, Jiaheng Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed(字节跳动种子) Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04213 2025-09-05 eess.SY cs.LG cs.SY 79%

Sailing Towards Zero-Shot State Estimation using Foundation Models Combined with a UKF

Tobin Holtmann, David Stenger, Andres Posada-Moreno, Friedrich Solowjow, Sebastian Trimpe

机构 * Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛RWTH大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments Accepted for publication at CDC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04013 2025-09-05 cs.CL cs.AI 79%

On Robustness and Reliability of Benchmark-Based Evaluation of LLMs

Riccardo Lunardi, Vincenzo Della Mea, Stefano Mizzaro, Kevin Roitero

机构 * University of Udine, Italy(乌迪内大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03940 2025-09-05 cs.CL cs.AI cs.SD 79%

VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents

Weihao Wu, Liang Cao, Xinyu Wu, Zhiwei Lin, Rui Niu, Jingbei Li, Zhiyong Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03809 2025-09-05 cs.CL cs.AI 79%

Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation

Jiaxin Guo, Daimeng Wei, Yuanchang Luo, Xiaoyu Chen, Zhanglin Wu, Huan Yang, Hengchao Shang, Zongyao Li, Zhiqiang Rao, Jinlong Yang, Hao Yang

机构 * Huawei Translation Services Center(华为翻译服务中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

Comments under preview

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10823 2025-09-05 cs.CV eess.IV 78%

From Embeddings to Accuracy: Comparing Foundation Models for Radiographic Classification

Xue Li, Jameson Merkow, Noel C. F. Codella, Alberto Santamaria-Pang, Naiteek Sangani, Alexander Ersoy, Christopher Burt, John W. Garrett, Richard J. Bruce, Joshua D. Warner, Tyler Bradshaw, Ivan Tarapov, Matthew P. Lungren, Alan B. McMillan

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Health and Life Sciences(微软健康与生命科学)

专题命中 评测与基准 :foundation model(title,abstract)

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13392 2025-09-05 cs.CV cs.HC 78%

POET: Supporting Prompting Creativity and Personalization with Automated Expansion of Text-to-Image Generation

Evans Xu Han, Alice Qian Zhang, Haiyi Zhu, Hong Shen, Paul Pu Liang, Jane Hsieh

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03891 2025-09-05 cs.CL cs.CV 77%

MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation

Gowen Loo, Chang Liu, Qinghong Yin, Xiang Chen, Jiawei Chen, Jingyuan Zhang, Yu Tian

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03857 2025-09-05 cs.AI 77%

Continuous Monitoring of Large-Scale Generative AI via Deterministic Knowledge Graph Structures

Kishor Datta Gupta, Mohd Ariful Haque, Hasmot Ali, Marufa Kamal, Syed Bahauddin Alam, Mohammad Ashiqur Rahman

机构 * Clark Atlanta University(克拉克阿特兰大学) Daffodil International University(达福迪国际大学) BRAC University(BRAC大学) The Grainger College of Engineering Nuclear Plasma & Radiological Engineering University of Illinois Urbana-Champaign(格拉inger工程学院核物理与放射性工程大学伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering Florida International University(电气与计算机工程系佛罗里达国际大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03741 2025-09-05 cs.HC cs.AI 77%

Designing Gaze Analytics for ELA Instruction: A User-Centered Dashboard with Conversational AI Support

Eduardo Davalos, Yike Zhang, Shruti Jain, Namrata Srivastava, Trieu Truong, Nafees-ul Haque, Tristan Van, Jorge Salas, Sara McFadden, Sun-Joo Cho, Gautam Biswas, Amanda Goodwin

机构 * Trinity University(特里尼蒂大学) St. Mary's University(圣玛丽大学) Vanderbilt University(范德比大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 22 pages, 9 figures, 3 tables, submitted to IUI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04316 2025-09-05 cs.CL 77%

Small Changes, Large Consequences: Analyzing the Allocational Fairness of LLMs in Hiring Contexts

Preethi Seshadri, Hongyu Chen, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(uci)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03696 2025-09-05 cs.IR 75%

LLMs for estimating positional bias in logged interaction data

Aleksandr V. Petrov, Michael Murtagh, Karthik Nagesh

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at the CONSEQUENCES Workshop @ RecSys'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03528 2025-09-05 cs.CL cs.CY cs.LG 73%

The ProLiFIC dataset: Leveraging LLMs to Unveil the Italian Lawmaking Process

Matilde Contestabile, Chiara Ferrara, Alberto Giovannetti, Giovanni Parrillo, Andrea Vandin

机构 * Sant'Anna School of Advanced Studies Pisa(圣安娜高级研究学院皮萨) DTU Technical University of Denmark(丹麦技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02349 2025-09-05 cs.SD cs.AI cs.LG 73%

AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation

Lu Wang, Hao Chen, Siyu Wu, Zhiyue Wu, Hao Zhou, Chengfeng Zhang, Ting Wang, Haodi Zhang

机构 * Lu Wang(卢王) Hao Chen(何晨) Siyu Wu(武士) Zhiyue Wu(吴致岳) Hao Zhou(周浩) Chengfeng Zhang(张成峰) Ting Wang(王婷) Haodi Zhang(张浩迪)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23746 2025-09-05 cs.CV cs.CL cs.LG cs.MM cs.SI 73%

Short-video Propagation Influence Rating: A New Real-world Dataset and A New Large Graph Model

Dizhan Xue, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Qihoo 360 AI lab(奇虎360 AI实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04202 2025-09-05 cs.CL cs.SI 70%

Explicit and Implicit Data Augmentation for Social Event Detection

Congbo Ma, Yuxia Wang, Jia Wu, Jian Yang, Jing Du, Zitai Qiu, Qing Li, Hu Wang, Preslav Nakov

机构 * Macquarie University(麦考瑞大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03793 2025-09-05 cs.MA cs.AI 70%

SAMVAD: A Multi-Agent System for Simulating Judicial Deliberation Dynamics in India

Prathamesh Devadiga, Omkaar Jayadev Shetty, Pooja Agarwal

机构 * PES University(PES大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03610 2025-09-05 cs.CL 70%

NoteBar: An AI-Assisted Note-Taking System for Personal Knowledge Management

Josh Wisoff, Yao Tang, Zhengyu Fang, Jordan Guzman, YuTang Wang, Alex Yu

机构 * NoteBar Research(NoteBar研究) University of Rochester(罗切斯特大学) Case Western Reserve University(凯斯西储大学) Skidmore College(斯克里文学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10438 2025-09-05 cs.LG math.OC stat.ML 70%

MARS: Unleashing the Power of Variance Reduction for Training Large Models

Huizhuo Yuan, Yifeng Liu, Shuang Wu, Xun Zhou, Quanquan Gu

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 35 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏