arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2305.12720 2023-05-23 cs.CL cs.AI 92%

llm-japanese-dataset v0: Construction of Japanese Chat Dataset for Large Language Models and its Methodology

Masanori Hirano, Masahiro Suzuki, Hiroki Sakaji

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04160 2023-05-23 cs.CL cs.AI cs.CV eess.AS 92%

X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages

Feilong Chen, Minglun Han, Haozhi Zhao, Qingyang Zhang, Jing Shi, Shuang Xu, Bo Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19308 2026-08-05 cs.SD cs.CL eess.AS 版本更新 92%

The Eloquence team submission for task 1 of MLC-SLM challenge

Eloquence团队针对MLC-SLM挑战赛任务1的提交

Lorenzo Concina, Jordi Luque, Alessio Brutti, Marco Matassoni, Yuchen Zhang

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) Telefónica Innovación Digital, Scientific Group(电信创新数字公司,科学小组) University of Essex(埃塞克斯大学)

专题命中 评测与基准 :SLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 该研究针对MLC-SLM挑战赛任务1,探索三种多语言ASR方法,评估基线、利用SLAM-ASR框架训练投影器并研究对比学习与会话上下文的作用。

Comments Technical Report for MLC-SLM Challenge of Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 92%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 评测与基准 :prompting(title,title_cn);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11972 2026-06-01 cs.CL 92%

Reassessing Extractive QA Datasets at Scale: LLM-as-a-Judge and In-Depth Analyses

重新评估大规模抽取式问答数据集:LLM作为评判者与深入分析

Xanh Ho, Jiahao Huang, Florian Boudin, Akiko Aizawa

机构 * National Institute of Informatics, Japan(日本国立信息研究所) The University of Tokyo, Japan(东京大学) Inria, LS2N, Nantes Université, France(法国Inria、LS2N、南特大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究系统性地使用LLM作为评判者评估四个抽取式问答数据集,发现其与人类评价的相关性远高于EM和F1,并分析了答案类型敏感性、提示变化和自偏好偏差等因素。

Comments GEM Workshop at ACL 2026; code and data are available at https://github.com/Alab-NII/llm-judge-extract-qa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15518 2026-05-20 cs.CL 92%

DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection

DetectRL-X: 向可靠多语言和真实世界LLM生成文本检测迈进

Junchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院NLP2 CT实验室) Alibaba Group(阿里巴巴集团) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DetectRL-X,一个综合性的多语言基准,用于评估先进检测器在8个维度上的性能,通过8种常见商业语言和6种易受LLM滥用的领域人类文本,结合4种流行商业LLM生成文本及润色、扩展和缩写等AI辅助写作操作,分析不同语言、领域、生成器、攻击策略、文本长度和润色操作对检测器性能的影响,以强化多语言和语言特定检测器。

Comments ACL 2026 Main. Code and data are available at https://github.com/AIDC-AI/Marco-LLM/tree/main/DetectRL-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03746 2026-04-20 cs.CL 92%

Whose Facts Win? LLM Source Preferences under Knowledge Conflicts

谁的事实获胜?在知识冲突下LLM的来源偏好

Jakob Schuster, Vagrant Gautam, Katja Markert

机构 * Heidelberg University(海德堡大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了LLM在知识冲突中的来源偏好,发现其更倾向于机构证实的信息,但可通过重复低可信度来源信息逆转。提出方法减少重复偏差,同时保持大部分偏好。

Comments Data and code: https://github.com/JaSchuste/llm-source-preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19347 2026-08-21 cs.SE 新提交 92%

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器

Ayesha Irshad, Pablo Valle, Jon Ayerdi, Aitor Arrieta

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 92%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05921 2026-08-07 cs.SE 新提交 92%

Sensor-Level Fault Diagnosis for Automotive Software Validation Using Large Language Models

基于大语言模型的汽车软件验证传感器级故障诊断

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究提出两阶段框架,用经4-bit低秩适配的LLM对HIL平台的汽车传感器记录做故障诊断,最小模型准确率达81.6%,适配循环可在单商用加速器运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 92%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract_cn);language model(title,abstract_cn)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26100 2026-07-30 cs.SE 新提交 92%

Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling

用于软件工程图的大语言模型:UML与ER建模的系统综述

Mojdeh Rahmanian, Ashkan Sami, Yanchao Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该系统综述分析64项2023-2025年研究,指出LLM在UML/ER建模中存在领域失衡、GPT依赖、评估不规范等问题,提出需标准化基准等改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 92%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03391 2026-06-19 cs.DL cs.CY 版本更新 92%

More Parameters Than Populations: A Systematic Literature Review of Large Language Models within Survey Research

参数多于总体:调查研究中的大语言模型系统文献综述

Trent D. Buskirk, Florian Keusch, Leah von der Heyde, Adam Eck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 通过系统文献综述,评估大语言模型在调查研究三个阶段(数据收集前、中、后)的应用,讨论其潜力与陷阱,并展望调查研究对LLM发展的贡献。

Comments This working paper is outdated as of June 2026 - please refer to the full version with substantive changes here: https://doi.org/10.31235/osf.io/eubj4_v1 This work was presented at NLPOR 2025 (non-archival): https://openreview.net/forum?id=0Hxhwa56Yg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 92%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07882 2026-05-28 cs.SE 92%

Rethinking Code Complexity Through the Lens of Large Language Models

通过大语言模型的视角重新思考代码复杂度

Chen Xie, Xiaodong Gu, Yuling Shi, Beijun Shen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对传统复杂度指标与LLM感知难度不匹配的问题,提出基于语义非线性的熵引导语义组合层次复杂度度量LM-CC,实验证明其与LLM性能强相关且语义保持的复杂度降低能提升下游任务表现。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01829 2026-05-28 cs.CL cs.AI cs.LG cs.MA 92%

Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models

如果你能说服我:评估大型语言模型说服效果与易受影响性的框架

Nimet Beyza Bozdag, Shuhaib Mehri, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。

Comments Paper published at the ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02039 2026-05-19 cs.AI cs.CL cs.DB cs.LG 92%

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

在大型语言模型上进行深度数据研究:评估深度数据研究

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。

Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 92%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 92%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 92%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14917 2026-04-27 cs.SE 92%

Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings

在现实世界设置下评估大型语言模型的代码推理能力

Changshu Liu, Alireza Ghazanfari, Yang Chen, Reyhaneh Jabbarvand

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文通过构建包含1200个问题的 dataset,评估 LLM 在现实复杂性下的代码推理能力,采用静态和动态分析方法,分类问题难度为 LC 或 HC,揭示现有评估方法主要偏向低复杂度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19260 2026-04-22 econ.GN q-fin.EC 92%

Understanding the Mechanism of Altruism in Large Language Models

理解大型语言模型中的利他主义机制

Shuhuai Zhang, Shu Wang, Zijun Yao, Chuanhao Li, Xiaozhi Wang, Songfa Zhong, Tracy Xiao Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过稀疏自编码器揭示LLM利他行为的内部机制,识别出与行为变化相关的神经网络特征,并验证其对分配决策的影响,为对齐LLM行为与人类价值观提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21131 2025-10-27 cs.CL cs.AI cs.LG 92%

Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications

Guangxin Su, Hanchen Wang, Jianwei Wang, Wenjie Zhang, Ying Zhang, Jian Pei

机构 * The University of New South Wales(新南威尔士大学) The University of Technology Sydney(技术大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Surveys and overviews; Natural language processing; Knowledge representation and reasoning; Graph algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11569 2025-10-01 cs.CL cs.AI cs.LG 92%

Towards Reasoning Ability of Small Language Models

Gaurav Srivastava, Shuxiang Cao, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, USA(弗吉尼亚理工大学计算机科学系) Department of Physics, Clarendon Laboratory, University of Oxford, UK(牛津大学物理系,克伦德尔实验室) NVIDIA Corporation(英伟达公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07484 2025-07-11 cs.CL cs.AI cs.LG 92%

Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models

Kaiqu Liang, Haimin Hu, Xuandong Zhao, Dawn Song, Thomas L. Griffiths, Jaime Fernández Fisac

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments Project page, code & data: https://machine-bullshit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15790 2025-02-27 cs.CL cs.AI cs.LG 92%

Small Language Models: Survey, Measurements, and Insights

Zhenyan Lu, Xiang Li, Dongqi Cai, Rongjie Yi, Fangming Liu, Xiwen Zhang, Nicholas D. Lane, Mengwei Xu

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05540 2024-07-09 q-bio.QM cs.AI cs.CL cs.LG 92%

A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding

Yiqing Shen, Zan Chen, Michail Mamalakis, Luhan He, Haiyang Xia, Tianbin Li, Yanzhou Su, Junjun He, Yu Guang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-20 cs.AI 新提交 92%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16924 2026-08-19 cs.CY cs.AI 新提交 92%

WIP: LLM Odyssey: A Game-Based Platform for Teaching LLM Engineering Concepts

工作进展:LLM奥德赛:一个基于游戏的LLM工程概念教学平台

Priyamvada Tripathi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究介绍开源游戏平台LLM奥德赛,含13个交互式游戏,覆盖LLM工程多主题,按布鲁姆分类设三个学习层级,已在加拿大学院初步部署,将开展50人混合方法评估。

Comments 5 pages, 4 figures. Accepted at the 2026 IEEE Frontiers in Education Conference (FIE 2026), Work in Progress track

详情

展开后加载摘要…

URL PDF HTML 收藏