arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2605.07122 2026-05-21 cs.SE 86%

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero: LLMs能否从零开始生成代码仓库?

Zhaoxi Zhang, Yiming Xu, Jiahui Liang, Weikang Li, Xiaoshuai Chen, Liwei Qian, Xin Pei, Jizhou Huang, Run Sun, Yunfang Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RepoZero基准测试,通过自动化执行验证实现从零开始生成代码仓库的严格评估,展示了Agentic Code-Test Evolution框架在多模型上的实验结果,揭示了当前LLM在代码生成能力与实际需求之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13053 2026-05-21 cs.IR 86%

A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset

对ReDial数据集上对话推荐系统的一次标准化重新评估

Ivica Kostric, Krisztian Balog

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对ReDial数据集上对话推荐系统的评估问题,通过标准化条件重新评估了三种架构家族中的七种主流方法,揭示了细粒度排名对实现细节的高度敏感性,以及重复捷径对准确性报告的显著影响,同时指出LLM基础能力对性能提升的影响大于架构创新,最后通过用户导向的指标证明传统召回率可能高估系统对话效果。

Comments Accepted to Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20351 2026-05-21 cs.CR 86%

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

对编码LLM和代码代理的拒绝评估:十三个恶意代码提示语料库的系统综述(2023-2025)

Richard J. Young, Gregory D. Moody

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了十三个恶意代码提示语料库,分析了其构建方法、提示构造分类、可重复性和许可条款,并指出了方法学上的三个主要缺口。

Comments 30 pages, 6 figures, 2 tables. PRISMA-style systematic review covering thirteen publicly released refusal corpora (AdvBench, CyberSecEval family, RMCBench, RedCode, MCGMark, JailbreakBench, CySecBench, MalwareBench, CIRCLE, MOCHA, ASTRA, Scam2Prompt, JAWS-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 86%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18660 2026-05-19 cs.HC 86%

Evaluating Multi-turn Human-AI Interaction

评估多轮人机交互

Shi Ding, Sijian Tan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了当前NLP评估方法的局限性,提出TCR框架用于评估人机交互,强调透明性、一致性和细化等维度,通过结构化评估提示和示例展示如何补充聚合指标和LLM作为评判者的方法。

Comments ACL 2026 EvalEval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17892 2026-05-19 cs.AR 86%

CPPL: A Circuit Prompt Programming Language

CPPL:一种电路提示编程语言

Shuo Yin, Yihe Wang, Lancheng Zou, Xufeng Yao, Tinghuan Chen, Chen Bai, Zhengrong Wang, Tsung-Yi Ho, Bei Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CPPL,一种通过编译器中介的硬件设计框架,将LLM辅助的硬件生成转化为可静态检查的前端问题,从而提高硬件设计的可靠性、可分析性和后端优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15503 2026-05-18 cs.CR 86%

uGen: An Agentic Framework for Generating Microarchitectural Attack PoCs

uGen:一种用于生成微架构攻击PoC的代理框架

Debopriya Roy Dipta, Thore Tiemann, Eduard Marin, Thomas Eisenbarth, Berk Gulmezoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出uGen框架,利用LLM生成微架构攻击代码,解决现有方法的可移植性问题,通过多代理设计提升攻击代码的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14932 2026-05-15 cs.CR 86%

Toward Securing AI Agents Like Operating Systems

向操作系统一样安全地保护AI代理

Lukas Pirch, Micha Horlboge, Patrick Großmann, Syeda Mahnur Asif, Klim Kireev, Thorsten Holz, Konrad Rieck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过操作系统视角研究LLM代理的安全性,分析了现有开源代理的攻击面,并提出安全设计建议。

Comments 17 pages, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12772 2026-05-15 cs.MM cs.CV 86%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 86%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00149 2026-05-12 physics.comp-ph 86%

Towards Verifiable and Self-Correcting AI Physicists for Quantum Many-Body Simulations

迈向量子多体模拟的可验证和自校正人工智能物理学家

Ken Deng, Xiangfei Wang, Guijing Duan, Chen Mo, Junkun Huang, Runqing Zhang, Ling Qian, Zhiguo Huang, Jize Han, Di Luo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出QMP-Bench基准和PhysVEC框架,通过自验证和纠错机制提升AI在量子多体模拟中的可靠性与准确性,显著优于现有LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 86%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 86%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 86%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26526 2026-04-30 cs.SE 86%

Identifying and Characterizing Semantic Clones of Solidity Functions

识别和表征Solidity函数的语义克隆

Ermanno Francesco Sannini, Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi, Corrado Aaron Visaggio, Andrea Di Sorbo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种可扩展的方法,通过分析代码和注释识别语义等价的Solidity函数,通过手动验证和实验验证了其有效性,并探讨了LLM在文档生成中的应用,为Solidity克隆检测提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22775 2026-04-28 cs.HC 86%

Cognitive Alignment Deciphered: A Self-Developed Scenario-Based Prompt Scale Coupled with Representational Similarity Analysis and Social Network Analysis for Unraveling Bias Mechanisms Across Humans and LLMs

认知对齐解码:一种自研的基于场景的提示量表结合表征相似性分析和社会网络分析,用于揭示人类和大语言模型中的偏见机制

Chengrui Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于场景的CBAS量表,结合RSA和SNA分析,揭示人类和LLM的偏见机制,通过干预提升LLM响应准确率,建立可复现的认知对齐研究流程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19312 2026-04-20 cs.LG cs.AI cs.CL cs.HC stat.ML 86%

FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users

FSPO:少样本优化合成偏好以个性化真实用户

Anikait Singh, Sheryl Hsu, Kyle Hsu, Eric Mitchell, Stefano Ermon, Tatsunori Hashimoto, Archit Sharma, Chelsea Finn

机构 * Stanford University(斯坦福大学) OpenAI Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FSPO通过少样本优化合成偏好实现LLM个性化,利用用户描述理性化提升奖励建模和指令遵循,生成100万合成偏好数据,在三个领域实现87%的Alpaca Eval胜率。

Comments Website: https://fewshot-preference-optimization.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 86%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14664 2026-04-17 cs.SD eess.AS 86%

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12548 2026-04-15 cs.CR 86%

DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection

DeepSeek 对语义-字符双空间变异提示注入的鲁棒性

Junyu Ren, Xingjian Pan, Wensheng Gan, Philip S. Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PromptFuzz-SC框架,通过结合语义变换和字符级混淆,评估LLM对提示注入的鲁棒性,实验显示双空间变异在攻击性能上表现最佳,提升了攻击成功率和隐蔽性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12271 2026-03-16 cs.CL cs.AI cs.LG 86%

Diagnosing Retrieval Bias Under Multiple In-Context Knowledge Updates in Large Language Models

在大型语言模型中多上下文知识更新下的检索偏见诊断

Boyu Qiao, Sean Guo, Xian Yang, Kun Li, Wei Zhou, Songlin Hu, Yunya Song

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与安全学院) Hong Kong University of Science and Technology(香港科学与技术大学) The University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了多次上下文知识更新对大型语言模型检索偏的影响,发现更新次数增加时偏见加剧,且最新状态准确性显著下降,通过分析发现模型在处理最新更新时存在识别困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03174 2026-03-04 cs.HC cs.CY 86%

AI as We Describe It: How Large Language Models and Their Applications in Health are Represented Across Channels of Public Discourse

人工智能如我们所描述:大型语言模型及其在健康领域的应用在公共话语渠道中的表现

Jiawei Zhou, Lei Zhang, Mei Li, Benjamin D Horne, Munmun De Choudhury

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 研究分析了大型语言模型在健康领域应用在不同公共话语渠道中的表现,揭示了话语风格、信息内容和象征性表示的差异,强调了风险沟通不足和不同平台对应用和风险的关注差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20224 2026-02-25 cs.LG cs.AI cs.CL 86%

Exploring Anti-Aging Literature via ConvexTopics and Large Language Models

通过凸优化和大语言模型探索抗衰老文献

Lana E. Yeganova, Won G. Kim, Shubo Tian, Natalie Xie, Donald C. Comeau, W. John Wilbur, Zhiyong Lu

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于凸优化和大语言模型的抗衰老文献主题建模方法,通过稳定且细粒度的主题发现,提升可解释性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03283 2026-02-23 cs.SE 86%

Exploring Generalizable Automated Program Repair with Large Language Models

探索大型语言模型在通用自动程序修复中的应用

Viola Campos, Ridwan Shariffdeen, Adrian Ulges, Yannic Noller

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文探讨了大型语言模型在自动程序修复中的应用,发现不同模型在不同语言上表现各异,需结合多个模型以提高修复效果,并指出故障定位的不完美会显著影响修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14438 2026-02-17 cs.RO cs.MA 86%

RoboSolver: A Multi-Agent Large Language Model Framework for Solving Robotic Arm Problems

RoboSolver: 一种基于多智能体大语言模型的机器人臂问题求解框架

Hamid Khabazi, Ali F. Meghdari, Alireza Taheri

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 RoboSolver通过多智能体框架结合LLM和VLM,实现机器人臂问题的自动求解,准确率达0.97。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06671 2026-02-09 cs.SE 86%

Code vs Serialized AST Inputs for LLM-Based Code Summarization: An Empirical Study

代码与序列化AST输入在基于LLM的代码摘要中的比较:一项实证研究

Shijia Dong, Haoruo Zhao, Paul Harvey

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文提出AST(NIT)方法,通过序列化AST提升基于LLM的代码摘要效果,实验表明其在输入长度、训练时间和摘要质量上均优于传统方法。

Comments Accepted at the 3rd International Workshop on Large Language Models for Code (LLM4Code 2026), co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02724 2026-02-04 cs.NE 86%

Automatic Design of Optimization Test Problems with Large Language Models

利用大语言模型自动设计优化测试问题

Wojciech Achtelik, Hubert Guzowski, Maciej Smołka, Jacek Mańdziuk

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 EoTF利用大语言模型自动设计优化测试问题,通过生成与目标ELA特征向量匹配的连续优化函数,提高基准测试的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08516 2026-01-14 cs.SD cs.CY eess.AS 86%

Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances

基于大语言模型时代的稳健CAPTCHA:从评估到进展

Ziqi Ding, Yunfeng Wan, Wei Song, Yi Liu, Gelei Deng, Nan Sun, Huadong Mo, Jingling Xue, Shidong Pan, Yuekang Li

专题命中 评测与基准 :language model(title,abstract);large language model(title)

AI总结 本文提出了一种基于音频 illusion 的新型CAPTCHA方法,通过利用人类听觉机制,有效对抗大语言模型和自动语音识别模型的攻击,显著提升CAPTCHA的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10262 2025-12-12 cs.CV 86%

VLM-NCD:Novel Class Discovery with Vision-Based Large Language Models

基于视觉大语言模型的新型类别发现

Yuetong Su, Baoguo Wei, Xinyu Wang, Xu Li, Lixin Li

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 基于视觉大语言模型的新型类别发现方法,通过融合视觉-文本语义和原型引导聚类,提升未知类别分类准确率25.3%,并展现对长尾分布的鲁棒性。

Comments 8 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08867 2025-12-10 cs.SE 86%

SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA

SimpleDevQA:在开发知识问答上评估大语言模型

Jing Zhang, Lianghong Guo, Yanlin Wang, Mingwei Liu, Jiachi Chen, Yuchi Ma, Ensheng Shi, Terry Yue Zhuo, Hongyu Zhang, Zibin Zheng

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏