arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2607.07619 2026-07-09 cs.SE 新提交 86%

Rethinking Code Performance Benchmarks for LLMs

重新思考大语言模型的代码性能基准测试

Nhat Minh Le, Yisen Xu, Zhijie Wang, Tse-Hsun, Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究重新审视大语言模型代码性能基准测试,发现现有测试存在局限。提出基于LLM的多智能体框架生成性能导向测试,能更好暴露运行时差异,在原始测试无显著差异的任务中,该框架生成的测试有显著改进,优于当前最优技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05916 2026-07-08 cs.CR 新提交 86%

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

超越语法:安全专家是否信任大语言模型进行网络入侵检测系统规则工程?

Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络威胁下NIDS规则工程瓶颈,通过用户研究评估基于LLM的规则生成框架,揭示语法 - 语义悖论,从业者对其自主能力存疑,且大规模模型生成规则有效,小模型大多无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06774 2026-07-07 cs.SE 版本更新 86%

OpenCoderRank: Personalized Technical Assessments with Generative AI

OpenCoderRank: 基于生成式AI的个性化技术评估

Hridoy Sankar Dutta, Sana Ansari, Swati Kumari, Shounak Ravi Bhalerao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。

Comments Accepted to SynthIR Workshop (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01953 2026-07-03 cs.SE 新提交 86%

Underspecification does not imply Incoherence: The Risks of Semantic Collapse in Coding Models

欠指定并不意味着不一致:编码模型中语义坍缩的风险

Cedric Richter, Mike Papadakis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究发现LLM在任务描述欠指定时,常坍缩到单一错误解释,生成一致但行为错位的代码,称为有害语义坍缩,影响多个基准测试。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 86%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00596 2026-07-02 cs.CV 新提交 86%

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs

基于语义引导的LLM历史亚美尼亚报纸阅读顺序重建

Chahan Vidal-Gorène, Nadi Tomeh, Victoria Khurshudyan

机构 * École nationale des chartes-PSL(法国国立文献学院-巴黎文理研究大学) Inalco(法国国立东方语言文化学院) Calfa

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对历史亚美尼亚报纸复杂版面和低资源问题,提出混合方法结合语义区域检测与生成式LLM,排序错误率较几何基线降低76%。

Comments International Conference on Pattern Recognition, 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19501 2026-07-01 cs.AI cs.CL cs.LG q-fin.RM 新提交 86%

DeXposure-Claw: An Agentic System for DeFi Risk Supervision

DeXposure-Claw: 一个用于DeFi风险监管的智能体系统

Aijie Shu, Bowei Chen, Wenbin Wu, Cathy Yi-Hsuan Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对DeFi监管中LLM智能体易误报的问题,提出DeXposure-Claw系统,通过图时间序列基础模型预测风险网络,结合确定性监控和置信度门控生成可审计监管票据,并构建六轴评估基准DeXposure-Bench,实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29997 2026-06-30 cs.CV 86%

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

Rigel: 基于自蒸馏分数自适应的图像与视频字幕评估

Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Daichi Yashima, Komei Sugiura

机构 * Keio University(Keio大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Rigel评估指标,通过自蒸馏从冻结LLM提取评估专用评分头,解决大词汇语言模型与小标签集不匹配问题,在视频字幕评估中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29459 2026-06-30 cs.LG cond-mat.mtrl-sci cs.AI cs.CL 86%

Interpretable Inverse Design of Metal-Organic Frameworks with Large Language Model Agents

可解释的金属有机框架逆向设计:基于大语言模型智能体

Kyungmin Nam, Seunghee Han, Jihan Kim

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLM4MOF框架,利用大语言模型智能体通过化学推理、候选MOF构建和模拟测试的闭环迭代,实现可解释的逆向设计,在六项任务中高效搜索高性能结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 86%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23667 2026-06-23 cs.DB 新提交 86%

The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data

表格另有说法:用反事实关系数据测试大语言模型

Xinzhi Wang, Chunwei Liu

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交 86%

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22247 2026-06-23 cs.SE 新提交 86%

Natural Language-Focused Software Engineering via Code-Documentation Equivalence

面向自然语言的软件工程:基于代码-文档等价性

Aryaz Eghbali, Zhongxin Liu, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出文档-代码等价性概念,通过自动生成等价文档的方法(Documentary)提升代码理解与编辑任务中LLM的准确性,实验显示准确率提升12.8-24.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14189 2026-06-23 cs.CY 版本更新 86%

AI and the Future of Academic Peer Review

人工智能与学术同行评审的未来

Sebastian Porsdam Mann, Mateo Aboy, Joel Jiehao Seah, Zhicheng Lin, Xufei Luo, Daniel Rodger, Hazem Zohny, Timo Minssen, Julian Savulescu, Brian D. Earp

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析同行评审的缺陷,探讨大型语言模型(LLM)如何通过监督辅助提升评审质量、减少偏见,并强调治理选择对AI辅助评审合法性的关键作用。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20401 2026-06-19 eess.SY cs.SY 新提交 86%

PowerAgentBench-Dyn: A Benchmark for Agentic AI in Power System Dynamic Studies

PowerAgentBench-Dyn:电力系统动态研究中智能体AI的基准测试

Qian Zhang, Andrea Pomarico, Costas Mylonas, Magda Foti, Alberto Berizzi, Le Xie

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-Dyn基准,用于评估基于LLM的智能体在电力系统动态分析任务中的能力,涵盖模型质量审查和安全风险筛选两个任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20243 2026-06-19 cs.SE cs.MA 新提交 86%

Phoenix: Safe GitHub Issue Resolution via Multi-Agent LLMs

Phoenix: 通过多智能体LLM实现安全的GitHub问题解决

Kipngeno Koech, Muhammad Adam, Baimam Boukar Jean Jacques, Joao Barros

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出多智能体LLM系统Phoenix,通过六个专业智能体和七层安全控制,在SWE-bench Lite子集上达到75%的解决率,并在真实问题中保持100%正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 86%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract)

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18789 2026-06-18 eess.SY cs.SY 新提交 86%

PowerAgentBench-SS: A Benchmark for Agentic AI in Power System Steady-State Studies

PowerAgentBench-SS:电力系统稳态研究中智能体AI的基准测试

Costas Mylonas, Magda Foti, Andrea Pomarico, Matheus Duarte, Qian Zhang, Emmanouel Varvarigos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-SS基准框架,用于评估LLM智能体在电力系统稳态研究中执行工程工作流的能力,通过工具API、验证预算和风险敏感指标区分智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18285 2026-06-18 cs.SI cs.CY 新提交 86%

RELIANCE: Curating and Evaluating Reproductive Health Information on Social Media

RELIANCE: 策展与评估社交媒体上的生殖健康信息

Vaibhav Balloli, Laura Peyton Ellis, Vishala Mishra, Alice Chi, Alex Peahl, Elizabeth Bondi-Kelly

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对TikTok上孕期和产后健康信息,构建专家标注数据集RELIANCE,评估LLM事实核查能力,发现近60%信息准确,但整体与具体声明评估存在15%差距。

Comments Accepted at Datasets and Benchmarks Track, ACM Knowledge Discovery and Data Mining (KDD) 2026. Project page: https://realize-lab.github.io/RELIANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15809 2026-06-16 cs.CR 新提交 86%

AttackonCTF: Defending Hardware Security Competition Benchmarks in the Age of LLMs

AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准

Mohamadreza Rostami, Nikhilesh Singh, Stephen Muttathil, Lichao Wu, Chen Chen, Huimin Li, Jeyavijayan Rajendran, Ahmad-Reza Sadeghi

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13684 2026-06-15 cs.CY cs.AI cs.CL cs.LG 新提交 86%

Cross-Dataset Bloom Question Classification: Supervised Models and Prompted LLMs

跨数据集布鲁姆问题分类:监督模型与提示式大语言模型

Abdolali Faraji, Mohammadreza Molavi, Zohreh Rasoulkhani, Mohammadreza Tavakoli, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology(莱比锡信息科学与技术研究中心) University of Genoa(热那亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 评估监督ML/DL模型和LLM在跨数据集布鲁姆分类中的泛化能力,发现LLM更稳定,并基于最佳提示策略开发了轻量级UI。

Comments Accepted at AIED 2026. Abdolali Faraji and Mohammadreza Molavi contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12407 2026-06-11 cs.CV 新提交 86%

How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology

看似无关紧要的设计选择如何决定病理学中LLM的性能

Kian R. Weihrauch, Thomas A. Buckley, William Lotter, Arjun K. Manrai

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) Dana-Farber Cancer Institute(丹娜-法伯癌症研究所)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统因子分析发现,调整补丁大小、放大倍数等输入配置可使通用大语言模型在病理切片任务上性能大幅提升,缩小与专用模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10880 2026-06-10 cs.SE 新提交 86%

Writing Better Software Explanations: A Guideline-Based Approach

编写更好的软件解释:一种基于指南的方法

Martin Obaidi, Jean-Carl Kremser, Hannah Deters, Jakob Droste, Marc Herrmann, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种结合LLM生成与质量指南的软件解释编写工具,通过生成、检查、迭代修订流程提升效率和质量,实验表明工具支持的解释满意度显著高于纯人工编写。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 86%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00873 2026-06-02 cs.CY 86%

Prompts for Public-Sector LLMs Should Be Governed as Commons

公共部门LLM的提示应作为公共资源进行治理

Rashid Mushkani

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出公共部门部署大型语言模型时使用的提示应作为受治理的制品,而非私有临时输入,并设计了带版本控制、社区维护的提示模板仓库及协商集成方法。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26169 2026-06-02 cs.SE cs.LO 86%

ESBMC: A Survey of Its Evolution, Integration, and Future Directions in Formal Software Verification

ESBMC:形式化软件验证的演化、集成与未来方向综述

Pierre Dantas, Lucas Cordeiro, Waldir Junior

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了ESBMC从研究原型发展为工业级形式化验证平台的过程,涵盖其技术演进、语言支持扩展、与LLM及AI代理的集成,并总结了其获奖、经济影响及未来挑战。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18416 2026-05-29 cs.SD 86%

SegTune: Structured and Fine-Grained Control for Song Generation

SegTune:歌曲生成的结构化与细粒度控制

Pengfei Cai, Joanna Wang, Haorui Zheng, Xu Li, Zihao Ji, Teng Ma, Zhongliang Liu, Chen Zhang, Pengfei Wan

机构 * Kuaishou Technology(快手科技)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出非自回归框架SegTune,通过段级局部描述和全局提示实现歌曲的结构化可控生成,并引入基于LLM的时长预测器实现精确的歌词-音乐对齐。

Comments This technical report was later revised and published at ACL 2026 (oral). ACL paper link: https://openreview.net/forum?id=FKf2S4u8at , code: https://github.com/KlingAIResearch/SegTune

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01162 2026-05-29 cs.LG cs.AI cs.CL 86%

Bridging the Semantic Gap for Categorical Data Clustering via Large Language Models

弥合分类数据聚类的语义鸿沟:基于大语言模型的方法

Zihua Yang, Xin Liao, Yiqun Zhang, Yiu-ming Cheung

机构 * School of Computer Science and Technology(计算机科学与技术学院) Guangdong University of Technology(广东技术大学) Department of Computer Science(计算机科学系) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BREVE框架,利用外部知识库的语义嵌入丰富分类属性值,并引入自适应权重平衡原始标识与语义信息,在八个基准数据集上平均ARI排名达1.3。

Comments Accepted to ICPR2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28169 2026-05-28 cs.AR 86%

FT-Pilot: Automated Fault-Tolerant RTL Rewriting via Vulnerability-Guided LLMs

FT-Pilot:通过漏洞引导的LLM实现自动化容错RTL重写

Weixing Liu, Zizhen Liu, Jing Ye, Naixing Wang, Cheng Liu, Huawei Li, Xiaowei Li

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出FT-Pilot框架,结合GNN和LLM实现RTL级自动软错误加固,通过漏洞分析和代码重写降低输出错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03070 2026-05-25 eess.SY cs.SE cs.SY 86%

ProOPF: Benchmarking and Improving LLMs for Professional-Grade Power Systems Optimization Modeling

ProOPF: 面向专业级电力系统优化建模的大语言模型基准测试与改进

Chao Shen, Zihan Guo, Xu Wan, Zhenghao Yang, Yifan Zhang, Wengi Huang, Jie Song, Zongyan Zhang, Mingyang Sun

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对电力系统优化建模中自动化翻译自然语言需求为可执行优化模型的问题,本文提出专业级最优潮流数据集ProOPF-D和基准ProOPF-B,用于评估和改进大语言模型在专业级OPF建模中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏