arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.16045 2026-08-18 cs.DB cs.AI 新提交 81%

Walk Before You Run: The Importance of Data Exploration for Data Analysis Agents

先跑再走:数据探索对数据分析智能体的重要性

Yike Yuan, Virum Ranka, Tina Lasisi, Lin Ma

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究指出LLM数据分析工具存在忽视数据探索步骤的差距,引入两个基准评估数据集理解,发现强模型仍会遗漏逻辑结构,显式数据探索可提升下游任务性能。

Comments 9 pages, 6 figures. Accepted to VLDB 2026 Workshop: DASHSys: Systems for Data-centric Agents with Human-in-the-loop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14863 2026-08-18 cs.SE cs.AI cs.DC 新提交 81%

Evaluating Agentic Code Repair Capabilities in Distributed Systems

评估分布式系统中智能体的代码修复能力

Yibo Yan, Huijuan Wang, Junzhou He, Yizhuo Liang, Shaoyu Wang, Huanchen Sun, Seo Jin Park

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 81%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 81%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13428 2026-08-14 cs.AI 新提交 81%

RAIL: An Automatic Classifier of the Artificial Intelligence Readiness Level

RAIL:一种人工智能就绪水平的自动分类器

Juan Irving Vasquez, Juan Terven, Laura-Ivoone Garay-Jimenez

机构 * CIETEC-IPN Instituto Politécnico Nacional(墨西哥国立理工学院) CICATA-QRO UPIITA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RAIL分类器,将三类AI就绪框架统一为AIRL量表,通过大语言模型智能体小组裁决实现自动评估,测试显示其一致性好且避免高估。

Comments Under review at journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13334 2026-08-14 cs.CL 新提交 81%

RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

RippleMem:从孤立检索到智能体长期记忆的关联回忆

Jingbo Ji, Lingyi Li, Xilong Cheng, Yuhao Zhou, Wenji Zhang, Yuting Tan, Yunxiao Qin

机构 * Communication University of China(中国传媒大学) Zhilian Yinghe Technology Co., Ltd.(智联映和科技有限公司) State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 RippleMem是一种智能体长期记忆系统,以自适应关联回忆替代孤立检索,在LoCoMo、LongMemEval-S数据集上提升LLM-as-a-Judge准确率并降低图构建成本,性能优于现有方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12444 2026-08-14 cs.CR cs.LG 新提交 81%

Non-Degenerate Risk Certification for Automated Security Decisions: A Decision-Contract Theory with ATT\&CK-Aligned Triage as a Worked Instance

面向自动化安全决策的非退化风险认证:以适配ATT&CK的分类为实例的决策契约理论

Zhenpeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出决策契约理论用于自动化安全决策的非退化风险认证,以适配ATT&CK的LLM入侵检测警报分类为实例,实验验证了该方法可有效控制风险并实现较高的正确自动化率。

Comments 17 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10176 2026-08-12 cs.AI 新提交 81%

TRACE: Trustworthy Retrieval-Augmented Conversational Engine

TRACE:可信赖的检索增强对话引擎

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威奇托州立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09939 2026-08-12 cs.HC cs.AI 新提交 81%

How to Dogfood Your AI Chat Agent: A Three-Layer Evaluation Framework with Goal-Directed NPC Simulation

如何内部试用你的AI聊天智能体:一种结合目标导向NPC模拟的三层评估框架

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出三层评估框架,结合NPC模拟器验证LLM聊天智能体的多轮对话目标达成能力,其模拟器成本低、效率高,可用于CI/CD集成,相关资源已公开供其他团队使用。

Comments 24 pages, 11 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交 81%

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09289 2026-08-11 cs.CL 新提交 81%

Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

准确但自然?诊断日本英语作为外语写作中的语法与习语差距

Steve Woollaston, Brendan Flanagan, Hiroaki Ogata

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出分层LLM修正流水线,结合CEFR-J语法提取器,诊断日本初中生英语写作的语法准确性与习语性差距,为个性化教学反馈提供循证支持。

Comments APCLC submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 81%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 81%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07497 2026-08-11 cs.HC cs.CL 新提交 81%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07446 2026-08-10 cs.SE cs.AI cs.CY 新提交 81%

Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

分类驱动的开源AI风险缓解工具分析

Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出分类驱动的协议,将21种开源AI风险缓解工具映射到MIT分类法,发现工具在治理等领域存在缺口,为企业AI风险缓解提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07395 2026-08-10 cs.SE cs.AI 新提交 81%

PACE: Primitive-Aware Code Evolution for Automated Algorithm Design

PACE:面向自动算法设计的基元感知代码进化

Zhuoliang Xie, Ruihao Zheng, Xiang Xu, Genghui Li, Zhengkun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有自动算法设计中局部逻辑与程序绑定导致的组件评估困难问题,提出PACE方法,通过EAP解耦逻辑,经实验验证可保留算法组件并发现竞争力算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07196 2026-08-10 cs.AI 新提交 81%

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

EMAS:通过证据引导的修正稳定多智能体系统演化

Chao Fei, Qingyi Si, Kaihua Liang, Yanghua Xiao, Panos Kalnis, Hongcheng Guo

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 EMAS 是一种不更新 LLM 参数、利用样本经验修正 MAS 拓扑与提示词的方法,在四个基准和两个 LLM 上提升了准确率并降低了 token 成本,表现优于多数基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06940 2026-08-10 cs.AI 新提交 81%

Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps

对关键投票的忽视:聚合独立性指标遗漏了验证真正有帮助的地方

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究发现 LLM 评委组的准确率提升集中在关键查询上,提出的按边际分层的单票替换规则可有效提升整体准确率,且总体依赖性诊断与分层效用互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 81%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-08-10 cs.AI 新提交 81%

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06202 2026-08-07 cs.HC cs.AI 新提交 81%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 81%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 81%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 81%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05179 2026-08-07 cs.CY cs.AI 新提交 81%

Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap

自主研究智能体:AI科学家与验证差距的综述

Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述聚焦AI/ML研究中AI科学家系统的主张验证差距,分析125项研究后纳入35项,发现多数系统发布代码但缺乏验证产物,贡献了语料库等成果,指出核心瓶颈转向主张的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04032 2026-08-06 cs.AR cs.AI cs.MA cs.SE 新提交 81%

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

EDATracer:用于大规模EDA工件分析的智能体框架

Phat Tieu, Sayanti Jana, Matthew DeLorenzo, Jiawen Wu, Narendran Srinivasan, Srinivas Shakkottai, Jiang Hu, Jeyavijayan Rajendran

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03898 2026-08-05 cs.CL 新提交 81%

ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts

ANNOTARES:用于从德国法定文本中提取逻辑结构的数据集

Ronja Schwarz, Jannik Strötgen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文针对德国法定文本逻辑成分提取难题,构建ANNOTARES数据集并测试多种模型,发现BERT与LLM模型表现更优,将发布数据集以推动自动法律推理研究。

Comments Accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 81%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03562 2026-08-05 cs.LG 新提交 81%

Robust General Utility for Reinforcement Learning

面向强化学习的鲁棒通用效用方法

Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02877 2026-08-05 cs.LG 新提交 81%

GoT-CD: Graph-of-Thoughts Causal Discovery and the Fragility of Post-hoc Path-Specific Fairness Audits

GoT-CD:思维图因果发现与事后路径特定公平性审计的脆弱性

Nitish Nagesh, Elahe Khatibi, Thomas Dean Hughes, Mahdi Bagheri, Pratik Gajane, Amir M. Rahmani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of Orléans(奥尔良大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GoT-CD方法,其生成的DAG在因果发现基准中表现优异,但研究发现事后路径特定公平性审计对因果发现的结构误差较为脆弱,需结合结构发现开展路径特定公平性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏