arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2608.09289 2026-08-11 cs.CL 新提交 81%

Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

准确但自然?诊断日本英语作为外语写作中的语法与习语差距

Steve Woollaston, Brendan Flanagan, Hiroaki Ogata

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出分层LLM修正流水线,结合CEFR-J语法提取器,诊断日本初中生英语写作的语法准确性与习语性差距,为个性化教学反馈提供循证支持。

Comments APCLC submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 81%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 81%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07497 2026-08-11 cs.HC cs.CL 新提交 81%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07446 2026-08-10 cs.SE cs.AI cs.CY 新提交 81%

Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

分类驱动的开源AI风险缓解工具分析

Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出分类驱动的协议,将21种开源AI风险缓解工具映射到MIT分类法,发现工具在治理等领域存在缺口,为企业AI风险缓解提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07395 2026-08-10 cs.SE cs.AI 新提交 81%

PACE: Primitive-Aware Code Evolution for Automated Algorithm Design

PACE:面向自动算法设计的基元感知代码进化

Zhuoliang Xie, Ruihao Zheng, Xiang Xu, Genghui Li, Zhengkun Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有自动算法设计中局部逻辑与程序绑定导致的组件评估困难问题,提出PACE方法,通过EAP解耦逻辑,经实验验证可保留算法组件并发现竞争力算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07196 2026-08-10 cs.AI 新提交 81%

EMAS: Stabilizing Multi-Agent System Evolution through Evidence-Guided Revision

EMAS:通过证据引导的修正稳定多智能体系统演化

Chao Fei, Qingyi Si, Kaihua Liang, Yanghua Xiao, Panos Kalnis, Hongcheng Guo

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 EMAS 是一种不更新 LLM 参数、利用样本经验修正 MAS 拓扑与提示词的方法,在四个基准和两个 LLM 上提升了准确率并降低了 token 成本,表现优于多数基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06940 2026-08-10 cs.AI 新提交 81%

Blind to the Pivotal Vote: Aggregate Independence Metrics Miss Where Verification Actually Helps

对关键投票的忽视:聚合独立性指标遗漏了验证真正有帮助的地方

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究发现 LLM 评委组的准确率提升集中在关键查询上,提出的按边际分层的单票替换规则可有效提升整体准确率,且总体依赖性诊断与分层效用互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 81%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-08-10 cs.AI 新提交 81%

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06202 2026-08-07 cs.HC cs.AI 新提交 81%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 81%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 81%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 81%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05179 2026-08-07 cs.CY cs.AI 新提交 81%

Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap

自主研究智能体:AI科学家与验证差距的综述

Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述聚焦AI/ML研究中AI科学家系统的主张验证差距,分析125项研究后纳入35项,发现多数系统发布代码但缺乏验证产物,贡献了语料库等成果,指出核心瓶颈转向主张的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04032 2026-08-06 cs.AR cs.AI cs.MA cs.SE 新提交 81%

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

EDATracer:用于大规模EDA工件分析的智能体框架

Phat Tieu, Sayanti Jana, Matthew DeLorenzo, Jiawen Wu, Narendran Srinivasan, Srinivas Shakkottai, Jiang Hu, Jeyavijayan Rajendran

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03898 2026-08-05 cs.CL 新提交 81%

ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts

ANNOTARES:用于从德国法定文本中提取逻辑结构的数据集

Ronja Schwarz, Jannik Strötgen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文针对德国法定文本逻辑成分提取难题,构建ANNOTARES数据集并测试多种模型,发现BERT与LLM模型表现更优,将发布数据集以推动自动法律推理研究。

Comments Accepted at KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 81%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03562 2026-08-05 cs.LG 新提交 81%

Robust General Utility for Reinforcement Learning

面向强化学习的鲁棒通用效用方法

Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02877 2026-08-05 cs.LG 新提交 81%

GoT-CD: Graph-of-Thoughts Causal Discovery and the Fragility of Post-hoc Path-Specific Fairness Audits

GoT-CD:思维图因果发现与事后路径特定公平性审计的脆弱性

Nitish Nagesh, Elahe Khatibi, Thomas Dean Hughes, Mahdi Bagheri, Pratik Gajane, Amir M. Rahmani

机构 * University of California, Irvine(加利福尼亚大学欧文分校) University of Orléans(奥尔良大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GoT-CD方法,其生成的DAG在因果发现基准中表现优异,但研究发现事后路径特定公平性审计对因果发现的结构误差较为脆弱,需结合结构发现开展路径特定公平性分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01805 2026-08-04 cs.AI 新提交 81%

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits

CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法

Wei Wang, Shuanghe Liu, Zhu Zhuo, Jiaqi Zhong, Xiaozhao Zhao, Xiaojie Zuo, Jie Su

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01233 2026-08-04 cs.AI 新提交 81%

CT-PrepAgent: Bounded Policy and Controlled Execution for Adaptive CT Data Preparation

CT-PrepAgent:用于自适应CT数据准备的有界策略与受控执行

Xiaolin Fan, Yue Pei, Yingying Zhang, Haogang Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对CT数据准备的可迁移性问题,提出CT-PrepAgent模型,通过有界策略与受控执行实现自适应处理,在公开分割任务与私有DICOM队列中均取得了良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01204 2026-08-04 cs.CL 新提交 81%

ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

ShiJianBench:面向投资顾问长周期评估的从对话到决策基准

Jie Gong, Maowei Jiang, Zhiwei Liu, Yang Qiao, Wenxi Wu, Mengxi Xiao, Enze Zhang, Ziyan Kuang, Yankai Chen, Caishuang Huang, Meng Zhou, Xiku Du, Xue Liu, Guojun Xiong, Min Peng, Qianqian Xie, Sophia Ananiadou

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究推出ShiJianBench离线框架,用多智能体投资者模拟器评估对话式投资顾问,发现LLM顾问在个性化内容与投资者轨迹上表现更优,凸显需开展轨迹感知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00764 2026-08-04 cs.AI 新提交 81%

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction

FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试

Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院) Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出首个评估深度研究智能体端到端金融指标构建表现的基准FinDeepIndicator,含多市场数据,实验发现DR智能体优于检索增强LLMs但仍不可靠,为金融领域智能体开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 81%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00243 2026-08-04 cs.AI 新提交 81%

More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness

更多辩论,相同证据:同质多智能体 groundedness 的结构局限

Yuelyu Ji

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对 groundedness 验证测试多智能体小组交换意见可提升判断质量的假设,在6个基准上评估同质三智能体小组,发现其准确率差异在+8.5至-4.4个百分点,未证实该前提。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00205 2026-08-04 cs.CL 新提交 81%

Averaging Bias: Human Faithfulness Annotations are not Locally Faithful

平均偏差:人类忠实性标注并非局部忠实

Huajian Zhang, Yiyang Feng, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现文本摘要忠实性基准的人类全局标注存在平均偏差,即标注者接受大部分句子忠实的摘要,而非严格合取规则要求的所有句子都忠实,需改进人类标注设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00018 2026-08-04 cs.DB cs.AI 新提交 81%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29218 2026-08-03 cs.AI 新提交 81%

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

MirrorCraft:Minecraft中隐藏规则变化下的配对评估

Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28777 2026-08-03 cs.CL 新提交 81%

Self-Supervised Skill Optimization

自监督技能优化

Siran Peng, Cuiyu Yang, Tianyu Fu, Tianshuo Zhang, Haoyuan Zhang, Weisong Zhao, Anyang Su, Minghui Wu, Huiying Li, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。

详情

展开后加载摘要…

URL PDF HTML 收藏