arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2603.04217 2026-03-05 cs.CL 85%

When Do Language Models Endorse Limitations on Human Rights Principles?

语言模型何时会支持人权原则的限制?

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) University of Michigan(密歇根大学) University of Copenhagen(哥本哈根大学) EuroSafeAI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究了语言模型在人权原则限制上的偏见,发现模型在不同语言和提示下表现出系统性差异,揭示了AI在高风险互动中的伦理挑战。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04212 2026-03-05 cs.SE cs.CL 85%

Code Fingerprints: Disentangled Attribution of LLM-Generated Code

代码指纹:解耦的LLM生成代码归因

Jiaxun Guo, Ziyuan Yang, Mengyu Sun, Hui Wang, Jingfeng Lu, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University, Chengdu, China(四川大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DCAN网络,通过解耦语义与风格信息,实现对LLM生成代码的多模型归因。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04191 2026-03-05 cs.AI 85%

Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions

迈向真实个性化:评估个性化用户-LLM交互中的长周期偏好跟随

Qianyun Guo, Yibo Li, Yue Liu, Bryan Hooi

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RealPref提出一个评估个性化用户-LLM交互中长周期偏好跟随的基准,揭示LLM在长上下文和隐性偏好下的表现下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04123 2026-03-05 cs.CL 85%

FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation

FINEST: 通过细粒度评估改进LLM对敏感话题的响应

Juhyun Oh, Nayeon Lee, Chani Jung, Jiho Jin, Junho Myung, Jongwon Lee, Taeui Song, Alice Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FINEST通过细粒度评估分类法,改进LLM对敏感话题的响应,显著减少错误率并提升帮助性与安全性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 85%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03116 2026-03-04 cs.AI 85%

Beyond Task Completion: Revealing Corrupt Success in LLM Agents through Procedure-Aware Evaluation

超越任务完成:通过过程感知评估揭示LLM代理中的腐败成功

Hongliu Cao, Ilias Driouich, Eoin Thomas

机构 * Amadeus France(法国阿马代乌斯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出过程感知评估框架,揭示LLM代理中隐藏的腐败成功,分析不同模型在任务执行中的失败模式及基准设计缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02949 2026-03-04 cs.SE cs.AI 85%

SEALing the Gap: A Reference Framework for LLM Inference Carbon Estimation via Multi-Benchmark Driven Embodiment

填补差距:通过多基准驱动的具身方法构建LLM推理碳估计的参考框架

Priyavanshi Pathania, Rohit Mehra, Vibhu Saujanya Sharma, Vikrant Kaulgud, Tiffani Nevels, Sanjay Podder, Adam P. Burden

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SEAL通过多基准驱动方法实现LLM推理碳估计,为可持续性评估提供标准化基础。

Comments 5 pages. To be published in the proceedings of 48th International Conference on Software Engineering (ICSE '26), April 12-18, 2026, Rio de Janeiro, Brazil (New Ideas and Emerging Results Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02345 2026-03-04 cs.SE cs.AI cs.MA 85%

RIVA: Leveraging LLM Agents for Reliable Configuration Drift Detection

RIVA: 利用LLM代理进行可靠的配置漂移检测

Sami Abuzakuk, Lucas Crijns, Anne-Marie Kermarrec, Rafael Pires, Martijn de Vos

机构 * EPFL(瑞士洛桑联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RIVA通过多代理系统和交叉验证技术,提高在工具响应错误时的IaC验证可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02297 2026-03-04 cs.CR cs.AI 85%

ZeroDayBench: Evaluating LLM Agents on Unseen Zero-Day Vulnerabilities for Cyberdefense

ZeroDayBench: 评估LLM代理在未见的零日漏洞上的能力以应对网络防御

Nancy Lau, Louis Sloot, Jyoutir Raj, Giuseppe Marco Boscardin, Evan Harris, Dylan Bowman, Mario Brajkovski, Jaideep Chawla, Dan Zhao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ZeroDayBench评估了前沿LLM在未见零日漏洞上的自主修复能力,揭示了其在主动网络防御中的局限性及改进方向。

Comments Accepted to ICLR 2026 Workshop "Agents in the Wild"

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10902 2026-03-04 cs.LG stat.ML 85%

Auditing Information Disclosure During LLM-Scale Gradient Descent Using Gradient Uniqueness

在大规模语言模型梯度下降过程中通过梯度唯一性审计信息披露

Sleem Abdelghafar, Maryam Aliakbarpour, Chris Jermaine

机构 * Rice University(Rice大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出梯度唯一性指标,用于在大规模语言模型训练过程中审计信息披露风险,通过高效算法减少计算开销,并揭示披露风险的异质性分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01701 2026-03-03 cs.DB cs.AI 85%

Beyond Single-Modal Analytics: A Framework for Integrating Heterogeneous LLM-Based Query Systems for Multi-Modal Data

超越单一模态分析:一种整合异构LLM查询系统的框架用于多模态数据

Ruyu Li, Tinghui Zhang, Haodi Ma, Daisy Zhe Wang, Yifan Wang

机构 * University of Hawaii at Manoa(夏威夷大学曼纳oa分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Meta Engine,一种整合异构LLM查询系统的框架,通过统一的语义查询引擎提升多模态数据处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00993 2026-03-03 cs.AI 85%

CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration

CollabEval: 通过多智能体协作增强LLM作为裁判

Yiyue Qian, Shinan Zhang, Yun Zhou, Haibo Ding, Diego Socolinsky, Yi Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CollabEval通过多智能体协作提升LLM作为裁判的评估性能,克服单一模型的不一致性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19208 2026-03-03 cs.CL 85%

DiSRouter: Distributed Self-Routing for LLM Selections

DiSRouter: 分布式自路由用于大语言模型选择

Hang Zheng, Hongshen Xu, Yongkai Lin, Shuai Fan, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学系X-LANCE实验室) Shanghai Innovation Institution, Shanghai, China(上海创新机构) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) AISpeech Co., Ltd., Suzhou, China(AISpeech公司) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DiSRouter通过分布式自路由机制,利用LLM的自我认知能力,实现更灵活、可扩展的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12462 2026-03-03 cs.AI cs.CR 85%

Evaluating and Mitigating LLM-as-a-judge Bias in Communication Systems

评估和减轻通信系统中LLM-as-a-judge的偏见

Jiaxin Gao, Chen Chen, Yanwen Jia, Xueluan Gong, Kwok-Yan Lam, Qian Wang

机构 * School of Computer Science and Engineering at Nanyang Technological University(南洋理工大学计算机科学与工程学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM-as-a-judge在通信系统中的偏见问题,分析了不同模型对偏见输入的鲁棒性,并提出四种缓解策略以提高判断的公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04265 2026-03-03 cs.CR cs.AI 85%

Weaponizing Language Models for Cybersecurity Offensive Operations: Automating Vulnerability Assessment Report Validation; A Review Paper

利用语言模型进行网络安全进攻性操作:自动化漏洞评估报告验证;综述论文

Abdulrahman S Almuhaidib, Azlan Mohd Zain, Zalmiyah Zakaria, Izyan Izzati Kamsani, Abdulaziz S Almuhaidib

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文综述了利用大型语言模型自动化漏洞评估报告验证的方法,旨在提高验证准确性并减少人工工作量。

Comments Pre-print - Accepted for publication in the Proceedings of the International Computer Sciences and Informatics Conference (ICSIC-2024), published by AIP Publishing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25662 2026-03-02 cs.HC cs.AI 85%

User Misconceptions of LLM-Based Conversational Programming Assistants

基于大语言模型的对话式编程助手中的用户误解

Gabrielle O'Brien, Antonio Pedro Santos Alves, Sebastian Baltes, Grischa Liebel, Mircea Lungu, Marcos Kalinowski

机构 * University of Michigan(密歇根大学) Pontifical Catholic University of Rio de Janeiro(里约热内卢天主教大学) Heidelberg University(海德堡大学) Reykjavik University(雷克雅未克大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了用户在使用基于大语言模型的对话式编程助手时可能存在的误解,强调了工具在明确自身能力及通过实证研究澄清编程需求的重要性。

Comments Accepted to the Journal Ahead Workshop at ICSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 85%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08254 2026-02-27 cs.SE cs.AI 85%

Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy

迈向利用语义熵自动验证语言模型合成测试用例

Hamed Taherkhani, Jiho Shin, Muhammad Ammar Tahir, Md Rakib Hossain Misu, Vineet Sunil Gattani, Hadi Hemmati

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出VALTEST框架,利用语义熵自动验证LLM生成的测试用例,提升测试有效性与代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21320 2026-02-26 cs.LG 85%

Tool-R0: Self-Evolving LLM Agents for Tool-Learning from Zero Data

Tool-R0:从零数据自我进化的大语言模型代理用于工具学习

Emre Can Acikgoz, Cheng Qian, Jonas Hübotter, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur

机构 * UIUC(伊利诺伊大学香槟分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Tool-R0通过自我对抗强化学习从零数据训练通用工具调用代理,实现92.5%的性能提升并超越完全监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00024 2026-02-26 cs.SI cs.AI 85%

EpidemIQs: Prompt-to-Paper LLM Agents for Epidemic Modeling and Analysis

EpidemIQs: 用于流行病建模与分析的提示到论文LLM代理

Mohammad Hossein Samaei, Faryad Darabi Sahneh, Lee W. Cohnstaedt, Caterina Scoglio

机构 * Department of Electrical and Computer Engineering, Kansas State University(电气与计算机工程系,堪萨斯州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EpidemIQs是一种多代理LLM框架,通过五个阶段实现流行病建模与分析的自动化,利用科学家代理和任务专家代理提高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01012 2026-02-25 cs.AI 85%

AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents

AutoEDA:通过基于微服务的LLM代理实现EDA流程自动化

Yiyi Lu, Hoi Ian Au, Junyao Zhang, Jingyu Pan, Guanglei Zhou, Yiting Wang, Jingwei Sun, Ang Li, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoEDA通过基于微服务的LLM代理实现EDA流程自动化,利用MCP协议提升交互可靠性,并通过本地微调模型和定制评估方法提高准确性与保密性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19643 2026-02-24 cs.CL 85%

KGHaluBench: A Knowledge Graph-Based Hallucination Benchmark for Evaluating the Breadth and Depth of LLM Knowledge

KGHaluBench: 一种基于知识图谱的幻觉基准测试,用于评估大语言模型知识的广度和深度

Alex Robertson, Huizhi Liang, Mahbub Gani, Rohit Kumar, Srijith Rajamohan

机构 * School of Computing, Newcastle University(计算学院,新castle大学) Sage Ai, Sage Group PLC(Sage Ai,Sage集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KGHaluBench通过基于知识图谱的基准测试,评估大语言模型在知识广度和深度上的表现,提供更全面的真相评估方法。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18891 2026-02-24 cs.CY cs.AI cs.HC 85%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18479 2026-02-24 physics.chem-ph cs.AI cs.DL 85%

AgentCAT: An LLM Agent for Extracting and Analyzing Catalytic Reaction Data from Chemical Engineering Literature

AgentCAT: 一种用于从化学工程文献中提取和分析催化反应数据的LLM代理

Wei Yang, Zihao Liu, Tao Tan, Xiao Hu, Hong Xie, Lulu Li Xin Li, Jianyu Han, Defu Lian, Mao Ye

机构 * University of Science and Technology of China(科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) National Engineering Research Center of Lower-Carbon Catalysis Technology(低碳催化技术国家工程研究中心) Dalian Institute of Chemical Physics, Chinese Academy of Sciences(化学物理研究所,中国科学院) IFLYTEK CO.LTD(IFLYTEK有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentCAT是一种用于从化学工程文献中提取和分析催化反应数据的LLM代理,通过形式化抽象和挑战分析,解决了复杂依赖结构下的数据提取问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18372 2026-02-23 cs.HC cs.AI 85%

"How Do I ...?": Procedural Questions Predominate Student-LLM Chatbot Conversations

如何做到?

Alexandra Neagu, Marcus Messer, Peter Johnson, Rhodri Nelson

机构 * Imperial College London, London, United Kingdom(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生与LLM聊天机器人对话中程序性问题的主导地位,发现其在总结性评估中更为突出,但现有分类方案存在局限性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16777 2026-02-20 cs.CL 85%

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

DistillNote:一种评估大语言模型生成临床笔记摘要功能性的框架

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam UMC, University of Amsterdam(医学信息学系,阿姆斯特丹大学) Amsterdam Public Health, Methodology(阿姆斯特丹公共健康与方法学) Institute of Mathematics and Statistics, University of São Paulo(数学与统计学研究所,圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DistillNote提出了一种评估大语言模型生成临床摘要功能性的新方法,通过下游任务验证摘要的诊断信号保留,揭示压缩与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 85%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16131 2026-02-19 stat.ML cs.LG 85%

Empirical Cumulative Distribution Function Clustering for LLM-based Agent System Analysis

基于经验累积分布函数的LLM代理系统分析聚类

Chihiro Watanabe, Jingyu Sun

机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16039 2026-02-19 cs.AI 85%

How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment

评分的不确定性有多大?基于大语言模型的自动评估中不确定性度量的基准测试

Hang Li, Kaiqi Yang, Xianxuan Long, Fedor Filippov, Yucheng Chu, Yasemin Copur-Gencturk, Peng He, Cory Miller, Namsoo Shin, Joseph Krajcik, Hui Liu, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Southern California(南加州大学) Washington State University(华盛顿州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的自动评估中不确定性度量的基准测试,分析了不同方法的优劣及影响因素,旨在提升评分系统的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11348 2026-02-19 cs.AI 85%

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试

Ruipeng Wang, Yuxin Chen, Yukai Wang, Chang Wu, Junfeng Fang, Xiaodong Cai, Qi Gu, Hui Su, An Zhang, Xiang Wang, Xunliang Cai, Tat-Seng Chua

机构 * University of Science(科学大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏