arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2604.05172 2026-04-09 cs.AI 85%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05719 2026-04-08 cs.CR cs.AI cs.SE 85%

Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing

黑客还是幻觉?对基于LLM的自动化渗透测试的全面分析

Jiaren Peng, Zeqin Li, Chang You, Yan Wang, Hanlin Sun, Xuan Tian, Shuqiao Zhang, Junyi Liu, Jianguo Zhao, Renyang Liu, Haoran Ou, Yuqiang Sun, Jiancheng Zhang, Yutong Jiao, Kunshu Song, Chao Zhang, Fan Shi, Hongda Sun, Rui Yan, Cheng Huang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文对基于LLM的自动化渗透测试框架进行系统分析和大规模评估,揭示其架构设计和性能差异,为未来研究提供结构化分类和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05371 2026-04-08 cs.AI 85%

LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection

基于LLM的语义判断用于无人机巡检中的电力线分割

Akram Hossain, Rabab Abdelfattah, Xiaofeng Wang, Kareem Abdelfatah

机构 * School of Computing Sciences and Computer Engineering, The University of Southern Mississippi(南密西西比大学计算科学与计算机工程学院) Electrical Engineering Department, University of South Carolina(南卡罗来纳大学电气工程系) Computer Science Department, Faculty of Computers & Artificial Intelligence, Fayoum University(法尤姆大学计算机与人工智能学院计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型作为语义判断器,评估无人机搭载模型生成的电力线分割结果可靠性,通过设计两个评估协议测试其重复性和感知敏感性,证明在约束条件下LLM能可靠监控关键任务的分割质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06556 2026-04-08 cs.SE cs.CL 85%

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 85%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03493 2026-04-07 cs.CL 85%

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

文化真实性:比较大语言模型的文化表征与本地人类期望

Erin MacMurray van Liemt, Aida Davani, Sinchana Kumbale, Neha Dixit, Sunipa Dev

机构 * Google Research(谷歌研究院) Google India(谷歌印度)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出人类中心框架评估LLM生成内容与本地期望的一致性,发现部分模型存在以西方为中心的校准,文化距离越远一致性越低,并识别出系统性误差。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02666 2026-04-06 cs.AI math.OC 85%

Let's Have a Conversation: Designing and Evaluating LLM Agents for Interactive Optimization

让我们交谈:设计和评估用于交互优化的LLM代理

Joshua Drossman, Alexandre Jacquillat, Sébastien Martin

机构 * Operations Research Center and Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院运筹学研究中心和斯隆管理学院) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的评估方法,通过对话评估优化代理,展示交互优化代理在解决学校调度问题时能获得更高质量的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02135 2026-04-03 cs.CL 85%

GaelEval: Benchmarking LLM Performance for Scottish Gaelic

GaelEval: 用于苏格兰盖尔语的大型语言模型性能评估

Peter Devine, William Lamb, Beatrice Alex, Ignatius Ezeani, Dawn Knight, Mícheál J. Ó Meachair, Paul Rayson, Martin Wynne

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出GaelEval,首个针对盖尔语的多维评估基准,包含语法任务、翻译基准和文化知识问答,评估19个LLM发现专有模型表现优于开源模型,盖尔语提示法有小幅优势。

Comments 13 pages, to be published in Proceedings of LLMs4SSH (workshop co-located with LREC 2026; Mallorca, Spain; May 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00478 2026-04-03 cs.AI 85%

The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents

硅镜:用于LLM代理反趋炎附势的动态行为门控

Harshee Jignesh Shah

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出硅镜框架,通过动态检测用户说服策略并调整AI行为以维持事实准确性,实验显示其显著降低LLM的趋炎附势倾向。

Comments 7 pages, 8 figures, 5 tables. Code and evaluation data available at https://github.com/Helephants/langgraph-layered-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01615 2026-04-03 cs.AI cs.SE 85%

Analysis of LLM Performance on AWS Bedrock: Receipt-item Categorisation Case Study

对AWS Bedrock上LLM性能的分析:收据项目分类案例研究

Gabby Sanchez, Sneha Oommen, Cassandra T. Britto, Di Wang, Jung-De Chiou, Maria Spichkova

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统评估了AWS Bedrock上四种指令调优模型在收据项目分类中的性能,分析了准确率、响应稳定性及成本效率,并探讨了不同提示方法对准确性和成本的影响。

Comments Preprint. Accepted to the 19th International Conference on Evaluation of Novel Approaches to Software Engineering (ENASE 2026). Final version to be published by SCITEPRESS, http://www.scitepress.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22862 2026-04-03 cs.SE cs.CL 85%

The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration

大语言模型代理中工具使用的演变:从单工具调用到多工具编排

Haoyuan Xu, Chang Li, Xinyan Ma, Xianhao Ou, Zihan Zhang, Tao He, Xiangyu Liu, Zixiang Wang, Jiafeng Liang, Zheng Chu, Runxuan Liu, Rongchuan Mu, Dandan Tu, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harvard University(哈佛大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型代理中工具使用从单次调用到长期编排的演变,分析了多工具代理的最新进展,涵盖任务规划、安全控制、效率优化及实际应用等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28183 2026-04-02 cs.AI 85%

PReD: An LLM-based Foundation Multimodal Model for Electromagnetic Perception, Recognition, and Decision

PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型

Zehua Han, Jing Xiao, Yiqi Duan, Mengyu Xiang, Yuheng Ji, Xiaolong Zheng, Chenghanyu Zhang, Zhendong She, Junyu Shen, Dingwei Tan, Shichu Sun, Zhou Cong, Mingxuan Liu, Fengxiang Wang, Jinping Sun, Yangang Sun

机构 * Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Beihang University(北京航空航天大学) Tianjin University(天津大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science and Technology(香港科技大学) Civil Aviation University of China(中国民航大学) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29559 2026-04-01 cs.CL cs.CY 85%

When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment

当我们可以信任LLM评分者?校准自动评估的置信度

Robinson Ferrer, Damla Turgut, Zhongzhou Chen, Shashank Sonkar

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了如何通过校准LLM评分器的置信度来提高自动评估的可靠性,比较了三种置信度估计方法在不同规模的LLM上的表现,发现自报置信度在所有条件下均表现最佳,且大模型在不同数据集上具有更好的校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29517 2026-04-01 cs.CL 85%

LLM Probe: Evaluating LLMs for Low-Resource Languages

LLM Probe:评估低资源语言的大型语言模型

Hailay Kidu Teklehaymanot, Gebrearegawi Gebremariam, Wolfgang Nejdl

机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) Aksum University(阿克苏姆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLM Probe框架,通过词典基础方法系统评估低资源语言中LLM的语言能力,揭示序列到序列模型在形态语法分析和翻译质量上的优势,以及因果模型在词汇对齐上的表现。

Comments 11 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29217 2026-04-01 eess.AS cs.CL cs.SD 85%

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

推进基于大语言模型的音素到字母转换以实现多语言语音识别

Lukuang Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

机构 * TasiTech Co., Ltd., China(塔斯科技股份有限公司,中国) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能(SPMI)实验室,中国) School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的多语言音素到字母转换,通过鲁棒训练和低资源过采样将平均识别错误率从10.56%降至7.66%。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 85%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27949 2026-03-31 cs.CL 85%

EnsemJudge: Enhancing Reliability in Chinese LLM-Generated Text Detection through Diverse Model Ensembles

EnsemJudge: 通过多样化模型集成提升中文LLM生成文本检测的可靠性

Zhuoshang Wang, Yubing Ren, Guoyu Zhao, Xiaowei Zhu, Hao Li, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EnsemJudge框架,通过定制策略和集成投票机制,有效检测中文LLM生成文本,优于基线方法并在NLPCC2025任务中取得第一,验证了其可靠性。

Comments Accepted by NLPCC 2025 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 85%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26106 2026-03-30 cs.CL 85%

LLM Benchmark-User Need Misalignment for Climate Change

LLM基准-气候变化中的用户需求错位

Oucheng Liu, Lexing Xie, Jing Jiang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示现有LLM基准与实际用户需求存在显著不匹配,提出主动知识行为框架和主题-意图-形式分类法,为基准设计、RAG系统开发和LLM训练提供指导。

Comments 37 pages (8 main), 31 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25322 2026-03-27 cs.MA cs.AI 85%

AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Study

AD-CARE:一种基于指南、模态无关的LLM代理,用于多队列评估、公平性分析和读者研究的阿尔茨海默病诊断

Wenlong Hou, Sheng Bi, Guangqian Yang, Lihao Liu, Ye Du, Hanxiao Xue, Juncheng Wang, Yuxiang Feng, Yue Xun, Nanxi Yu, Ning Mao, Mo Yang, Yi Wah Eva Cheung, Ling Long, Kay Chen Tan, Lequan Yu, Xiaomeng Ma, Shaozhen Yan, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院) Amazon(亚马逊) Zhejiang University(浙江大学) Sany AI(三一人工智能) Yantai Yuhuangding Hospital, Qingdao University(青岛大学烟台毓璜顶医院) The University of Hong Kong(香港大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AD-CARE通过整合临床指南和多模态数据,实现了多队列中84.9%的诊断准确率,显著提升诊断效率和公平性,适用于阿尔茨海默病的临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25176 2026-03-27 cs.CL 85%

Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models

基于LLM-as-a-Judge和混合模型的提示攻击检测

Hieu Xuan Le, Benjamin Goh, Quy Anh Tang

机构 * GovTech, Singapore(新加坡政府科技局)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨轻量级通用LLM在真实生产环境中作为安全判断者的可靠性,通过结构化推理过程检测提示攻击,实验表明Gemini-2.0-Flash-Lite-001等模型可有效用于实时防护,同时评估混合模型对攻击检测的提升效果。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02606 2026-03-27 cs.SI cs.AI cs.CY 85%

Gender Dynamics and Homophily in a Social Network of LLM Agents

社交网络中LLM代理的性别动态与同性倾向

Faezeh Fadaei, Jenny Carla Moran, Taha Yasseri

机构 * School of Mathematics and Statistics, University College Dublin(都柏林大学数学与统计学院) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin and Technological University Dublin(人类与机器社会学中心(SOHAM),都柏林圣三一学院与都柏林理工大学) Trinity Long Room Hub, Trinity College Dublin(都柏林圣三一学院长厅中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM代理在社交网络中的性别表现动态及同性倾向,发现尽管个体性别表现随时间变化,网络仍表现出强性别同质性,揭示文化影响下的性别排序机制。

Comments Under Review

Journal ref Philosophical Transactions A. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23613 2026-03-26 cs.SE cs.AI 85%

LLMLOOP: Improving LLM-Generated Code and Tests through Automated Iterative Feedback Loops

LLMLOOP: 通过自动化迭代反馈循环改进大语言模型生成的代码和测试

Ravin Ravi, Dylan Bradshaw, Stefano Ruberto, Gunel Jahangirova, Valerio Terragni

机构 * King's College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLMLOOP通过自动化迭代反馈循环提升大语言模型生成的代码和测试质量,通过五种循环解决编译错误、静态分析问题、测试失败和测试质量改进,验证了其在HUMANEVAL-X基准上的有效性。

Comments Accepted for publication in IEEE International Conference on Software Maintenance and Evolution (ICSME 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ICSME64153.2025.00109 Code: github.com/ravinravi03/LLMLOOP

Journal ref IEEE International Conference on Software Maintenance and Evolution (ICSME 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15994 2026-03-25 cs.CR cs.AI 85%

MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents

MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估

Dongsen Zhang, Zekun Li, Xu Luo, Xuannan Liu, Peipei Li, Wenjun Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23279 2026-03-25 cs.SI cs.AI 85%

Emergence of Fragility in LLM-based Social Networks: the Case of Moltbook

基于大语言模型的社会网络中脆弱性的涌现:以Moltbook为例

Luca Sodano, Sofia Sciangula, Amulya Galmarini, Francesco Bertolotti

机构 * School of Industrial Engineering Intelligence, Complexity and Technology Lab (ICT Lab)(工业工程智能、复杂性与技术实验室) LIUC - Università Cattaneo Castellanza(LIUC-卡塔内奥卡斯泰尔兰扎大学) Università Cattaneo Castellanza(卡塔内奥卡斯泰尔兰扎大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中基于大语言模型的智能体交互网络,发现其连接模式高度异质,存在核心外围结构,对随机节点移除较 resilient,但对高连接节点的攻击易受破坏,揭示AI社交系统可能发展出集中化与结构性脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23073 2026-03-25 cs.SE cs.AI 85%

Can an LLM Detect Instances of Microservice Infrastructure Patterns?

LLM能否检测微服务基础设施模式的实例?

Carlos Eduardo Duarte, Neil B. Harrison, Filipe Figueiredo Correia, Ademar Aguiar, Pavlína Gonçalves

机构 * Department of Computer Science, Utah Valley University(计算机科学系,犹他谷大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过MicroPAD工具评估LLM检测建筑模式的能力,发现其在多语言和多类型 artifact 中的表现因模式普及度和独特性而异。

Comments Accepted at ICSA 2026 - International Conference on Software Architecture - Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23050 2026-03-25 cs.DB cs.AI 85%

DBAutoDoc: Automated Discovery and Documentation of Undocumented Database Schemas via Statistical Analysis and Iterative LLM Refinement

DBAutoDoc: 通过统计分析和迭代LLM细化实现未记录数据库模式的自动发现与文档化

Amith Nagarajan, Thomas Altman

机构 * Tasio Labs (a Blue Cypress company)(Tasio实验室(Blue Cypress公司旗下))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DBAutoDoc通过统计分析与迭代LLM细化技术,自动发现并文档化未记录的关系数据库模式,其核心是通过图结构问题迭代解决,结合神经网络反向传播的结构,实现语义校正,最终在基准数据库上取得96.1%的综合评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22904 2026-03-25 cs.AI 85%

Separating Diagnosis from Control: Auditable Policy Adaptation in Agent-Based Simulations with LLM-Based Diagnostics

区分诊断与控制:基于LLM诊断的代理仿真中可审计的政策适应

Shaoxin Zhong, Yuchen Su, Michael Witbrock

机构 * University of Auckland, Auckland, New Zealand(奥克兰大学,新西兰奥克兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出三层框架,通过分离诊断与控制实现政策适应性和可审计性。LLM作为诊断工具评估群体状态并生成风险评估,确定性公式转化为可追溯的参数更新。实验显示显式控制规则在老年护理仿真中比黑盒LLM方法更高效且保持可审计性。

Comments This paper has been accepted at AAMAS 2026 Workshop MABS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 85%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20636 2026-03-24 cs.CL cs.CE 85%

A Modular LLM Framework for Explainable Price Outlier Detection

一个模块化的LLM框架用于可解释的价格异常检测

Shadi Sartipi, John Wu, Sina Ghotbi, Nikhita Vedula, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于LLM的框架,通过产品检测和比较进行价格异常判断,实现75%以上的人工审核一致率,优于零样本和检索基于的LLM方法。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏