arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2602.17234 2026-05-26 cs.AI cs.LG 89%

All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Mitigation in LLM Backtesting

所有泄漏都重要,有些泄漏更重要:LLM回测中可解释的时间污染检测与缓解

Zeyu Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出基于Shapley值的声明级评估框架Shapley-DCLR和推理时架构TimeSPEC,用于检测和缓解LLM回测中的时间污染问题。

Comments 8 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24667 2026-05-26 cs.AI cs.LG 89%

When Mean CE Fails: Median CE Can Better Track Language Model Quality

当平均交叉熵失效时:中位数交叉熵能更好地跟踪语言模型质量

Hao Guo, Simon Dennis, Rivaan Patil, Kevin Shabahang

机构 * i14 University of Melbourne(墨尔本大学) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文发现中位数交叉熵比平均交叉熵更能反映语言模型在训练过程中的任务性能,并建议在评估时报告多个百分位交叉熵。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20523 2026-05-21 cs.LG cs.AI q-bio.QM 89%

Machine-Learning-Enhanced Non-Invasive Testing for MASLD Fibrosis: Shallow-Deep Neural Networks Versus FIB-4, Tabular Foundation Models, and Large Language Models

机器学习增强的非侵入性测试用于MASLD纤维化:浅层-深层神经网络与FIB-4、表格基础模型和大语言模型的比较

Athanasios Angelakis, Gabriele De Vito, Eleni-Myrto Trifylli, Filomena Ferrucci

机构 * BioML Lab, RI CODE, UniBw, Munich, Germany(BioML实验室,RI CODE,UniBw,慕尼黑,德国) Department of Epidemiology and Data Science, Amsterdam UMC, Amsterdam, Netherlands(流行病学与数据科学系,阿姆斯特丹大学医学中心,阿姆斯特丹,荷兰) Alpha Indicium, Rijswijk, Netherlands(Alpha Indicium,里杰斯霍伊斯,荷兰) Department of Computer Science, University of Salerno, Salerno, Italy(计算机科学系,萨勒诺大学,萨勒诺,意大利) GI-Liver Unit, 2nd Department of Internal Medicine, National and Kapodistrian University of Athens, General Hospital of Athens “Hippocratio”, Athens, Greece(肝病单位,第二内科部,雅典国家与卡波迪斯托里亚大学,雅典“希波克拉底”医院,希腊)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(title);分类 cs.AI、cs.LG

AI总结 本文研究了机器学习增强的非侵入性测试在MASLD纤维化检测中的应用,比较了浅层-深层神经网络、FIB-4、表格基础模型和大语言模型在不同队列中的性能,发现浅层-深层神经网络在保持FIB-4变量空间的同时提供了更平衡的外部操作性能。

Comments 26 pages, 4 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17565 2026-05-19 cs.AI cs.CL 89%

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

泛化还是记忆?国际象棋训练语言模型的脆弱性测试

Ethan Tang

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了国际象棋训练语言模型是泛化还是记忆,通过测试发现其高性能主要源于模式匹配,并展示了LLM-Modulo框架在提升国际象棋谜题解决性能上的效果,证明了与外部验证器结合的通用LLM比直接训练合成数据更灵活。

Comments 14 pages, 2 figures, 4 tables, 3 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04815 2026-04-21 cs.CL cs.AI 89%

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection

LiveFact:一种动态、时间感知的LLM驱动虚假新闻检测基准

Cheng Xu, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学) Bebxy(贝比)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LiveFact引入动态时间感知基准,评估模型在处理演进不完整信息时的推理能力,发现传统静态基准无法检测的推理差距。

Comments ACL 2026 Main; Homepage at https://livefact.bebxy.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 89%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19764 2026-03-02 cs.LG cs.AI 89%

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

多视角编码器在基于大语言模型的代理工作流性能预测中的应用

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。

Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21235 2026-01-30 cs.CL cs.AI 89%

SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models

SHARP:通过风险轮廓进行社会危害分析以衡量大语言模型中的不平等

Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

机构 * San Francisco, USA(美国旧金山) Boston, USA(美国波士顿)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SHARP通过风险轮廓分析大语言模型中的社会危害,揭示了模型在偏见、公平性和伦理方面的异质性风险结构。

Comments Pre Print, 29 pages. key words: Social harm evaluation in LLMs, Large language models, Risk sensitive model selection, Evaluation for high-stakes domains, Worst-case behavior in LLMs, Algorithmic bias, Fairness in machine learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01185 2025-09-05 cs.CL cs.AI 89%

Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation

Seganrasan Subramanian, Abhigya Verma

机构 * ServiceNow

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);SFT(abstract);preference optimization(abstract)

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08688 2025-08-18 cs.CL cs.AI 89%

The Fellowship of the LLMs: Multi-Model Workflows for Synthetic Preference Optimization Dataset Generation

Samee Arif, Sualeha Farid, Abdul Hameed Azeemi, Awais Athar, Agha Ali Raza

机构 * Lahore University of Management Sciences(拉合尔管理科学大学) University of Michigan - Ann Arbor(密歇根大学安娜堡分校) EMBL European Bioinformatics Institute(欧洲生物信息学研究所) Strategize Inc(Strategize公司)

专题命中 评测与基准 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19230 2025-02-25 cs.LG cs.CL cs.CR 89%

Humanizing the Machine: Proxy Attacks to Mislead LLM Detectors

Tianchun Wang, Yuanzhou Chen, Zichuan Liu, Zhanwen Chen, Haifeng Chen, Xiang Zhang, Wei Cheng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11100 2024-10-23 cs.AI cs.CL 89%

Are Large Language Models Moral Hypocrites? A Study Based on Moral Foundations

José Luiz Nunes, Guilherme F. C. F. Almeida, Marcelo de Araujo, Simone D. J. Barbosa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Final version available at: https://ojs.aaai.org/index.php/AIES/article/view/31704 13 pages, 4 figures, 2 tables

Journal ref NUNES, J. L.; ALMEIDA, GUILHERME F.C.F. ; ARAUJO, M. ; BARBOSA, SIMONE D J. Are Large Language Models Moral Hypocrites? A Study Based on Moral Foundations. In: AAAI/ACM Conference on AI, Ethics, and Society, 2024, San Jose, Califórnia

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09341 2023-08-21 cs.CL cs.LG 89%

Document Automation Architectures: Updated Survey in Light of Large Language Models

Mohammad Ahmadi Achachlouei, Omkar Patil, Tarun Joshi, Vijayan N. Nair

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments The current paper is the updated version of an earlier survey on document automation [Ahmadi Achachlouei et al. 2021]. Updates in the current paper are as follows: We shortened almost all sections to reduce the size of the main paper (without references) from 28 pages to 10 pages, added a review of selected papers on large language models, removed certain sections and most of diagrams. arXiv admin note: substantial text overlap with arXiv:2109.11603

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22305 2025-06-30 cs.CL 89%

Detection of Personal Data in Structured Datasets Using a Large Language Model

Albert Agisha Ntwali, Luca Rück, Martin Heckmann

机构 * Aalen University of Applied Sciences(亚琛应用科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(journal_ref)

Comments 10 pages

Journal ref LLM-DPM '2025, Next Gen Data and Process Management: Large Language Models and Beyond, June 22, 2025, Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02048 2026-08-11 cs.CV 版本更新 89%

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型

Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhisa, Daisuke Kawahara, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(国立信息学研究所LLMC) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学) NII(国立信息学研究所) Aichi Institute of Technology(爱知工业大学) Institute of Physical and Chemical Research(理化学研究所)

专题命中 评测与基准 :language model(title,abstract);post-training(title,abstract);LLM(abstract)

AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06379 2026-08-10 cs.HC 新提交 89%

Preventive Care Recommendations by Large Language Models

基于大语言模型的预防性护理建议

Eden Avnat, Elia Yanko, Ori Yoran, Raja-Elie E. Abdulnour

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究对比7种LLMs与医生的预防性护理优先级排序,发现LLMs与医生高度一致但对生活方式干预重视不足,部分模型表现更优,强化效果需价值对齐训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06287 2026-08-07 cs.SE 新提交 89%

Automatic Translation of Unstructured Requirements into Linear Temporal Logic through Large Language Models

基于大语言模型将非结构化需求自动翻译为线性时序逻辑

Alexandra Newcomb, Omar Ochoa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28991 2026-08-03 cs.CV 新提交 89%

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18816 2026-08-03 cs.CR cs.SE 89%

AppPoet: Large Language Model based Android malware detection via multi-view prompt engineering

Wenxiang Zhao, Juntao Wu, Zhaoyi Meng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by Expert Systems With Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08854 2026-07-29 cs.CR 版本更新 89%

Large Language Models and Attention-Based AI for Hardware Design and Security: Progress, Challenges, and Opportunities

基于注意力的人工智能模型与大语言模型在硬件设计与安全中的应用:进展、挑战与机遇

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Harish Kumar Dharavath, Banafsheh Saber Latibari, Muntasir Mamun, Jaeden Wolf Carpenter, Benjamin Tan, Hammond Pearce, Krishnendu Chakrabarty, Pratik Satam, Soheil Salehi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究基于注意力的人工智能模型与大语言模型在硬件设计与安全领域的应用,利用大语言模型和HDL数据集创建自动化系统,探讨其在逻辑设计和硬件安全方面的集成,通过研究多种方法和案例凸显变革潜力并应对挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19670 2026-07-23 cs.MA 新提交 89%

Same Game, Different Story: A Minimal Conservative Strategic Robustness Benchmark for Large Language Model Agents

相同博弈,不同故事:大语言模型智能体的最小保守战略稳健性基准

Seyed Pouyan Mousavi Davoudi, Alireza Amiri-Margavi, Amin Gholami Davodi, Hamidreza Hasani Balyani, Arshia Gharagozlou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究大语言模型智能体在战略环境中的可靠性,通过“相同博弈,不同故事”基准,以收益不变框架变化下行动分布不变性定义稳健性,经二次分析已发表数据得出社会关系框架会改变模型行为,应分别评估稳健性与能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 89%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16304 2026-07-15 cs.CR cs.SE 版本更新 89%

An Evaluation of Large Language Models for Detection of Malicious Python Packages

注意差距:评估LLMs在高层面恶意包检测与细粒度指标识别中的表现

Ahmed Ryan, Ibrahim Khalil, Abdullah Al Jahid, Md Erfan, Sungbin Park, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了LLMs在恶意包检测与细粒度指标识别中的性能差异,发现通用模型在过滤威胁方面表现优异,但专用编码模型在识别严格结构的攻击时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09595 2026-07-09 cs.AI cs.CL cs.LG 版本更新 89%

LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?

Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang, Yueqi Ren, Jirong Yang, Ayoung Lee, Shitanshu Bhushan, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 89%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03734 2026-07-07 cs.SE 新提交 89%

Fault Detection and Explainable Classification in Automotive HIL Validation via Denoising Autoencoders and In-Context Large Language Models

通过去噪自编码器和上下文大语言模型进行汽车硬件在环验证中的故障检测与可解释分类

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出用于汽车实时验证中故障检测与分类的通用且可解释的两阶段框架,先以去噪自编码器标记异常,再用大语言模型分类并给出解释,评估显示该方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28618 2026-06-30 cs.SE 89%

Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework

使用突变注入框架评估LLM在Java代码片段适配上的表现

Ali Aman, Muhammad Asaduzzaman, Shaowei Wang, Chanchal K. Roy

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 通过突变注入框架构建Java代码片段数据集,研究无指令条件下LLM对代码片段的适配能力,分析适配类型难度、复杂度影响及所需上下文范围。

Comments Accepted in the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05366 2026-06-30 cs.CL cs.AI cs.LG 89%

Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

在执行中迷失:大型语言模型在多语言环境下的工具调用鲁棒性研究

Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani, Wanpeng Xu, Hua Wei, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了多语言环境下大型语言模型工具调用的鲁棒性,通过MLCL基准测试发现参数值语言不匹配是主要失败模式,尽管策略减少错误但无法恢复英语水平性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03546 2026-06-30 cs.CL cs.AI cs.HC cs.LG 89%

Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

大语言模型在隐私与亲社会冲突下的价值-行动对齐

Guanyu Chen, Chenxiao Yu, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26960 2026-06-26 cs.NI 新提交 89%

Toward Agentic SysAdmin: Rethinking System Administration with AI Agents

迈向智能系统管理:用AI智能体重新思考系统管理

Gianmaria Frigo, Davide Saladino, Alberto Castagnaro, Francesco Marchiori, Denis Donadel, Luca Pajola, Mauro Conti

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出NetLLMeval框架,通过实时网络仿真自动评估LLM在系统管理任务中的表现,发现求解器设计显著影响准确性,本地模型在合适配置下可媲美前沿大模型。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏