arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2406.07545 2024-06-12 cs.CL cs.AI 87%

Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena

Aidar Myrzakhan, Sondos Mahmoud Bsharat, Zhiqiang Shen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Code and dataset are available at https://github.com/VILA-Lab/Open-LLM-Leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06443 2024-06-11 cs.LG cs.CL cs.CR 87%

LLM Dataset Inference: Did you train on my dataset?

Pratyush Maini, Hengrui Jia, Nicolas Papernot, Adam Dziedzic

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Code is available at \href{https://github.com/pratyushmaini/llm_dataset_inference/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07324 2024-02-19 cs.AI cs.CL 87%

Small LLMs Are Weak Tool Learners: A Multi-LLM Agent

Weizhou Shen, Chenliang Li, Hongzhan Chen, Ming Yan, Xiaojun Quan, Hehong Chen, Ji Zhang, Fei Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments On progress, github repo: https://github.com/X-PLUG/Multi-LLM-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03014 2023-12-07 cs.LG cs.AI cs.CV physics.ao-ph 87%

Foundation Models for Weather and Climate Data Understanding: A Comprehensive Survey

Shengchao Chen, Guodong Long, Jing Jiang, Dikai Liu, Chengqi Zhang

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Ongoing work. Survey Paper. 35 pages, 2 figures, 4 tables. The first work to comprehensively and systematically summarize DL-based weather and climate data understanding, paving the way for the development of weather and climate foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26317 2026-08-28 cs.CV cs.AI cs.MM 新提交 86%

Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models

模态成熟度指数:评估全模态模型多模态能力的基准

Rohit Patel, Dieuwke Hupkes, Sloan Strader

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出评估全模态模型多模态能力的基准MMI,测试五种模态及组合,发现前沿模型MPS得分低,LLM评分者与人工标注者判断一致性达70.8%。

Comments 26 pages, 6 figures. Code and dataset available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26113 2026-08-28 cs.AI 新提交 86%

PICasso: An AI-Enabled Design Framework for Autonomous Optimization of Silicon Photonic Devices

PICasso:一种用于硅光子器件自主优化的AI辅助设计框架

Deepak Vungarala, Deniz Najafi, Abdulrahman Aljoudi, Zahra Ghanaatian, Navid Khoshavi, Gourav Datta, Arman Roohi, Mahdi Nikdast, Shaahin Angizi

机构 * New Jersey Institute of Technology(新泽西理工学院) University of Michigan(密歇根大学) Colorado State University(科罗拉多州立大学) AMD(超威半导体公司) Case Western Reserve(凯斯西储大学) University of Illinois, Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PICasso是一种AI辅助的光子集成线路设计框架,结合结构化生成流程与多环节验证优化,可提升LLM生成的线路规范满意度,降低插入损耗,生成可制造的版图。

Comments 5 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25180 2026-08-27 cs.CY cs.AI cs.HC 新提交 86%

Self-Explanation Tutor for Active Study of CS1 Worked Examples

面向CS1例题主动学习的自解释导师

Arun-Balajiee Lekshmi-Narayanan, Mohammad Hassany, Kamil Akhuseyinoglu, Rully Hendrawan, Peter Brusilovsky

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究构建了面向入门编程的自解释导师ESSE,证实基于LLM的评估可支撑该导师,且其反馈能提升学生学习例题的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24898 2026-08-27 cs.HC cs.AI 新提交 86%

MCP-Driven Accessibility Tree Standardization for AI-Powered Screen Reader Agents

基于MCP的AI驱动屏幕阅读器智能体的可访问性树标准化

Vishnu Ramineni, Nitin Saksena, Akash Kumar Agarwal, Darshan Mohan Bidkar, Balakrishna Pothineni, Durgaraman Maruthavanan, Lokesh Butra, Siva Kumar Chintham

机构 * University of Texas(得克萨斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于MCP的统一可访问性层架构,解决LLM智能体跨平台可访问性感知的集成复杂性问题,为可访问AI智能体提供语义信息基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24103 2026-08-26 cs.AI 新提交 86%

ACE: A Self-Correcting Agentic Canvas Editor for Multi-Slide Presentation Automation

ACE:用于多幻灯片演示自动化的自修正智能体画布编辑器

JooYoung Jang, Taegyeong Lee, Jihyeon Park, Nojun Kwak

机构 * Seoul National University(首尔大学) Miridih(米里迪)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体编辑演示文档的布局破坏与有效输出被误判问题,提出带CARE路由器和自修正循环的ACE,其性能优于对比方法,获盲评者偏好。

Comments 26 pages, 12 figures, EMNLP 2026 Industry Track (Main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09979 2026-08-26 cs.CL 版本更新 86%

GhazalBench: Canonical Verse Access in LLMs across Persian Ghazals and Shakespearean Sonnets

GhazalBench: 评估大语言模型对波斯抒情诗的理解与规范表层形式访问

Ghazal Kalhor, Yadollah Yaghoobzadeh

机构 * School of Electrical and Computer Engineering, College of Engineering, University of Tehran(德黑兰理工大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出GhazalBench基准,评估LLM在波斯抒情诗中的诗意理解与规范表层形式访问能力,发现模型普遍能理解诗意但难以生成精确诗句,而识别任务缩小差距,英语表现更好,表明训练数据差异是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23317 2026-08-25 cs.NE cs.AR cs.LG 新提交 86%

Spicing up Genetic Netlist Generation with LLMs

用大型语言模型(LLM)增强遗传网表生成

Stefan Uhlich, Yağız Gençer, Andrea Bonetti, Arun Venkitaraman, Chia-Yu Hsieh, Eisaku Ohbuchi, Lorenzo Servadei

机构 * Sony AI(索尼人工智能) EPFL(洛桑联邦理工学院) Sony Semiconductor Solutions(索尼半导体解决方案公司) TU Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.LG

AI总结 该研究提出混合合成框架LLM-SPICEMixer,将遗传网表生成与IGEL结合,在Iris分类任务中,相比无LLM引导的遗传框架,提升了多项性能指标。

Comments Accepted for MLCAD 2026, Extended Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21985 2026-08-25 cs.AI 新提交 86%

Redteaming Leading Arabic LLMs with ASAS

基于ASAS对领先阿拉伯大型语言模型开展红队测试

Fidaa Abed, Haidar Khan, M Saiful Bari, Babar Khan, Abdalghani Abujabal

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出首个人工策划的阿拉伯语红队测试基准ASAS,评估7款领先阿拉伯LLM的安全性,发现多数模型对50%不安全提示防御失效,自动安全评判器表现逊于人工,为阿拉伯LLM安全提供文化适配的测试方案。

Comments 13 pages, 5 figues, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01033 2026-08-25 cs.CR cs.AI 版本更新 86%

CallScreenBench: Benchmarking Small Language Models as Phone Secretaries

CallScreenBench:将端侧模型作为电话秘书的基准测试

Jiaqi Gan, Haoyuan Tang, Jamey Z. Liang, Siying Chen, Ankit Raj, Kidus Zewde, Yuchen Zhou, Yuxin Zhang, Simiao Ren

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究人员提出CallScreenBench基准,针对端侧模型作为电话秘书的场景,从五个维度评分,发现分类性能差异是测量假象,脚本退化代理提供基准线,未设通过/失败阈值。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-08-25 cs.CL 版本更新 86%

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages, including references and appendices; 1 figure and 6 tables. Project repository: https://github.com/zhao4hua4/XHS-SCoRE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09874 2026-08-25 cs.CV cs.AI cs.IR 版本更新 86%

Benchmarking Document Parsers on Mathematical Formula Extraction from PDFs

对PDF中数学公式提取的文档解析器进行基准测试

Pius Horn, Janis Keuper

机构 * Institute for Machine Learning and Analytics (IMLA), Offenburg University, Offenburg, Germany(机器学习与分析研究所(IMLA)、奥芬堡大学) University of Mannheim, Mannheim, Germany(曼海姆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的PDF数学公式提取基准测试框架,通过合成数据和LLM评估方法,评估了多种解析器的性能差异,揭示了选择合适解析器的关键因素。

Comments Best Scientific Paper Award, ICPR 2026 (Document Analysis and Recognition Track)

Journal ref Pattern Recognition. ICPR 2026. Lecture Notes in Computer Science, vol 16813, pp. 93-107. Springer, Cham, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20960 2026-08-24 cs.AI 新提交 86%

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

能否从大型语言模型中移除科学主张?主张级遗忘的系统评估

Snigdha Paul, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(塔塔咨询服务研究部) Yale University(耶鲁大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文针对大型语言模型中过时科学主张的传播风险,提出科学主张遗忘任务并构建基准SciUnlearn,发现现有遗忘方法无法有效消除主张级知识,需专门的结构化知识移除方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20688 2026-08-24 cs.AI physics.optics 新提交 86%

VortexChat: An agentic framework for autonomous multi-objective integrated photonic design

VortexChat:面向自主多目标集成光子设计的智能体框架

Faqian Chong, Yulun Wu, Shilong Li, Andrew Forbes, Hongsheng Chen, Song Han

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VortexChat是结合LLM决策智能体与电磁仿真的自主设计框架,可从自然语言规格端到端设计集成光子器件,在Vortex100基准测试中无需人工介入即可生成达标器件,成功设计制备出高性能太赫兹涡旋光束复用器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02353 2026-08-21 cs.CL 86%

Detecting AI-Generated Essays in Writing Assessment: Responsible Use and Generalizability Across LLMs

在写作评估中检测AI生成的论文:在LLMs中的负责任使用与通用性

Jiangang Hao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了在写作评估中检测AI生成论文的挑战,分析了不同LLM间检测器的泛化能力,并提出了负责任使用检测器的指南。

Comments 21 pages, 2 figures

Journal ref Artificial Intelligence Applications in Educational Learning and Assessment, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04180 2026-08-19 cs.LG 版本更新 86%

A Comparative Study of Feature Selection Methods for EHR Diagnosis Codes in Opioid Use Disorder Prediction

阿片类药物使用障碍预测中用于电子健康记录诊断代码的特征选择方法对比研究

Zihan Ding, Yinan Liu, Tengfei Ma, Rachel Wong, Xia Zhao, Richard N. Rosenthal, Fusheng Wang

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) University of Vermont(佛蒙特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究对比五种特征选择方法在阿片类药物使用障碍预测中的表现,发现NTK敏感性方法在准确性与稳定性间平衡最优,LLM引导选择可提供互补临床信号。

Comments Accepted at the AMIA 2026 Annual Symposium. Author list corrected to match the accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16508 2026-08-18 cs.CR cs.LG cs.NI 新提交 86%

LLMs for Zero-Shot Threat Detection via Structured Risk Indicators

基于结构化风险指标的零样本威胁检测大语言模型

Abdullah Alghamdi, Siamak Layeghy, Marius Portmann

机构 * University of Queensland(昆士兰大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出两阶段LLM框架,结合RAG从异构安全日志零样本检测内部威胁与APT,在两个基准数据集上优于现有模型,风险指标质量是性能关键驱动因素

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16286 2026-08-18 cs.CL 新提交 86%

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

条款式的第三类接触:大型语言模型能否替代语言教师?

Kristina Šekrst, Ana Kovačić

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。

Journal ref Oxford Intersections: AI in Society (Oxford, online edn, Oxford Academic, 20 Mar. 2025 - )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16196 2026-08-18 cs.AI cs.HC 新提交 86%

Beyond Asking: A Pipeline for Personalized Game Generation that Reads Players from Behavior

超越询问:一种从玩家行为读取数据的个性化游戏生成流水线

Yifan Lu, Xiaopeng Yuan, Haohan Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了带真实特质的合成玩家基准,提出机会感知决策时刻表示,对比了LLM等方法的推断效果,将推断画像用于游戏难度自适应并开展人类研究验证。

Comments 16 pages, 3 figures, 6 tables. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15055 2026-08-18 cs.AI 新提交 86%

TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning

TAHB:面向文本属性超图学习的综合基准

David Yoon Suk Kang, JungHyun Kim, Juhyun Jeon, Sang-Wook Kim

机构 * Chungbuk National University(忠北国立大学) Hanyang University(汉阳大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出首个整合超图结构与文本属性的公开基准TAHB,含10个跨领域数据集,证实LLM增强文本语义可提升超图学习性能,为交叉领域研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15012 2026-08-18 cs.CR cs.AI cs.MA 新提交 86%

SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system

SysEvolve:一种原生AI、安全且自主的对抗攻防协同进化系统

Yuhan Meng, Shaofei Li, Jionghao Huang, Jiandong Jin, Puyi Wang, Hanlin Jiang, Anis Yusof, Peng Jiang, Zhenkai Liang, Yao Guo, Ding Li

机构 * School of Computer Science, Peking University(北京大学计算机学院) Southeast University(东南大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对网络安全攻防不对称问题,提出SysEvolve协同进化系统,含三个组件,实验验证其攻防性能,还揭示了LLM智能体能力的三项关键发现。

Comments Technical Report For SysEvolve System

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 86%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12894 2026-08-14 cs.CL 新提交 86%

BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

BavGround:巴伐利亚区域文化接地与方言能力基准

Jophin John, Michael Hoffmann, Jan Fillies, Michael A. Hedderich, Barbara Plank

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12340 2026-08-14 cs.CL 新提交 86%

Class-Structure Preservation Beats Diversity: A Comprehensive Benchmark of Text Augmentation Methods for Imbalanced Text Classification

类结构保留优于多样性:不平衡文本分类的文本增强方法综合基准测试

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建含11种增强方法的基准,在7个数据集上测试后发现,基于LLM的增强性能不优于经典的EmbSMOTE,类结构保真度而非表面多样性是关键,建议检索式过采样作为不平衡多分类默认方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12004 2026-08-13 cs.SE cs.AI 新提交 86%

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

RealisticTritonBench:面向真实世界AI框架的Triton内核生成基准测试

Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu

机构 * State Key Lab for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Huawei(华为) The School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出RealisticTritonBench基准,解决现有Triton内核生成基准的局限,评估发现领先LLM在真实世界Triton内核生成任务上仍表现不佳。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14267 2026-08-13 cs.AI cond-mat.mtrl-sci 版本更新 86%

DREAMS: Density Functional Theory Based Research Engine for Agentic Materials Simulation

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

Ziqi Wang, Hongshuo Huang, Hancheng Zhao, Changwen Xu, Shang Zhu, Jan Janssen, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。

Comments 47 pages, 44 pages of Supporting Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11022 2026-08-12 cs.DC cs.AI 新提交 86%

Workflow Cards: Structured Summaries of Workflow Executions Using Provenance Data

工作流卡片:利用溯源数据生成工作流执行的结构化摘要

Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji, Rafael Ferreira da Silva, Wesley Brewer, Valentine Anantharaj, Sandro Fiore, Renan Souza

机构 * University of Trento(特伦托大学) Argonne National Laboratory(阿贡国家实验室) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出工作流卡片,将工作流执行的溯源数据转化为可读的结构化摘要,填补了现有模型、数据卡片缺失执行级信息的空白,使LLM回答质量较传统查询提升近一倍。

Comments Accepted at eScience2026

详情

展开后加载摘要…

URL PDF HTML 收藏