arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2408.14307 2026-01-01 cs.CL cs.AI cs.LG 92%

LLM-3D Print: Large Language Models To Monitor and Control 3D Printing

LLM-3D Print: 大型语言模型用于监控和控制3D打印

Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 利用大型语言模型监控和控制3D打印过程,自动识别和纠正打印缺陷,提升产品质量与生产效率。

Journal ref Additive Manufacturing, Vol. 114, September 2025, Article 105027

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23037 2026-01-01 cs.AI cs.CL cs.LG 90%

Agentic Large Language Models, a survey

代理大语言模型:综述

Aske Plaat, Max van Duijn, Niki van Stein, Mike Preuss, Peter van der Putten, Kees Joost Batenburg

机构 * Leiden University Leiden Netherlands Leiden University \& AI Lab, Pegasystems Leiden Netherlands Leiden University Leiden University \& AI Lab, Pegasystems

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。

Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/

Journal ref JAIR volume 84, article 29, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24518 2026-01-01 cs.CV 89%

Using Large Language Models To Translate Machine Results To Human Results

利用大型语言模型将机器结果转换为人类结果

Trishna Niraula, Jonathan Stubblefield

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用YOLOv5和YOLOv8结合大型语言模型生成胸部X光图像的自然语言放射学报告,验证了AI生成报告与人类报告的语义相似性及临床准确性。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24058 2026-01-01 cs.CL cs.AI cs.LG 89%

Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models

超越幻觉:一种衡量开源大语言模型可靠性的综合评分

Rohit Kumar Salla, Manoj Saravanan, Shrikar Reddy Kota

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出综合可靠性评分(CRS)用于评估开源大语言模型的可靠性,通过实验发现最可靠的系统在准确率、鲁棒性和校准不确定性间取得平衡。

Comments 5 pages, 4 tables, accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10161 2026-01-01 cs.CL cs.AI 88%

Large Language Model Sourcing: A Survey

大语言模型的来源:一项综述

Liang Pang, Jia Gu, Sunhao Dai, Zihao Wei, Zenghao Duan, Kangxi Wu, Zhiyi Yin, Jun Xu, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型来源的四个维度,并提出双范式分类法以分类现有来源方法,旨在提高模型的透明度和可信度。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24289 2026-01-01 cs.CL 88%

Automated Analysis of Sustainability Reports: Using Large Language Models for the Extraction and Prediction of EU Taxonomy-Compliant KPIs

欧盟可持续性报告的自动化分析:利用大型语言模型提取和预测符合欧盟分类法的KPIs

Jonathan Schmoll, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一个结构化数据集,利用大型语言模型评估欧盟分类法合规性,发现模型在预测财务KPIs上表现不佳,但能辅助识别经济活动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17784 2026-01-01 cs.LG 88%

AdditiveLLM: Large Language Models Predict Defects in Additive Manufacturing

AdditiveLLM:大型语言模型预测增材制造缺陷

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,宾夕法尼亚州,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 AdditiveLLM通过自然语言输入预测增材制造缺陷,准确率达93%,简化了工艺参数优化过程。

Journal ref Additive Manufacturing Letters, Vol. 14, July 2025, Article 100292

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02761 2026-01-01 cs.AI 87%

Plan Verification for LLM-Based Embodied Task Completion Agents

基于大语言模型的体感任务完成代理的计划验证

Ananth Hariharan, Vardhan Dongre, Dilek Hakkani-Tür, Gokhan Tur

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于自然语言提示的体感任务代理计划验证框架,通过迭代修正提升动作序列质量,实现高召回率和精确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23712 2026-01-01 cs.CL cs.AI 86%

STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability

STED与一致性评分:一个评估LLM结构化输出可靠性的框架

Guanghui Wang, Jinze Yu, Xing Zhang, Dayuan Jiang, Yin Song, Tomal Deb, Xuefeng Liu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) AWS WWSO SA Field Initiatives(AWS WWSO SA现场项目)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STED与一致性评分框架,用于评估LLM结构化输出可靠性,通过实验展示其在不同模型上的表现差异及应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15272 2026-01-01 cs.CL cs.AI cs.CV 86%

OmniBench: Towards The Future of Universal Omni-Language Models

OmniBench: 向通用多语言模型的未来迈进

Yizhi Li, Yinghao Ma, Ge Zhang, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Queen Mary University of London(伦敦大学玛丽女王学院) Hongkong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。

Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25055 2026-01-01 cs.AI cs.HC 85%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21635 2026-01-01 cs.CL 85%

Heaven-Sent or Hell-Bent? Benchmarking the Intelligence and Defectiveness of LLM Hallucinations

天降还是地狱?评估大语言模型幻觉的智能与缺陷

Chengxu Yang, Jingling Yuan, Siqi Cai, Jiawei Jiang, Chuang Hu

机构 * Wuhan University of Technology(武汉理工大学) Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) BreathingCORE Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HIC-Bench框架,通过分类智能与缺陷幻觉,评估LLM在创造力与准确性之间的平衡,揭示幻觉对科学创新的推动作用。

Comments Published as a conference paper at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04235 2026-01-01 cs.CL 85%

Addressing Hallucinations with RAG and NMISS in Italian Healthcare LLM Chatbots

通过RAG和NMISS解决意大利医疗LLM聊天机器人中的幻觉

Maria Paola Priola

机构 * Department of Economics and Business, University of Cagliari(经济与商业系,卡利亚里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过RAG和NMISS方法有效缓解和检测LLM中的幻觉问题,验证了GPT-4和NMISS对提升医疗领域LLM性能的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18565 2026-01-01 cs.CL cs.AI 84%

Bielik 7B v0.1: A Polish Language Model -- Development, Insights, and Evaluation

Bielik 7B v0.1:波兰语言模型——开发、见解与评估

Krzysztof Ociepa, Łukasz Flis, Krzysztof Wróbel, Adrian Gwoździej, Remigiusz Kinas

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。

Journal ref Computer Science 26(4) (2025) 131-161

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24947 2026-01-01 cs.CV cs.CL 83%

CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement

CPJ: 通过基于提示-判断的图像描述实现可解释的农业害虫诊断

Wentao Zhang, Tao Fang, Lina Lu, Lifei Wang, Weihe Zhong

机构 * Business School, Shandong University of Technology, Shandong, China(山东科技大学商学院) Institute of International Language Services Studies, Macau Millennium College, Macau SAR, China(国际语言服务研究所,澳门 Millennium 学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 CPJ通过基于提示-判断的图像描述实现可解释的农业害虫诊断,无需训练即可提升诊断性能。

Comments This paper is 6 pages in length and contains 2 figures. Tao Fang (Corresponding Author), Lina Lu (Co-corresponding Author)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15301 2026-01-01 cs.CL cs.AI 81%

A Survey on LLM-Assisted Clinical Trial Recruitment

关于LLM辅助临床试验招募的综述

Shrestha Ghosh, Moritz Schneider, Carina Reinicke, Carsten Eickhoff

机构 * University of Tübingen(图宾根大学) Boehringer Ingelheim(勃林格殷曼)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM在临床试验招募中匹配试验与患者任务的应用,分析了现有方法和挑战,并探讨了未来发展方向。

Comments Accepted to IJCNLP-AACl 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17083 2026-01-01 cs.CL cs.AI 79%

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

当F1失效时:面向对话主题分段的粒度感知评估

Michael H. Coen

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出粒度感知评估框架,用于对话主题分段,强调粒度选择而非单一边界预测。

Comments 34 pages, 4 figures. Evaluation and methodology study on dialogue topic segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03179 2026-01-01 cs.AI cs.LG cs.MA 79%

Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework

迈向自主工程设计:一种知识引导的多智能体框架

Varun Kumar, George Em Karniadakis

机构 * School of Engineering, Brown University(布朗大学工程学院) Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种知识引导的多智能体框架,用于提升工程设计的效率与质量,通过协作智能体和知识图谱实现自动化设计优化。

Comments Added appendices and updated literature review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 79%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24415 2026-01-01 cs.CR cs.HC 78%

Language Model Agents Under Attack: A Cross Model-Benchmark of Profit-Seeking Behaviors in Customer Service

语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试

Jingyu Zhang

专题命中 评测与基准 :language model(title);LLM(abstract)

AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09009 2026-01-01 cs.LG cs.AI cs.CL 78%

Open-sci-ref-0.01: open and reproducible reference baselines for language model and dataset comparison

Open-sci-ref-0.01: 开放和可重复的参考基线用于语言模型和数据集比较

Marianna Nezhurina, Jörg Franke, Taishi Nakamura, Timur Carstensen, Niccolò Ajroldi, Ville Komulainen, David Salinas, Jenia Jitsev

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 open-sci-ref通过开放和可重复的参考基线,为语言模型和数据集的比较提供标准化评估框架,支持训练过程的比较与未来研究。

Comments v.1.1. AAAI Workshop on Reproducible Artificial Intelligence (RAI, https://reproducibleai.github.io) 2026, camera ready version. Model weights and intermediate training checkpoints are available at https://huggingface.co/collections/open-sci/open-sci-ref-001; code for reproducing training, evaluation and raw experiments data at https://github.com/LAION-AI/open-sci-ref-0.01

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23897 2026-01-01 cs.NI 78%

Wireless Multimodal Foundation Model (WMFM): Integrating Vision and Communication Modalities for 6G ISAC Systems

无线多模态基础模型(WMFM):为6G ISAC系统集成视觉与通信模态

Mohammad Farzanullah, Han Zhang, Akram Bin Sediq, Ali Afana, Melike Erol-Kantarci

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出基于对比学习的无线多模态基础模型WMFM,通过联合学习无线信道系数和视觉图像,实现6G ISAC系统的高效多模态学习与应用。

Comments Journal Paper, 13 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25015 2026-01-01 cs.CL 77%

MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes

MAMA-Memeia! 多维度多智能体协作在表情包抑郁症状识别中的应用

Siddhant Agarwal, Adya Dhuler, Polly Ruhnke, Melvin Speisman, Md Shad Akhtar, Shweta Yadav

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MAMAMemeia通过多智能体多维度协作框架,利用CAT能力提升表情包抑郁症状识别的宏F1指标,达到7.55%的提升,成为新的基准模型。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24834 2026-01-01 cs.AI 77%

GenZ: Foundational models as latent variable generators within traditional statistical models

GenZ:在传统统计模型中通过可解释的语义特征作为潜在变量生成器的基础模型

Marko Jojic, Nebojsa Jojic

机构 * Arizona State University(亚利桑那州立大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenZ通过可解释的语义特征连接基础模型与统计模型,实现更精准的预测,其在房地产价格预测和电影推荐中均取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07017 2026-01-01 cs.SE cs.AI 77%

Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice

基于实践丰富上下文的LLM细粒度代码审查基准测试

Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang, Bo Jiang, Pengfei Gao, Chao Peng, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ContextCRBench通过丰富上下文的细粒度代码审查基准测试,评估LLM在代码审查中的性能,发现文本上下文比代码上下文更有效,且在工业应用中提升了审查系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22418 2026-01-01 cs.SE cs.HC 75%

Building Software by Rolling the Dice: A Qualitative Study of Vibe Coding

通过掷骰子构建软件:关于vibe编码的定性研究

Yi-Hung Chou, Boyuan Jiang, Yi Wen Chen, Mingyue Weng, Victoria Jackson, Thomas Zimmermann, James A. Jones

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过分析vibe编码实践,揭示开发者在依赖AI生成代码时的行为差异及心理模型影响,为软件工程的未来研究和工具设计提供新方向。

Comments Accepted for publication at the ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (ESEC/FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06205 2026-01-01 cs.AI cs.CL cs.LG 75%

On measuring grounding and generalizing grounding problems

关于测量 grounding 并推广 grounding 问题

Daniel Quigley, Eric Maynard

机构 * Center for Possible Minds(可能心智中心) Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种框架,用于测量和推广 grounding 问题,通过定义不同需求和评估标准,分析了符号、参照、向量和关系四种模式的 grounding 现状,并探讨了其在不同任务中的表现。

Comments resubmission: 39 pages, 85 sources, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24340 2026-01-01 cs.CV cs.AI cs.CL 73%

DermaVQA-DAS: Dermatology Assessment Schema (DAS) & Datasets for Closed-Ended Question Answering & Segmentation in Patient-Generated Dermatology Images

DermaVQA-DAS:皮肤科评估方案(DAS)及用于患者生成皮肤科图像中封闭式问答与分割的数据库

Wen-wai Yim, Yujuan Fu, Asma Ben Abacha, Meliha Yetisgen, Noel Codella, Roberto Andres Novoa, Josep Malvehy

机构 * Microsoft Health AI(微软健康人工智能) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Hospital Clinic of Barcelona(巴塞罗那医院诊所)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 DermaVQA-DAS引入了皮肤科评估方案DAS,支持封闭式问答与分割任务,通过专家标注数据集和多模态模型评估,提升患者为中心的皮肤科视觉语言模型研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23713 2026-01-01 cs.CL cs.AI 73%

PyBangla at BLP-2025 Task 2: Enhancing Bangla-to-Python Code Generation with Iterative Self-Correction and Multilingual Agents

在BLP-2025任务2中提升孟加拉语到Python代码生成:通过迭代自我纠正和多语言代理

Jahidul Islam, Md Ataullha, Saiful Azad

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BanglaCodeAct框架,通过多代理提示和迭代自我纠正,提升孟加拉语到Python代码生成的性能,实验显示Qwen3-8B结合该框架在开发集和盲测集上分别达到94.0%和71.6%的准确率。

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03401 2026-01-01 cond-mat.mtrl-sci 71%

A Comprehensive Assessment and Benchmark Study of Large Atomistic Foundation Models for Phonons

对大原子基础模型在声子特性上的全面评估和基准研究

Md Zaibul Anam, Ogheneyoma Aghoghovbia, Mohammed Al-Fahdi, Lingyu Kong, Victor Fung, Ming Hu

专题命中 评测与基准 :foundation model(title)

AI总结 本文评估了六种大原子基础模型在声子特性预测中的表现,发现EquiformerV2在预测原子力和三阶IFCs方面表现最佳,而微调版本在预测二阶IFCs、LTC等声子性质上优于其他模型。

Journal ref Advanced Intelligent Discovery 2025, 0, e202500075

详情

展开后加载摘要…

URL PDF HTML 收藏