arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-19 至 2025-12-19 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 40 篇

2503.22821 2025-12-19 cs.SE 90%

Identifying and Mitigating API Misuse in Large Language Models

识别和缓解大语言模型中的API误用

Terry Yue Zhuo, Junda He, Jiamou Sun, Zhenchang Xing, David Lo, John Grundy, Xiaoning Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出Dr.Fix方法,通过分类法指导LLM自动修复生成代码中的API误用问题,提升修复精度。

Comments Accepted at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01329 2025-12-19 cs.CL cs.AI 90%

Evaluating Large Language Models in Crisis Detection: A Real-World Benchmark from Psychological Support Hotlines

评估大型语言模型在危机检测中的表现:来自心理支持热线的现实世界基准测试

Guifeng Deng, Shuyin Rao, Tianyu Lin, Anlu Dai, Pan Wang, Junyi Xie, Haidong Song, Ke Zhao, Dongwu Xu, Zhengdong Cheng, Tao Li, Haiteng Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PsyCrisisBench,通过评估540个标注转录文本,测试64种LLM在危机检测任务中的表现,发现LLM在自杀计划识别和风险评估中表现优异,但情绪状态识别仍具挑战性。

Comments Preprint. Submitted to IEEE Journal of Biomedical and Health Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16816 2025-12-19 cs.SE 89%

Toward Systematic Counterfactual Fairness Evaluation of Large Language Models: The CAFFE Framework

迈向大型语言模型系统性反事实公平性评估:CAFFE框架

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Gemma Catolino, Andrea De Lucia, Fabio Palomba

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 CAFFE框架通过结构化和意图感知的方法系统评估大型语言模型的反事实公平性,提升了公平性检测的广度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16029 2025-12-19 cs.CY cs.AI cs.CL 88%

Cross-Language Bias Examination in Large Language Models

大语言模型中的跨语言偏见检验

Yuxuan Liang, Marwa Mahmoud

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种多语言偏见评估框架,通过显性与隐性偏见测量揭示LLM在不同语言中的偏见差异,强调隐性偏见检测的重要性,为公平多语言LLM的发展提供方法基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 88%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20990 2025-12-19 cs.CE cs.AI cs.MM 88%

FinAudio: A Benchmark for Audio Large Language Models in Financial Applications

FinAudio: 一个用于金融应用的音频大语言模型基准

Yupeng Cao, Haohang Li, Yangyang Yu, Shashidhar Reddy Javaji, Yueru He, Jimin Huang, Qianqian Xie, Fabrizio Dimino, Xiao-yang Liu, K. P. Subbalakshmi, Meikang Qiu, Sophia Ananiadou, Jian-Yun Nie

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) The Fin AI(Fin AI公司) Domyn(Domyn公司) Augusta University(奥古斯塔大学) The University of Manchester(曼彻斯特大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 FinAudio是一个用于评估音频大语言模型在金融领域应用的基准,通过三个任务和两个数据集评估七种模型,揭示了现有模型的局限性并提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 88%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15894 2025-12-19 cs.AI 88%

PediatricAnxietyBench: Evaluating Large Language Model Safety Under Parental Anxiety and Pressure in Pediatric Consultations

儿童焦虑基准:在儿科咨询中评估大语言模型在父母焦虑和压力下的安全性

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 PediatricAnxietyBench评估大语言模型在父母焦虑和压力下的安全性,发现70B模型在诊断和紧急情况识别方面表现更优,但所有模型均存在现实压力下的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01050 2025-12-19 cs.DB 88%

AutoDDG: Automated Dataset Description Generation using Large Language Models

AutoDDG:利用大语言模型实现自动化数据集描述生成

Haoxiang Zhang, Yurong Liu, Aécio Santos, Wei-Lun Hung, Juliana Freire

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 AutoDDG利用大语言模型自动生成数据集描述,提升数据集检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 87%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09149 2025-12-19 cs.CL cs.AI 86%

MindShift: Analyzing Language Models' Reactions to Psychological Prompts

MindShift: 分析语言模型对心理提示的反应

Anton Vasiliuk, Irina Abdullaeva, Polina Druzhinina, Anton Razzhigaev, Andrey Kuznetsov

机构 * FusionBrain Lab(融合大脑实验室) Applied AI Institute(应用人工智能研究院) Innopolis University(因诺普里斯大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 MindShift通过评估语言模型对心理提示的反应,揭示了模型在心理适应性和人格模拟方面的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15251 2025-12-19 cs.SE 85%

Input Reduction Enhanced LLM-based Program Repair

输入减少增强的基于大语言模型的程序修复

Boyang Yang, Luyao Ren, Xin Yin, Jiadong Ren, Haoye Tian, Shunfu Jin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出ReduceFix方法,通过减少故障诱导输入提升基于LLM的程序修复性能,实验表明其在多个基准上显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21557 2025-12-19 cs.CL 84%

Generation-Time vs. Post-hoc Citation: A Holistic Evaluation of LLM Attribution

生成时间与事后引用:对大语言模型归属的全面评估

Yash Saxena, Raviteja Bommireddy, Ankur Padia, Manas Gaur

机构 * UMBC(美国马里兰大学伯克利分校) IIITDM(印度印度理工学院迪瓦德分校)

专题命中 评测与基准 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了生成时间引用与事后引用在大语言模型归属中的性能差异,发现P-Cite在覆盖和正确性上表现更优,而G-Cite更适用于精度要求高的场景。

Comments NeurIPS 2025 LLM Evaluation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16041 2025-12-19 cs.CL cs.AI 81%

Are We on the Right Way to Assessing LLM-as-a-Judge?

我们是否在正确地评估LLM作为裁判?

Yuanning Feng, Sinan Wang, Zhengxiang Cheng, Yao Wan, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Sage评估套件,通过局部和全局一致性指标评估LLM作为裁判的可靠性,发现当前先进模型在复杂情况下存在显著偏好不一致问题,并揭示情境偏好现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 79%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01396 2025-12-19 cs.HC cs.AI cs.IR 79%

Easy Come, Easy Go? Examining the Perceptions and Learning Effects of LLM-based Chatbot in the Context of Search-as-Learning

易得易失?在搜索即学习情境下考察基于大语言模型的聊天机器人感知与学习效果

Yeonsun Yang, Ahyeon Shin, Mincheol Kang, Jiheon Kang, Xu Wang, Jean Y. Song

机构 * Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系) Humanities, Arts, and Social Sciences, Yonsei University(延世大学人文、艺术与社会科学系)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究探讨了基于大语言模型的聊天机器人在搜索即学习情境下的感知与学习效果,发现尽管即时回答提升了学习效率,但并未导致长期知识保留的劣化。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16795 2025-12-19 cs.CL cs.AI cs.CY cs.IR 79%

From Facts to Conclusions : Integrating Deductive Reasoning in Retrieval-Augmented LLMs

从事实到结论:在检索增强的大语言模型中整合演绎推理

Shubham Mishra, Samyek Jain, Gorang Mehrishi, Shiv Tiwari, Harsh Sharma, Pratik Narang, Dhruv Kumar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 79%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16530 2025-12-19 cs.CL cs.AI 79%

Plain language adaptations of biomedical text using LLMs: Comparision of evaluation metrics

利用大语言模型对生物医学文本进行plain language改编:评估指标的比较

Primoz Kocbek, Leon Kopitar, Gregor Stiglic

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07392 2025-12-19 cs.CL cs.AI 79%

Voice-Interactive Surgical Agent for Multimodal Patient Data Control

多模态患者数据控制的语音交互手术代理

Hyeryun Park, Byung Mo Gu, Jun Hee Lee, Byeong Hyeon Choi, Sekeun Kim, Hyun Koo Kim, Kyungsang Kim

机构 * Image Guided Precision Cancer Surgery Institute, College of Medicine, Korea University(影像引导精准癌症手术研究所,韩国大学医学院) Department of Radiology, Massachusetts General Hospital(放射科,麻省总医院) Department of Thoracic and Cardiovascular Surgery, Korea University Guro Hospital, College of Medicine, Korea University(胸外科和心血管外科,韩国大学Guro医院,韩国大学医学院) Department of Biomedical Sciences, College of Medicine, Korea University(生物医学科学系,韩国大学医学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于大型语言模型的语音交互手术代理,用于多模态患者数据的高效控制与处理,通过分层多代理框架提升手术流程中的数据操作效率与鲁棒性。

Comments 14 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16913 2025-12-19 cs.CV 78%

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

全景深度估计的基础模型:Depth Any Panoramas

Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi

机构 * Insta360 Research(Insta360研究院) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出了一种全景深度估计的基础模型,通过三阶段伪标签流程和优化方法提升模型在不同场景下的鲁棒性和泛化能力。

Comments Project Page: https://insta360-research-team.github.io/DAP_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 77%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 77%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08158 2025-12-19 cs.CL 77%

Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs

超越过度拒绝:基于场景的诊断与事后缓解措施以应对大语言模型中的夸大拒绝

Shuzhou Yuan, Ercong Nie, Yinuo Sun, Chenxuan Zhao, William LaCroix, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和图腾德斯雷克大学) LMU Munich and MCML(慕尼黑大学和MCML) Saarland University(萨尔兰州大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于场景的诊断与事后缓解方法,以减少大语言模型中的夸大拒绝问题,通过两个基准测试和三种轻量级策略提升合规性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16381 2025-12-19 cs.NI 75%

A Network Arena for Benchmarking AI Agents on Network Troubleshooting

一个用于AI代理在网络故障排除中基准测试的网络竞技场

Zhihao Wang, Alessandro Cornacchia, Alessio Sacco, Franco Galante, Marco Canini, Dingde Jiang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NIKA是一个开源的网络故障排除基准,用于评估AI代理在动态网络环境中的性能,包含数百个精心挑选的网络事件和54个代表性问题,旨在帮助研究人员和网络专家改进网络故障诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14687 2025-12-19 cs.CL cs.AI cs.LG eess.AS 75%

Spoken DialogSum: An Emotion-Rich Conversational Dataset for Spoken Dialogue Summarization

Spoken DialogSum:用于语音对话摘要的富有情感的对话数据集

Yen-Ju Lu, Kunxiao Gao, Mingrui Liang, Helin Wang, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing(语言与语音处理中心)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Spoken DialogSum是一个用于语音对话摘要的富有情感的对话数据集,通过结合语音、摘要和非语言线索,提升情感摘要的生成效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13843 2025-12-19 cs.LG cs.AI eess.IV 73%

Machine Learning and Transformers for Thyroid Carcinoma Diagnosis: A Review

机器学习与变换器在甲状腺癌诊断中的应用:综述

Yassine Habchi, Hamza Kheddar, Yassine Himeur, Mohamed Chahine Ghanem

机构 * Institute of Technology, University Center Salhi Ahmed, Naama, Algeria(阿尔及利亚纳马大学中心沙利·阿赫迈德技术学院) LSEA Laboratory, Electrical Engineering Department, University of Medea, 26000, Algeria(阿尔及利亚梅德亚大学电子工程系LSEA实验室) College of Engineering and Information Technology, University of Dubai, Dubai, UAE(阿联酋迪拜大学工程与信息技术学院) Cybersecurity Institute, Department of Computer Science, University of Liverpool, Liverpool, UK(英国利物浦大学计算机科学系网络安全研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了利用机器学习和变换器进行甲状腺癌诊断的AI方法,探讨了其分类系统、数据集对比及未来发展方向。

Journal ref Journal of Visual Communication and Image Representation, Vol. 115, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16425 2025-12-19 cs.IR cs.AI 70%

Introducing ORKG ASK: an AI-driven Scholarly Literature Search and Exploration System Taking a Neuro-Symbolic Approach

引入ORKG ASK:一种采用神经符号方法的AI驱动学术文献搜索与探索系统

Allard Oelen, Mohamad Yaser Jaradeh, Sören Auer

机构 * TIB – Leibniz Information Centre for Science and Technology(蒂宾根信息科学与技术研究中心) L3S Research Center, Leibniz University of Hannover(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ORKG ASK通过神经符号方法结合向量搜索和LLMs,为研究人员提供AI驱动的学术文献搜索与探索支持,提升文献检索效率和用户满意度。

详情
URL PDF HTML 收藏
2512.01185 2025-12-19 cs.CR 67%

DefenSee: Dissecting Threat from Sight and Text -- A Multi-View Defensive Pipeline for Multi-modal Jailbreaks

DefenSee:从视觉和文本中解构威胁——一种多视图防御管道用于多模态对抗突破

Zihao Wang, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 DefenSee通过图像变体转录和跨模态一致性检查,提供一种多模态防御方法,有效降低多模态对抗攻击的成功率,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11486 2025-12-19 cs.CV 67%

Automated Building Heritage Assessment Using Street-Level Imagery

利用街景图像进行自动建筑遗产评估

Kristina Dabrock, Tim Johansson, Anna Donarelli, Mikael Mangold, Noah Pflugradt, Jann Michael Weinand, Jochen Linßen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究利用GPT模型和建筑登记数据,通过机器学习对斯德哥尔摩建筑进行遗产价值分类,验证结果显示宏F1分数达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏