arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 55 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2506.07927 2025-12-16 cs.AI cs.CL cs.LG 90%

Solving Inequality Proofs with Large Language Models

用大语言模型解决不等式证明

Pan Lu, Jiayi Sheng, Luna Lyu, Jikai Jin, Tony Xia, Alex Gu, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。

Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11009 2025-12-16 cs.CL cs.AI 90%

SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth

SproutBench: 为青少年设计的安全和伦理大型语言模型基准

Wenpeng Xing, Lanyi Wei, Haixiao Hu, Jingyi Yu, Rongchang Li, Mohan Li, Changting Lin, Meng Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SproutBench通过1283个发展性对抗提示评估47种LLMs,揭示儿童安全漏洞,为青少年AI设计提供指导。

Comments Accepted in AAAI 2026 Workshop on AI for Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12488 2025-12-16 cs.CL 89%

The American Ghost in the Machine: How language models align culturally and the effects of cultural prompting

机器中的美国幽灵:语言模型如何实现文化对齐以及文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 多伦多大学)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究通过文化提示测试了多种LLM对不同文化适应性,发现多数模型默认倾向美国,但对日本和中国文化对齐存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03761 2025-12-16 cs.CL 89%

Pet-Bench: Benchmarking the Abilities of Large Language Models as E-Pets in Social Network Services

Pet-Bench: 评估大型语言模型作为社交网络服务中电子宠物的能力基准

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Zheyu Ye, Zhoujun Li, Zuozhu Liu, Wei Lu

机构 * Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航) Zhejiang University(浙江大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Pet-Bench是一个评估大型语言模型作为电子宠物在社交网络服务中能力的基准测试,通过多样化的任务和7500多个互动实例,评估模型在自我进化和人际互动方面的表现,揭示模型大小和能力对性能的影响,推动情感沉浸式人-宠物互动的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13004 2025-12-16 eess.SY cs.SY 89%

Large Language Models for Power System Applications: A Comprehensive Literature Survey

大语言模型在电力系统应用中的综述:全面的文献调查

Muhammad Sarwar, Muhammad Rizwan, Mubushra Aziz, Abdul Rehman Sudais

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大语言模型在电力系统中的应用,探讨了其在故障诊断、负荷预测等领域的潜力及面临的挑战,提出未来研究方向。

Comments 17 pages, 1 table, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 88%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20578 2025-12-16 cs.SE 88%

LLPut: Investigating Large Language Models for Bug Report-Based Input Generation

LLPut: 探究大型语言模型在基于bug报告的输入生成中的应用

Alif Al Hasan, Subarna Saha, Mia Mohammad Imran, Tarannum Shaila Zaman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LLPut技术,评估三种开源生成式LLMs在从bug报告中提取相关输入方面的性能,探讨生成式LLMs在自动bug诊断中的能力和限制。

Journal ref The First International Workshop on Large Language Model-Oriented Empirical Research (LLanMER 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12010 2025-12-16 cs.CY cs.CL 88%

Leveraging Large Language Models for Career Mobility Analysis: A Study of Gender, Race, and Job Change Using U.S. Online Resume Profiles

利用大语言模型进行职业流动性分析:一项基于美国在线简历资料研究性别、种族和工作转换的调查

Palakorn Achananuparp, Ye Xu, Yao Lu, Xavier Jayaraj Siddarth Ashok, Ee-Peng Lim

机构 * Singapore Management University(新加坡国立管理学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究利用大语言模型分析美国在线简历数据,探讨性别、种族和工作转换对职业流动性的影响,发现女性和黑人毕业生的工作转换回报较低。

Comments Accepted by EPJ Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23065 2025-12-16 cs.CL 88%

SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services

SNS-Bench-VL:在社交网络服务中评估多模态大语言模型的基准测试

Hongcheng Guo, Zheyong Xie, Shaosheng Cao, Boyang Wang, Weiting Liu, Anjie Le, Lei Li, Zhoujun Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SNS-Bench-VL是一个用于评估多模态大语言模型在社交网络服务中性能的基准测试,涵盖8个多模态任务,包含4001个问题-答案对,评估25种先进模型,揭示多模态社交理解的挑战。

Comments We found problems in the code while rechecking our implementation. These issues led to noticeable numerical discrepancies, making some of the reported results and conclusions potentially unreliable. Therefore, we request to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12059 2025-12-16 cs.AI 88%

The Forecast Critic: Leveraging Large Language Models for Poor Forecast Identification

预测批评者:利用大语言模型进行差预测识别

Luke Bhan, Hanyu Zhang, Andrew Gordon Wilson, Michael W. Mahoney, Chuck Arvin

机构 * Amazon(亚马逊)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 利用大语言模型进行预测监控,通过识别不合理预测提升预测质量。

Comments Presented at AAAI 2026 AI4TS workshop and AABA4ET workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15101 2025-12-16 cs.LG cs.CL cs.IT math.IT 86%

Cost-aware LLM-based Online Dataset Annotation

面向成本的基于大语言模型的在线数据集标注

Eray Can Elumar, Cem Tekin, Osman Yagan

机构 * Dept. of Electrical and Computer Engineering(电气与计算机工程系) Carnegie Mellon University(卡内基梅隆大学) Dept. of Electrical Engineering(电气工程系) Bilkent University(比尔肯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CaMVo框架,通过自适应选择LLM子集降低标注成本,实现高效准确的数据集标注。

Journal ref In The Thirty-ninth Annual Conference on Neural Information Processing Systems, 2025. URL https://openreview.net/forum?id=3AdTRYA2uJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00057 2025-12-16 cs.PL cs.AI cs.LG cs.SE 86%

Incoherence as Oracle-less Measure of Error in LLM-Based Code Generation

不一致性作为无 oracle 的错误度量方法在基于 LLM 的代码生成中的应用

Thomas Valentin, Ardi Madadi, Gaetano Sapia, Marcel Böhme

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无 oracle 的错误度量方法,用于评估基于LLM的代码生成的正确性,通过不一致性度量有效识别错误程序并替代传统 oracle 评估。

Comments Accepted at AAAI'26 (extended version). 8 pages + refs and appendix

Journal ref 40th Annual AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23260 2025-12-16 cs.CR cs.AI 85%

From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows

从提示注入到协议利用:LLM驱动的AI代理工作流中的威胁

Mohamed Amine Ferrag, Norbert Tihanyi, Djallel Hamouda, Leandros Maglaras, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(阿联酋大学计算机与网络工程系) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(埃奥瓦大学) Department of Computer Science, Guelma University(古尔马大学计算机科学系) De Montfort University(德蒙福特大学) Khalifa University of Science and Technology(卡里玛科学技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一的端到端威胁模型,系统分类了LLM代理生态系统中的三十多种攻击技术,涵盖输入操纵、模型妥协、系统和隐私攻击及协议漏洞,并提供缓解策略以设计安全的代理AI系统。

Comments The paper is published in ICT Express (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 85%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL 83%

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23059 2025-12-16 cs.CL cs.AI 81%

Conveying Imagistic Thinking in Traditional Chinese Medicine Translation: A Prompt Engineering and LLM-Based Evaluation Framework

在传统中医翻译中传达意象思维:一种提示工程和基于LLM的评估框架

Jiatong Han

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于提示工程和LLM的评估框架,用于提升传统中医翻译中隐喻和转喻的传达效果,通过人机协同方法实现高效且可复制的翻译路径。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01198 2025-12-16 cs.CL 79%

Conveying Imagistic Thinking in Traditional Chinese Medicine Translation: A Prompt Engineering and LLM-Based Evaluation Framework

在传统中医翻译中传达意象思维:一种提示工程与基于LLM的评估框架

Jiatong Han

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本研究提出一种提示工程与LLM结合的评估框架,用于提升传统中医翻译中意象思维的传达效果。

Comments This is a duplicate of arXiv:2511.23059

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 79%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13658 2025-12-16 cs.CY cs.AI 77%

Embedding-Based Rankings of Educational Resources based on Learning Outcome Alignment: Benchmarking, Expert Validation, and Learner Performance

基于学习成果对齐的教育资源排名:基准测试、专家验证与学习者表现

Mohammadreza Molavi, Mohammad Moein, Mohammadreza Tavakoli, Abdolali Faraji, Stefan T. Mol, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology (TIB)(莱比锡科学与技术信息中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于嵌入的对齐框架,通过基准测试和专家验证,证明了教育资源与学习成果对齐度对学习表现的正向影响。

Comments Accepted for publication at the 16th International Conference on Learning Analytics & Knowledge (LAK 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13059 2025-12-16 cs.CL 77%

An Open and Reproducible Deep Research Agent for Long-Form Question Answering

一个开放且可重复的深度研究代理用于长格式问答

Ikuya Yamada, Wataru Ikeda, Ko Yoshida, Mengyu Ye, Hinata Sugimoto, Masatoshi Suzuki, Hisanori Ozaki, Jun Suzuki

机构 * Studio Ousia(Ousia工作室) Tohoku University(东京大学) DENTSU SOKEN INC.(DENTSU SOKEN公司) RIKEN(日本学术振兴会) NII LLMC(日本信息处理学会LLMC)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。

Comments Technical report of a winning system in the NeurIPS MMU-RAG competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12536 2025-12-16 cs.SE cs.AI 77%

Diverse LLMs vs. Vulnerabilities: Who Detects and Fixes Them Better?

多样化LLMs与漏洞:谁更能检测和修复它们?

Arastoo Zibaeirad, Marco Vieira

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出DVDR-LLM框架,通过集成多个LLMs来提高软件漏洞检测与修复的准确性,同时探讨了集成方法在不同安全场景下的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12500 2025-12-16 cs.HC cs.AI 77%

Explainable AI as a Double-Edged Sword in Dermatology: The Impact on Clinicians versus The Public

可解释AI在皮肤科中的双刃剑作用:对医生与公众的影响

Xuhai Xu, Haoyu Hu, Haoran Zhang, Will Ke Wang, Reina Wang, Luis R. Soenksen, Omar Badri, Sheharbano Jafry, Elise Burger, Lotanna Nwandu, Apoorva Mehta, Erik P. Duhaime, Asif Qasim, Hause Lin, Janis Pereira, Jonathan Hershon, Paulius Mui, Alejandro A. Gru, Noémie Elhadad, Lena Mamykina, Matthew Groh, Philipp Tschandl, Roxana Daneshjou, Marzyeh Ghassemi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了可解释AI在皮肤科诊断中的影响,发现不同专业背景的人对XAI的反应不同,LLM在医疗AI中具有双刃剑效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12004 2025-12-16 cs.LG cs.CY 77%

EnviroLLM: Resource Tracking and Optimization for Local AI

EnviroLLM:本地AI的资源追踪与优化

Troy Allen

机构 * Georgia Institute of Technology, College of Computing(佐治亚理工学院计算机学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EnviroLLM通过提供本地AI资源追踪、性能评估和能耗优化工具,帮助用户更有效地管理和评估AI模型的效率与环境影响。

Comments 8 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11906 2025-12-16 cs.CV cs.LG 77%

MPath: Multimodal Pathology Report Generation from Whole Slide Images

MPath:从全切片图像生成多模态病历报告

Noorul Wahab, Nasir Rajpoot

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA研究中心)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 MPath通过多模态条件化方法,利用预训练的生物医学语言模型生成病理报告,展示了在病理报告生成中的有效性与可扩展性。

Comments Pages 4, Figures 1, Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11887 2025-12-16 cs.CY cs.AI 77%

Advancing Autonomous Driving System Testing: Demands, Challenges, and Future Directions

推进自动驾驶系统测试:需求、挑战与未来方向

Yihan Liao, Jingyu Zhang, Jacky Keung, Yan Xiao, Yurou Dai

机构 * City University of Hong Kong(香港城市大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Lehigh University(莱斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究探讨了自动驾驶系统测试的需求与挑战,指出现有测试技术在现实性能评估中的不足,并提出了未来研究方向,包括系统化测试标准、跨模型协作及可扩展验证框架。

Comments Accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13360 2025-12-16 cs.SE 75%

UCRBench: Benchmarking LLMs on Use Case Recovery

UCRBench:基于用例恢复的LLM基准测试

Shuyuan Xiao, Yiran Zhang, Weisong Sun, Xiaohong Chen, Yang Liu, Zhi Jin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UCRBench通过代码对齐的用例基准测试,评估LLM在从源代码生成用例方面的性能,揭示其在复杂系统中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12405 2025-12-16 cs.LG 74%

Can Graphs Improve Tabular Foundation Models?

图能否提升表格基础模型?

Franck Le, Keith Grueneberg, Erich Nahum, Vadim Sheinin

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 BOLERO通过引入轻量图先验提升预训练表格Transformer的性能,在分类和回归任务中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12238 2025-12-16 cs.CL cs.AI 73%

Semantic Distance Measurement based on Multi-Kernel Gaussian Processes

基于多核高斯过程的语义距离测量

Yinzhu Cheng, Haihua Xie, Yaqing Wang, Miao He, Mingming Sun

机构 * Institute of Statistics and Big Data(统计与大数据研究所) Renmin University of China(中国人民大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学应用研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于多核高斯过程的语义距离测量方法,通过自动学习核参数提升细粒度情感分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12503 2025-12-16 cs.AI 70%

KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs

KidsArtBench: 多维度儿童艺术评估与属性感知的大语言模型

Mingrui Ye, Chanjin Zheng, Zengyi Yu, Chenyu Xiang, Zhixue Zhao, Zheng Yuan, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) East China Normal University(东华大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KidsArtBench通过属性感知的多LoRA方法提升儿童艺术评估的准确性与教育意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12444 2025-12-16 cs.CL 70%

Can GPT replace human raters? Validity and reliability of machine-generated norms for metaphors

GPT能否替代人类评分者?机器生成的隐喻规范的有效性和可靠性

Veronica Mangiaterra, Hamad Al-Azary, Chiara Barattieri di San Pietro, Paolo Canal, Valentina Bambini

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了GPT在隐喻评分中的有效性与可靠性,发现较大模型能有效替代人类评分,但需注意隐喻惯例性和多模态因素的影响。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏