arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-16 至 2025-12-16 共收录 269 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2507.00057 2025-12-16 cs.PL cs.AI cs.LG cs.SE 86%

Incoherence as Oracle-less Measure of Error in LLM-Based Code Generation

不一致性作为无 oracle 的错误度量方法在基于 LLM 的代码生成中的应用

Thomas Valentin, Ardi Madadi, Gaetano Sapia, Marcel Böhme

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无 oracle 的错误度量方法,用于评估基于LLM的代码生成的正确性,通过不一致性度量有效识别错误程序并替代传统 oracle 评估。

Comments Accepted at AAAI'26 (extended version). 8 pages + refs and appendix

Journal ref 40th Annual AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23260 2025-12-16 cs.CR cs.AI 85%

From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows

从提示注入到协议利用:LLM驱动的AI代理工作流中的威胁

Mohamed Amine Ferrag, Norbert Tihanyi, Djallel Hamouda, Leandros Maglaras, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(阿联酋大学计算机与网络工程系) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(埃奥瓦大学) Department of Computer Science, Guelma University(古尔马大学计算机科学系) De Montfort University(德蒙福特大学) Khalifa University of Science and Technology(卡里玛科学技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一的端到端威胁模型,系统分类了LLM代理生态系统中的三十多种攻击技术,涵盖输入操纵、模型妥协、系统和隐私攻击及协议漏洞,并提供缓解策略以设计安全的代理AI系统。

Comments The paper is published in ICT Express (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 85%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13405 2025-12-16 cs.CL 83%

RealHiTBench: A Comprehensive Realistic Hierarchical Table Benchmark for Evaluating LLM-Based Table Analysis

RealHiTBench: 一个全面的现实感分层表格基准,用于评估基于LLM的表格分析

Pengzuo Wu, Yuhang Yang, Guangcheng Zhu, Chao Ye, Hong Gu, Xu Lu, Ruixuan Xiao, Bowen Bao, Yijing He, Liangyu Zha, Wentao Ye, Junbo Zhao, Haobo Wang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Institute of Computing Innovation, Zhejiang University(浙江大学计算机创新研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RealHiTBench是一个用于评估基于LLM的表格分析能力的综合现实感分层表格基准,通过多种输入格式和复杂结构的表格测试,验证了改进LLMs对表格层次结构感知的重要性。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23059 2025-12-16 cs.CL cs.AI 81%

Conveying Imagistic Thinking in Traditional Chinese Medicine Translation: A Prompt Engineering and LLM-Based Evaluation Framework

在传统中医翻译中传达意象思维:一种提示工程和基于LLM的评估框架

Jiatong Han

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于提示工程和LLM的评估框架,用于提升传统中医翻译中隐喻和转喻的传达效果,通过人机协同方法实现高效且可复制的翻译路径。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01198 2025-12-16 cs.CL 79%

Conveying Imagistic Thinking in Traditional Chinese Medicine Translation: A Prompt Engineering and LLM-Based Evaluation Framework

在传统中医翻译中传达意象思维:一种提示工程与基于LLM的评估框架

Jiatong Han

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本研究提出一种提示工程与LLM结合的评估框架,用于提升传统中医翻译中意象思维的传达效果。

Comments This is a duplicate of arXiv:2511.23059

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23453 2025-12-16 cs.CR cs.CL 79%

Counterfactual Evaluation for Blind Attack Detection in LLM-based Evaluation Systems

对抗性评估用于基于大语言模型的评估系统的盲攻击检测

Lijia Liu, Takumi Kondo, Kyohei Atarashi, Koh Takeuchi, Jiyi Li, Shigeru Saito, Hisashi Kashima

机构 * Kyoto University(京都大学) Hokkaido University(北海道大学) SIGNATE, Inc.(SIGNATE公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出SE+CFE框架,通过反事实评估提升基于大语言模型的评估系统对盲攻击的检测能力,同时保持性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13658 2025-12-16 cs.CY cs.AI 77%

Embedding-Based Rankings of Educational Resources based on Learning Outcome Alignment: Benchmarking, Expert Validation, and Learner Performance

基于学习成果对齐的教育资源排名:基准测试、专家验证与学习者表现

Mohammadreza Molavi, Mohammad Moein, Mohammadreza Tavakoli, Abdolali Faraji, Stefan T. Mol, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology (TIB)(莱比锡科学与技术信息中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于嵌入的对齐框架,通过基准测试和专家验证,证明了教育资源与学习成果对齐度对学习表现的正向影响。

Comments Accepted for publication at the 16th International Conference on Learning Analytics & Knowledge (LAK 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13059 2025-12-16 cs.CL 77%

An Open and Reproducible Deep Research Agent for Long-Form Question Answering

一个开放且可重复的深度研究代理用于长格式问答

Ikuya Yamada, Wataru Ikeda, Ko Yoshida, Mengyu Ye, Hinata Sugimoto, Masatoshi Suzuki, Hisanori Ozaki, Jun Suzuki

机构 * Studio Ousia(Ousia工作室) Tohoku University(东京大学) DENTSU SOKEN INC.(DENTSU SOKEN公司) RIKEN(日本学术振兴会) NII LLMC(日本信息处理学会LLMC)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出一个开放的深度研究代理,结合开源大语言模型和网络搜索API,通过偏好微调提升长格式问答的推理质量。

Comments Technical report of a winning system in the NeurIPS MMU-RAG competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12536 2025-12-16 cs.SE cs.AI 77%

Diverse LLMs vs. Vulnerabilities: Who Detects and Fixes Them Better?

多样化LLMs与漏洞:谁更能检测和修复它们?

Arastoo Zibaeirad, Marco Vieira

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出DVDR-LLM框架,通过集成多个LLMs来提高软件漏洞检测与修复的准确性,同时探讨了集成方法在不同安全场景下的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12500 2025-12-16 cs.HC cs.AI 77%

Explainable AI as a Double-Edged Sword in Dermatology: The Impact on Clinicians versus The Public

可解释AI在皮肤科中的双刃剑作用:对医生与公众的影响

Xuhai Xu, Haoyu Hu, Haoran Zhang, Will Ke Wang, Reina Wang, Luis R. Soenksen, Omar Badri, Sheharbano Jafry, Elise Burger, Lotanna Nwandu, Apoorva Mehta, Erik P. Duhaime, Asif Qasim, Hause Lin, Janis Pereira, Jonathan Hershon, Paulius Mui, Alejandro A. Gru, Noémie Elhadad, Lena Mamykina, Matthew Groh, Philipp Tschandl, Roxana Daneshjou, Marzyeh Ghassemi

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了可解释AI在皮肤科诊断中的影响,发现不同专业背景的人对XAI的反应不同,LLM在医疗AI中具有双刃剑效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12004 2025-12-16 cs.LG cs.CY 77%

EnviroLLM: Resource Tracking and Optimization for Local AI

EnviroLLM:本地AI的资源追踪与优化

Troy Allen

机构 * Georgia Institute of Technology, College of Computing(佐治亚理工学院计算机学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EnviroLLM通过提供本地AI资源追踪、性能评估和能耗优化工具,帮助用户更有效地管理和评估AI模型的效率与环境影响。

Comments 8 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11906 2025-12-16 cs.CV cs.LG 77%

MPath: Multimodal Pathology Report Generation from Whole Slide Images

MPath:从全切片图像生成多模态病历报告

Noorul Wahab, Nasir Rajpoot

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA研究中心)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 MPath通过多模态条件化方法,利用预训练的生物医学语言模型生成病理报告,展示了在病理报告生成中的有效性与可扩展性。

Comments Pages 4, Figures 1, Table 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11887 2025-12-16 cs.CY cs.AI 77%

Advancing Autonomous Driving System Testing: Demands, Challenges, and Future Directions

推进自动驾驶系统测试:需求、挑战与未来方向

Yihan Liao, Jingyu Zhang, Jacky Keung, Yan Xiao, Yurou Dai

机构 * City University of Hong Kong(香港城市大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Lehigh University(莱斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究探讨了自动驾驶系统测试的需求与挑战,指出现有测试技术在现实性能评估中的不足,并提出了未来研究方向,包括系统化测试标准、跨模型协作及可扩展验证框架。

Comments Accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13360 2025-12-16 cs.SE 75%

UCRBench: Benchmarking LLMs on Use Case Recovery

UCRBench:基于用例恢复的LLM基准测试

Shuyuan Xiao, Yiran Zhang, Weisong Sun, Xiaohong Chen, Yang Liu, Zhi Jin

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UCRBench通过代码对齐的用例基准测试,评估LLM在从源代码生成用例方面的性能,揭示其在复杂系统中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12405 2025-12-16 cs.LG 74%

Can Graphs Improve Tabular Foundation Models?

图能否提升表格基础模型?

Franck Le, Keith Grueneberg, Erich Nahum, Vadim Sheinin

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 BOLERO通过引入轻量图先验提升预训练表格Transformer的性能,在分类和回归任务中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12238 2025-12-16 cs.CL cs.AI 73%

Semantic Distance Measurement based on Multi-Kernel Gaussian Processes

基于多核高斯过程的语义距离测量

Yinzhu Cheng, Haihua Xie, Yaqing Wang, Miao He, Mingming Sun

机构 * Institute of Statistics and Big Data(统计与大数据研究所) Renmin University of China(中国人民大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学应用研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于多核高斯过程的语义距离测量方法,通过自动学习核参数提升细粒度情感分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12503 2025-12-16 cs.AI 70%

KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs

KidsArtBench: 多维度儿童艺术评估与属性感知的大语言模型

Mingrui Ye, Chanjin Zheng, Zengyi Yu, Chenyu Xiang, Zhixue Zhao, Zheng Yuan, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) East China Normal University(东华大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KidsArtBench通过属性感知的多LoRA方法提升儿童艺术评估的准确性与教育意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12444 2025-12-16 cs.CL 70%

Can GPT replace human raters? Validity and reliability of machine-generated norms for metaphors

GPT能否替代人类评分者?机器生成的隐喻规范的有效性和可靠性

Veronica Mangiaterra, Hamad Al-Azary, Chiara Barattieri di San Pietro, Paolo Canal, Valentina Bambini

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了GPT在隐喻评分中的有效性与可靠性,发现较大模型能有效替代人类评分,但需注意隐喻惯例性和多模态因素的影响。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11506 2025-12-16 cs.AI 70%

EmeraldMind: A Knowledge Graph-Augmented Framework for Greenwashing Detection

EmeraldMind: 一种集成领域知识图谱的绿色洗脑检测框架

Georgios Kaoukis, Ioannis Aris Koufopoulos, Eleni Psaroudaki, Danae Pla Karidi, Evaggelia Pitoura, George Papastefanatos, Panayiotis Tsaparas

机构 * Archimedes, Athena Research Center(阿奇米德研究中心) Athena Research Center(阿提卡研究中心) University of Ioannina(伊奥安尼纳大学) IMSI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EmeraldMind通过整合领域知识图谱与检索增强生成技术,实现绿色洗脑检测,提供证据支持的裁决并提升解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08290 2025-12-16 cs.CR cs.AI 70%

Systematization of Knowledge: Security and Safety in the Model Context Protocol Ecosystem

知识体系化:模型上下文协议生态系统中的安全与安全

Shiva Gaire, Srijan Gyawali, Saroj Mishra, Suman Niroula, Dilip Thakur, Umesh Yadav

机构 * Tribhuvan University(特里布文大学) University of North Dakota(北达科他大学) Youngstown State University(亚当斯州立大学) University of Missouri(密苏里大学) University of Toledo(托莱多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统化分析了模型上下文协议生态系统中的安全与安全风险,提出了全面的风险分类,并探讨了从对话聊天机器人到自主代理操作系统安全过渡的路线图。

Comments All authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00009 2025-12-16 cs.HC cs.AI 70%

Development and Benchmarking of a Blended Human-AI Qualitative Research Assistant

混合人类-人工智能定性研究助手的开发与基准测试

Joseph Matveyenko, James Liu, John David Parsons, Ryan A. Brown, Alina Palimaru, Prateek Puri

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文开发了Muse,一种交互式AI定性研究系统,通过基准测试展示了其在主题识别和标注中的可靠性及纠错能力。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14952 2025-12-16 cs.LG 70%

Stochastic Bilevel Optimization with Heavy-Tailed Noise

具有重尾噪声的随机双层优化

Zhuanghua Liu, Luo Luo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种针对具有重尾噪声的双层优化问题的N²SBA方法,实现了高效的SFO复杂度,并在非凸-强凹最小化最大优化中取得了良好的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04457 2025-12-16 cs.CL 70%

Do MLLMs Really Understand the Charts?

多模态大语言模型真的能理解图表吗?

Xiao Zhang, Dongyuan Li, Liuyu Xiang, Yao Zhang, Cheng Zhong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) AAITC, CTO Organization, Lenovo(AAITC、CTO组织、联想) Lenovo(联想)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 ChartVR-3B/7B 模型,通过 VR-RFT 策略提升图表视觉推理能力,并在 ChartVRBench 上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 70%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07405 2025-12-16 cs.LG 70%

RiemannFormer: A Framework for Attention in Curved Spaces

RiemannFormer:曲空间中注意力机制的框架

Zhongping Ji

机构 * Hangzhou Dianzi University(杭州电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RiemannFormer通过引入曲空间中的几何解释和参数优化,提升变换器模型的性能。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11604 2025-12-16 cs.CR 67%

SoK: Can Fully Homomorphic Encryption Support General AI Computation? A Functional and Cost Analysis

SoK:完全同态加密能否支持通用人工智能计算?功能与成本分析

Jiaqi Xue, Xin Xin, Wei Zhang, Mengxin Zheng, Qianqian Song, Minxuan Zhou, Yushun Dong, Dongjie Wang, Xun Chen, Jiafeng Xie, Liqiang Wang, David Mohaisen, Hongyi Wu, Qian Lou

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨FHE能否支持通用AI计算,通过功能和成本分析评估了十种FHE方法,并针对混合线性和非线性操作的工作负载进行了基准测试。

Comments 26th Privacy Enhancing Technologies Symposium (PETS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13238 2025-12-16 cs.CV 67%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12756 2025-12-16 cs.CV 67%

FysicsWorld: A Unified Full-Modality Benchmark for Any-to-Any Understanding, Generation, and Reasoning

FysicsWorld: 一个统一的全模态基准用于任意到任意的理解、生成和推理

Yue Jiang, Dingkang Yang, Minghao Han, Jinghang Han, Zizhi Chen, Yizhou Liu, Mingcheng Li, Peng Zhai, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(菲茨智能技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 FysicsWorld是一个统一的全模态基准,支持图像、视频、音频和文本之间的双向交互,通过16个主要任务和3,268个样本全面评估理解、生成和推理能力,揭示模型在多模态任务中的性能差异。

Comments The omni-modal benchmark report from Fysics AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12592 2025-12-16 cs.CY 67%

Beyond Static Scoring: Enhancing Assessment Validity via AI-Generated Interactive Verification

超越静态评分:通过AI生成的交互验证提升评估效度

Tom Lee, Sihoon Lee, Seonghun Kim

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出人机协作框架,通过AI生成的交互验证提升评估效度,解决传统静态评分无法捕捉过程证据的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏