arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-22 至 2025-12-22 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 38 篇

2512.17028 2025-12-22 cs.CL cs.AI cs.LG 90%

A Women's Health Benchmark for Large Language Models

为大型语言模型建立女性健康基准

Victoria-Elisabeth Gruber, Razvan Marinescu, Diego Fajardo, Amin H. Nassar, Christopher Arkfeld, Alexandria Ludlow, Shama Patel, Mehrnoosh Samaei, Valerie Klug, Anna Huber, Marcel Gühner, Albert Botta i Orfila, Irene Lagoja, Kimya Tarr, Haleigh Larson, Mary Beth Howard

机构 * Lumos AI Medical Oncology, Yale Cancer Center(耶鲁癌症中心医学肿瘤学部) Obstetrics and Gynecology, MGH, Harvard Medical School(妇产科,MGH,哈佛医学院) Obstetrics, Gynecology & Reproductive Sciences, UCSF(妇产科与生殖科学,UCSF) Brown Division of Global Emergency Medicine(全球急诊医学部,布朗分部) Department of Emergency Medicine, Emory University(急诊医学部,埃默里大学) Pharmacy Department, Clinic Ottakring(药学部,克利克诊所) Windrush Surgery, Buckinghamshire, Oxfordshire and Berkshire West Integrated Care Board, NHS(温德许手术,贝肯ham郡,牛津郡和伯克希尔西部整合护理委员会,NHS) Women’s Health Research, Yale School of Medicine(女性健康研究,耶鲁医学院) Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出女性健康基准,评估LLM在女性健康领域的表现,发现现有模型在关键任务上存在显著缺陷,需进一步改进以提供可靠医疗建议。

Comments 15 pages, 6 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20915 2025-12-22 cs.CR cs.AI cs.LG 90%

ZKPROV: A Zero-Knowledge Approach to Dataset Provenance for Large Language Models

ZKPROV: 一种用于大语言模型数据溯源的零知识方法

Mina Namazi, Alexander Nemecek, Erman Ayday

机构 * Open University of Catalonia(加泰罗尼亚开放大学) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ZKPROV通过零知识证明实现大语言模型的数据溯源验证,保障数据隐私与效率平衡,适用于医疗等敏感领域。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22659 2025-12-22 cs.SE cs.AI 89%

A Systematic Literature Review on Detecting Software Vulnerabilities with Large Language Models

基于大语言模型的软件漏洞检测系统文献综述

Sabrina Kaniewski, Fabian Schmidt, Markus Enzweiler, Michael Menth, Tobias Heer

机构 * Esslingen University(埃斯林根大学) Institute for Intelligent Systems, Esslingen University(智能系统研究所,埃斯林根大学) Chair of Communication Networks, University of Tübingen(通信网络教研室,图宾根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文系统综述了基于大语言模型的软件漏洞检测研究,分析了263项研究,提出了细粒度分类法,识别关键限制,并为未来研究提供了方向。

Comments 43 pages + 20 pages references, 7 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20900 2025-12-22 cs.CL cs.CY 89%

Large Language Models: A New Approach for Privacy Policy Analysis at Scale

大型语言模型:一种大规模隐私政策分析的新方法

David Rodriguez, Ian Yang, Jose M. Del Alamo, Norman Sadeh

机构 * ETSI Telecomunicación Universidad Politécnica de Madrid Spain(马德里理工大学电信工程学院) School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行大规模隐私政策分析,通过高效提取隐私实践,实现高准确率和低资源消耗。

Journal ref Computing, vol. 106, no. 12, pp. 3879-3903, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17164 2025-12-22 cs.IR 89%

TCDE: Topic-Centric Dual Expansion of Queries and Documents with Large Language Models for Information Retrieval

基于大语言模型的查询与文档主题聚焦双扩展方法用于信息检索

Yu Yang, Feng Tian, Ping Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TCDE通过大语言模型实现查询与文档的主题聚焦双扩展,提升信息检索的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17308 2025-12-22 cs.AI cs.CL 88%

Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation

大型语言模型作为宝可梦战斗代理:战略玩法与内容生成

Daksh Jain, Aarya Jain, Ashutosh Desai, Avyakt Verma, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,比兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在宝可梦战斗中的战略决策能力及内容生成能力,展示了其作为动态游戏对手和设计者的潜力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09147 2025-12-22 cs.CL cs.AI 88%

LLM-as-a-qualitative-judge: automating error analysis in natural language generation

LLM-as-a-qualitative-judge: 自动化自然语言生成中的错误分析

Nadezhda Chirkova, Tunde Oluwaseyi Ajayi, Seth Aycock, Zain Muhammad Mujahid, Vladana Perlić, Ekaterina Borisova, Markarit Vartampetian

机构 * Naver Labs Europe(纳维尔实验室欧洲分公司) Insight Research Ireland Centre for Data Analytics, Data Science Institute, University of Galway(爱尔兰洞察研究数据分析中心、数据科学研究所、Galway大学) University of Amsterdam(阿姆斯特丹大学) University of Copenhagen(哥本哈根大学) STMicroelectronics(STMicroelectronics公司) Télécom Paris(巴黎电信学院) Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心有限公司) Technische Universität Berlin(柏林技术大学) Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、LIG)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM-as-a-qualitative-judge方法,通过生成结构化报告帮助改进自然语言生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17389 2025-12-22 cs.IR 88%

The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability

大语言模型在推荐系统中的心理世界:关联性、个性化与知识性基准测试

Guangneng Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LRWorld基准,评估大语言模型在推荐系统中的关联性、个性化和知识性能力,发现其在浅层相似性任务上表现良好,但在深度个性化嵌入和多模态推理方面仍有不足。

Comments 21 pages, 13 figures, 27 tables, submission to KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14121 2025-12-22 cs.CV cs.AI 85%

SportsGPT: An LLM-driven Framework for Interpretable Sports Motion Assessment and Training Guidance

SportsGPT: 一种基于大语言模型的可解释性体育动作评估与训练指导框架

Wenbo Tian, Ruting Lin, Hongxian Zheng, Yaodong Yang, Geng Wu, Zihao Zhang, Zhang Zhang

机构 * School of Artificial Intelligence, UCAS, Beijing, China(人工智能学院) MAIS, NLPR, Institute of Automation, CAS, Beijing, China(自动化研究所) College of Education, Beijing Sport University, Beijing, China(北京体育大学) KuTi Sports Technology, Shaanxi, China(KuTi体育科技) Haoxiong Technology, Shanghai, China(浩鸿科技)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SportsGPT通过结合大语言模型和运动分析技术,实现可解释的体育动作评估与专业训练指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10689 2025-12-22 cs.CL 85%

Learning to Contextualize Web Pages for Enhanced Decision Making by LLM Agents

通过LLM代理增强决策的网页上下文化学习

Dongjun Lee, Juyong Lee, Kyuyoung Kim, Jihoon Tack, Jinwoo Shin, Yee Whye Teh, Kimin Lee

机构 * KAIST AI(韩国科学技术院人工智能实验室) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LCoW通过上下文化学习提升LLM代理在网页自动化任务中的决策能力,显著提高闭源和开源模型的成功率。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03735 2025-12-22 cs.LG cs.AI cs.CR cs.CY 84%

Privacy Bias in Language Models: A Contextual Integrity-based Auditing Metric

语言模型中的隐私偏误:基于情境完整性的一种审计度量

Yan Shvartzshnaider, Vasisht Duddu

机构 * York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于情境完整性的方法,用于评估语言模型的隐私偏误,探讨其影响因素及评估方法。

Comments Privacy Enhancing Technologies Symposium (PETS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18883 2025-12-22 cs.SE cs.LG 81%

Predictive Prompt Analysis

预测提示分析

Jae Yong Lee, Sungmin Kang, Shin Yoo

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出预测提示分析方法,通过稀疏自编码器快速分析提示并预测LLM响应,提升LLM在软件开发中的应用效率。

Comments Accepted by FSE 2025, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 81%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15952 2025-12-22 cs.CV cs.AI 79%

VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance

VideoGameQA-Bench: 评估用于视频游戏质量保证的视觉-语言模型

Mohammad Reza Taesiri, Abhijay Ghildyal, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 VideoGameQA-Bench是一个用于评估视觉-语言模型在视频游戏质量保证中性能的综合基准,涵盖视觉测试、故障检测和bug报告生成等多种任务。

Comments Project website with code and data: https://asgaardlab.github.io/videogameqa-bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12508 2025-12-22 cs.CL cs.AI cs.SD eess.AS 79%

Fun-ASR Technical Report

Fun-ASR 技术报告

Keyu An, Yanni Chen, Zhigao Chen, Chong Deng, Zhihao Du, Changfeng Gao, Zhifu Gao, Bo Gong, Xiangang Li, Yabin Li, Ying Liu, Xiang Lv, Yunjie Ji, Yiheng Jiang, Bin Ma, Haoneng Luo, Chongjia Ni, Zexu Pan, Yiping Peng, Zhendong Peng, Peiyao Wang, Hao Wang, Haoxu Wang, Wen Wang, Wupeng Wang, Yuzhong Wu, Biao Tian, Zhentao Tan, Nan Yang, Bin Yuan, Jieping Ye, Jixing Yu, Qinglin Zhang, Kun Zou, Han Zhao, Shengkui Zhao, Jingren Zhou, Yanqiao Zhu

机构 * Tongyi Fun Team(通义Fun团队)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Fun-ASR 是一种基于大语言模型的语音识别系统,通过整合大量数据、大模型容量和强化学习,实现了在复杂语音识别场景中的最先进性能,并优化了实际部署需求。

Comments Authors are listed in alphabetical order. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23358 2025-12-22 cs.CL cs.AI cs.DB cs.IR 79%

Text-to-SQL Task-oriented Dialogue Ontology Construction

面向任务的对话本体构建

Renato Vukovic, Carel van Niekerk, Michael Heck, Benjamin Ruppik, Hsien-Chin Lin, Shutong Feng, Nurul Lubis, Milica Gasic

机构 * Heinrich Heine University Düsseldorf(海因里希-海涅大学杜塞尔多夫)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TeQoDO通过LLM自主构建面向任务的对话本体,结合模块化TOD系统概念,提升对话系统的可解释性和可控性。

Comments Accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17387 2025-12-22 cs.SE cs.CL 77%

CIFE: Code Instruction-Following Evaluation

CIFE:代码指令遵循评估

Sravani Gunnu, Shanmukha Guttula, Hima Patel

机构 * IIT Bombay(印度班加罗尔理工学院) IBM Research India(IBM印度研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CIFE评估了1000个Python任务的代码生成模型,通过13类约束测试,揭示了模型在遵循开发者要求方面的不足,提出C2A分数衡量正确性与约束遵循性。

Comments 20 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17146 2025-12-22 cs.CR cs.LG q-bio.QM 77%

Biosecurity-Aware AI: Agentic Risk Auditing of Soft Prompt Attacks on ESM-Based Variant Predictors

生物安全意识的AI:基于ESM变体预测器的软提示攻击代理审计

Huixin Zhan

机构 * Department of Computer Science and Engineering(计算机科学与工程系) New Mexico Institute of Mining and Technology(新墨西哥采矿与技术研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本研究提出SAGE框架,通过代理风险审计发现ESM变体预测器对软提示攻击的敏感性,揭示基因组基础模型的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06278 2025-12-22 cs.RO 75%

Mitigating Undesired Conditions in Flexible Production with Product-Process-Resource Asset Knowledge Graphs

通过产品-过程-资源资产知识图谱缓解柔性生产中的不良状况

Petr Novak, Stefan Biffl, Marek Obitko, Petr Kadera

机构 * Czech Institute of Informatics, Robotics and Cybernetics(捷克信息学、机器人学与自动控制研究所) Czech Technical University in Prague(布拉格捷克技术大学) TU Wien -- Institute of Information Systems Engineering, Faculty of Informatics(维也纳技术大学——信息系统工程研究所,信息学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PPR-AKG模型,通过结合语义技术和大语言模型,解决柔性生产中的不良状况问题,提升资源分配效率和生产质量。

Comments Originally published online by CEUR Workshop Proceedings (CEUR-WS.org, ISSN 1613-0073) within ISWC 2025 Companion Volume. Available online: https://ceur-ws.org/Vol-4085/ and https://ceur-ws.org/Vol-4085/paper9.pdf

Journal ref CEUR Workshop Proceedings (CEUR-WS.org), ISSN 1613-0073. ISWC 2025 Companion Volume. Available online: https://ceur-ws.org/Vol-4085/ and https://ceur-ws.org/Vol-4085/paper9.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17419 2025-12-22 cs.SE cs.AI cs.CL cs.LG 75%

SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories

SWE-Bench++: 一个从开源仓库生成可扩展软件工程基准的框架

Lilin Wang, Lucas Ramalho, Alan Celestino, Phuc Anthony Pham, Yu Liu, Umang Kumar Sinha, Andres Portillo, Onassis Osunwa, Gabriel Maduekwe

机构 * Research & Development, Turing(研发与图灵)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SWE-Bench++通过自动化生成多语言软件工程基准,提升仓库级代码生成的评估与改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17117 2025-12-22 cs.HC 75%

Alignment, Exploration, and Novelty in Human-AI Interaction

对齐、探索与新颖性在人机交互中的体现

Halfdan Nordahl Fundal, Johannes Eide Rambøll, Karsten Olsen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了人类与AI在协作叙事中的情感对齐、语义探索和创新贡献,发现人类输入在塑造叙事方向和创造性分歧中起关键作用。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17902 2025-12-22 cs.CV cs.AI cs.CR 74%

Adversarial Robustness of Vision in Open Foundation Models

开放基础模型中视觉的对抗鲁棒性

Jonathon Fox, William J Buchanan, Pavlos Papadopoulos

机构 * Blockpass ID Lab(Blockpass ID 实验室) Edinburgh Napier University(爱丁堡纳皮尔大学)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 本文研究了LLaVA-1.5-13B和Llama 3.2 Vision-8B-2在视觉输入下的对抗鲁棒性,发现Llama 3.2 Vision在高扰动水平下性能下降更小,表明视觉模态是降级开放权重VLMs的可行攻击向量。

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 74%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17756 2025-12-22 cs.CL cs.AI 73%

AncientBench: Towards Comprehensive Evaluation on Excavated and Transmitted Chinese Corpora

AncientBench: 向考古与传世中文语料的全面评估迈进

Zhihan Zhou, Daqian Shi, Rui Song, Lida Shi, Xiaolei Diao, Hao Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AncientBench通过四个维度和十个任务全面评估大语言模型对古代文字的理解能力,揭示其在古代文本场景中的潜力与与人类的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15184 2025-12-22 cs.LG 70%

Data for Mathematical Copilots: Better Ways of Presenting Proofs for Machine Learning

用于数学助手的数据:为机器学习呈现证明的更好方式

Simon Frieder, Jonas Bayer, Sam Looi, Jacob Loader, Julius Berner, Katherine M. Collins, András Juhász, Fabian Ruehle, Sean Welleck, Gabriel Poesia, Ryan-Rhys Griffiths, Adrian Weller, Anirudh Goyal, Cameron Freer, Thomas Lukasiewicz, Timothy Gowers

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学) Caltech(加州理工学院) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) FutureHouse Inc.(未来房屋公司) Meta Vienna University of Technology(维也纳技术大学) MIT(麻省理工学院) Imperial College London(伦敦帝国学院) Collège de France(法兰西学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出改进数学助手数据集的设计,以更真实反映数学研究实践,从而提升大语言模型的证明学习能力。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 70%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17183 2025-12-22 cs.RO 67%

Semantic Co-Speech Gesture Synthesis and Real-Time Control for Humanoid Robots

语义共语手势合成与人形机器人实时控制

Gang Zhang

机构 * China Mobile HangZhou(中国移动杭州)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于语义的手势生成与实时控制框架,通过整合生成检索机制和模仿学习策略,实现人形机器人自然流畅的非语言交流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17527 2025-12-22 cs.LG cs.AI cs.CR 62%

SafeBench-Seq: A Homology-Clustered, CPU-Only Baseline for Protein Hazard Screening with Physicochemical/Composition Features and Cluster-Aware Confidence Intervals

SafeBench-Seq: 一种基于同源聚类、仅CPU运行的蛋白质危险筛查基准,结合物理化学/组成特征及聚类感知置信区间

Muhammad Haris Khan

机构 * University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 SafeBench-Seq是一种基于同源聚类、仅CPU运行的蛋白质危险筛查基准,利用物理化学和组成特征及聚类感知置信区间,提供可重复的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00496 2025-12-22 cs.CL cs.AI 62%

ResearchQA: Evaluating Scholarly Question Answering at Scale Across 75 Fields with Survey-Mined Questions and Rubrics

ResearchQA: 在75个领域中大规模评估学术问答

Li S. Yifei, Allen Chang, Chaitanya Malaviya, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 ResearchQA通过整合75个领域的调研文章,生成21K问题和160K评分项,用于大规模评估LLM系统,发现多数系统在覆盖评分项方面表现不足。

Comments 12 pages main, 40 pages total, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17267 2025-12-22 cs.CL cs.AI 62%

AutoMetrics: Approximate Human Judgements with Automatically Generated Evaluators

AutoMetrics: 通过自动生成评估器进行近似人类判断

Michael J. Ryan, Yanzhe Zhang, Amol Salunkhe, Yi Chu, Di Xu, Diyi Yang

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 AutoMetrics通过自动生成评估器,在低数据条件下提升与人类评分的相关性,提高Kendall相关性达33.4%,并提供可解释的自动指标工具。

详情

展开后加载摘要…

URL PDF HTML 收藏