arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2604.06188 2026-04-09 cs.HC cs.AI cs.CL 62%

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

大语言模型的幻觉螺旋:AI聊天机器人界面的基准测试审计研究

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci

机构 * Princeton University(普林斯顿大学) Phillips Exeter Academy(菲利普斯埃克塞特学院) Independent(独立)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过56次20轮对话测试ChatGPT-4o和ChatGPT-5,发现API与聊天界面环境存在显著差异,揭示了自动化测试方法的不足及政策选择对行为的影响。

Comments Accepted at the 2nd Annual Conference of the International Association for Safe and Ethical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03926 2026-04-09 cs.AI cs.CY cs.HC cs.MA 62%

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

CODE-GEN:一种基于检索增强生成的多选题生成人机协作人工智能系统

Xiaojing Duan, Frederick Nwanganga, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 CODE-GEN通过生成与课程目标一致的多选题提升学生代码推理能力,采用生成器和验证器代理,结合专用工具提高准确性,评估结果显示系统在七个教学维度上表现优异,但人类专家仍需参与设计教学性干扰项和反馈质量。

Comments Full version of the paper accepted as a short paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00102 2026-04-09 cs.LG cs.AI eess.SP 62%

Towards transparent and data-driven fault detection in manufacturing: A case study on univariate, discrete time series

面向透明和数据驱动的制造业故障检测:一个关于单变量离散时间序列的案例研究

Bernd Hofmann, Patrick Bruendl, Huong Giang Nguyen, Joerg Franke

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合机器学习和可解释方法的故障检测方法,通过量化扰动分析和专家评估验证其有效性,在单变量离散时间序列中实现95.9%的检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06071 2026-04-08 cs.CL cs.AI cs.HC 62%

Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles

你生命中的故事:基于丰富心理测量资料的LLM生成生命故事的往返评估

Ben Wigler, Maria Tsfasman, Tiffany Matej Hrkalovic

机构 * LoveMind AI Jheronimus Academy of Data Science(耶罗尼米斯数据科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过LLM生成生命故事并回收心理测量数据,验证了LLM在编码和解码个体差异方面的鲁棒性,展示了心理特征与语言表达之间的关系。

Comments Under review at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04192 2026-04-08 cs.CV cs.AI cs.LG 62%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05075 2026-04-08 cs.AI cs.CL 62%

MMORF: A Multi-agent Framework for Designing Multi-objective Retrosynthesis Planning Systems

MMORF:一种用于设计多目标逆合成规划系统的多智能体框架

Frazier N. Baker, Trieu Nguyen, Reza Averly, Botao Yu, Daniel Adu-Ampratwum, Huan Sun, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Mathematics and Statistics, University of South Florida(南佛罗里达大学数学与统计系) Division of Medicinal Chemistry and Pharmacognosy, The Ohio State University(俄亥俄州立大学药物化学与生药学系) Department of Biomedical Informatics, The Ohio State University(俄亥俄州立大学生物医学信息学系) Translational Data Analytics Institute, The Ohio State University(俄亥俄州立大学转化数据分析研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMORF框架,通过多智能体系统解决多目标逆合成规划问题,展示了MASIL和RFAS在安全、成本和约束任务中的优越性能。

Comments 36 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 62%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 62%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15746 2026-04-07 cs.CL cs.AI 62%

LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation

LLMs 自我评判:一种用于人类对齐评估的游戏理论框架

Gao Yang, Yuhang Liu, Siyu Miao, Xinyue Liang, Zhengyang Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于游戏理论的自动相互评估框架,通过LLM自我评估和同伴评审,结合人类投票行为,探索LLM评估的对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26433 2026-04-07 cs.LG cs.AI 62%

ACT: Agentic Classification Tree

ACT:代理分类树

Vincent Grari, Tim Arni, Thibault Laugel, Sylvain Lamprier, James Zou, Marcin Detyniecki

机构 * AXA AI Research(AXA人工智能研究) Stanford University(斯坦福大学) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院) Polish Academy of Sciences, IBS PAN, Warsaw, Poland(波兰科学院计算机科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 ACT通过将决策树扩展到非结构化输入,利用自然语言问题和LLM反馈提升透明度和可解释性,实验证明其在文本基准上优于基于提示的方法。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24186 2026-04-07 cs.CL cs.AI 62%

Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks

测量能力,而非表现:跨医学基准的项目意识评估

Zhimeng Luo, Lixin Wu, Adam Frisch, Daqing He

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院) Department of Educational Psychology, University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校教育心理学系) Department of Emergency Medicine, University of Pittsburgh(匹兹堡大学急诊医学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedIRT框架,通过项目反应理论评估LLM在医学领域的实际能力,揭示了不同医学主题的领域异质性,并展示了项目难度分析对不同响应模式的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03376 2026-04-07 cs.AI cs.CL 62%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03252 2026-04-07 cs.CY cs.CL 62%

Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations

利用大语言模型评估数字农业工具的包容性:人类与AI评估的比较分析

Githma Pewinya, Carolina Martins, Garcia Mariangel

机构 * International Water Management Institute(国际水资源管理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨大语言模型在快速评估数字农业工具包容性方面的潜力,比较四种模型与专家评估的性能,发现其在某些维度上能接近专家判断,但可靠性因模型和情境而异。

Comments 24 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 62%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02194 2026-04-03 cs.CL cs.AI 62%

Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Model

Neuro-RIT: 用于鲁棒检索增强语言模型的神经引导指令微调

Jaemin Kim, Jae O Lee, Sumyeong Ahn, Seo Yeon Park

机构 * Hanyang University(汉阳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Neuro-RIT通过神经层面的对齐提升检索增强语言模型的鲁棒性,通过神经属性挖掘分离相关与无关上下文的神经元,并采用两阶段指令微调策略增强噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21884 2026-04-03 cs.CL cs.AI 62%

Support-Contra Asymmetry in LLM Explanations

支持-矛盾不对称性在大语言模型解释中的体现

Avinash Patil

机构 * Hewlett Packard Enterprise(慧与科技公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型生成的解释与外部模型提取的预测词汇证据之间的关系,发现正确预测的解释更倾向于引用支持性词汇,而错误预测的解释则更多引用矛盾性词汇,揭示了解释与证据之间的不对称性。

Comments 17 Pages, 12 Figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17760 2026-04-02 cs.LG cs.AI 62%

But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors

但你的诚实答案是什么?利用引导向量辅助LLM-法官的诚实替代方案

Leon Eshuijs, Archie Chaudhury, Alan McBeth, Ethan Nguyen

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent(独立)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUSSA框架,通过引导向量优化法官的诚实性,提升对欺骗性回答的检测能力,实验显示在不同 dishonesty 水平下,GPT-4.1和Claude Haiku的AUROC均有显著提升,但任务复杂度不匹配时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13129 2026-04-02 cs.CV cs.AI cs.LG 62%

Science-T2I: Addressing Scientific Illusions in Image Synthesis

Science-T2I: 解决图像合成中的科学幻觉

Jialuo Li, Wenhao Chai, Xingyu Fu, Haiyang Xu, Saining Xie

机构 * New York University(纽约大学) University of Washington(华盛顿大学) University of Pennsylvania(宾夕法尼亚大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。

Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 62%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29500 2026-04-01 cs.AI cs.LG 62%

Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries

通过结构化形式中介学习生成可形式验证的逐步逻辑推理

Luoxin Chen, Yichi Zhou, Huishuai Zhang

机构 * Wangxuan Institue of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRoSFI方法,通过形式验证提升推理可靠性,利用结构化中间步骤和形式证明验证生成可信的逐步推理过程。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26378 2026-03-30 cs.LG cs.AI 62%

Generative Modeling in Protein Design: Neural Representations, Conditional Generation, and Evaluation Standards

蛋白质设计中的生成建模:神经表示、条件生成与评估标准

Senura Hansaja Wanasekara, Minh-Duong Nguyen, Xiaochen Liu, Nguyen H. Tran, Ken-Tye Yong

机构 * The University of Sydney(悉尼大学) VinUniversity

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了蛋白质研究中的生成AI,涵盖序列、几何和多模态表示,生成架构如SE(3)等价扩散、流匹配和混合预测生成系统,以及从结构预测到蛋白质-配体相互作用的任务设置,并提出评估最佳实践和开放挑战。

Comments 20 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25813 2026-03-30 cs.LG cs.AI 62%

MAGNET: Autonomous Expert Model Generation via Decentralized Autoresearch and BitNet Training

MAGNET:通过去中心化自研与BitNet训练实现自主专家模型生成

Yongwan Kim, Sungchul Park

机构 * Holo Studio Co., Ltd.(Holo Studio 有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 MAGNET通过去中心化自研和BitNet训练,实现跨通用硬件的领域专家语言模型自主生成、训练与服务,核心贡献包括自研流水线、BitNet三进制训练、分布式融合与链上贡献追踪。

Comments 20 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI 62%

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 62%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24618 2026-03-27 cs.AR cs.AI cs.LG 62%

Causal AI For AMS Circuit Design: Interpretable Parameter Effects Analysis

因果AI用于AMS电路设计:可解释的参数影响分析

Mohyeu Hussain, David Koblah, Reiner Dizon-Paradis, Domenic Forte

机构 * University of Florida(佛罗里达大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于因果推理的框架,通过SPICE仿真数据构建DAG并估算ATE,实现参数影响的可解释性分析,验证了因果AI在AMS设计中的高精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 62%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23519 2026-03-26 cs.CL cs.AI 62%

MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?

MedMT-Bench: LLMs能否在医学场景中记忆并理解长多轮对话?

Lin Yang, Yuancheng Yang, Xu Wang, Changkun Liu, Haihua Yang

机构 * ByteDance(字节跳动)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 MedMT-Bench通过模拟诊断治疗流程,测试LLM在长上下文记忆、干扰鲁棒性和安全防御方面的表现,发现17种前沿模型均无法达到60%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 62%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23501 2026-03-25 cs.CV cs.AI cs.CL 62%

MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage

MedObvious:通过临床分诊暴露视觉语言模型中的医学莫拉维奇悖论

Ufaq Khan, Umair Nawaz, L D M S S Teja, Numaan Saeed, Muhammad Bilal, Yutong Xie, Mohammad Yaqub, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(马尔代夫布扎伊德人工智能大学,阿联酋) National Institute of Technology, Silchar(西尔CHAR国家理工学院) Birmingham City University, UK(伯明翰城市大学,英国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究提出MedObvious基准测试,通过临床分诊任务验证视觉语言模型的输入验证能力,发现现有模型在处理不一致或无效输入时仍存在可靠性问题。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏