Evaluating AI Generated Summaries for Cancer Patients
评估面向癌症患者的AI生成摘要
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
评估面向癌症患者的AI生成摘要
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究采用双重评估框架,结合人类专家与LLM-as-a-judge,评估癌症患者护理应用中AI生成摘要的质量,发现其存在遗漏和轻微不准确问题,以此优化相关设计与防护措施。
ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证
机构 * Multiverse Computing ; Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) ; Centre for Social Innovation(社会创新中心) ; Donostia International Physics Center(多诺斯蒂亚国际物理中心) ; Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。
Comments 20 pages, 4 figures
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)
MVC-Bench:医学视觉-语言模型的校准基准测试
机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) ; Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)
专题命中 幻觉与事实性 :safety(abstract)
AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。
Comments Accepted in EMNLP 2026 Findings