CIPHER:对隐私加固证据记录进行跨记录推理的基准测试
CIPHER: Benchmarking Cross-record Inference over Privacy-Hardened Evidence Records
浏览论文内容
中文总结 AI 辅助
CIPHER基准测试评估隐私加固记录上的跨记录推理,发现系统错误主要源于记录选择和谓词解释,而非算术执行。
中文摘要 AI 辅助
对受隐私约束的记录进行推理,需要将结构化属性与自由文本叙述中的证据相结合。我们引入了CIPHER(对隐私加固证据记录进行跨记录推理),这是一个包含来自消费者金融、临床和执法记录的专家验证问题的基准。这些问题涵盖常见的表格操作,并包含可执行的SQL监督。我们在原生编辑和基于替代的证据恢复下评估了检索、提示、表格专家和混合符号神经系统的性能。即使提供了支持记录,所有系统系列也表现出大量失败。大多数错误源于不正确的记录选择和谓词解释,而非算术执行。隐私转换具有非均匀效应,有时会掩盖必要证据,有时会减少干扰。CIPHER为诊断这些失败和评估敏感文本转换如何影响混合记录推理提供了一个可复现的测试平台。
英文摘要
Reasoning over privacy-constrained records requires combining structured attributes with evidence from free-text narratives. We introduce CIPHER (Cross-record Inference over Privacy-Hardened Evidence Records), a benchmark of expert-validated questions from consumer-finance, clinical, and law-enforcement records. The questions cover common tabular operations and include executable SQL supervision. We evaluate retrieval, prompting, table-specialist, and hybrid symbolic-neural systems under native redaction and surrogate-based evidence restoration. All system families exhibit substantial failures even when supporting records are provided. Most errors arise from incorrect record selection and predicate interpretation rather than arithmetic execution. Privacy transformations have non-uniform effects, sometimes obscuring necessary evidence and sometimes reducing distraction. CIPHER provides a reproducible testbed for diagnosing these failures and assessing how transformations of sensitive text affect reasoning over hybrid records.
发表机构
- Arizona State University(亚利桑那州立大学)
机构由 AI 辅助整理,请以论文原文为准。