arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

超越边际分布:多表合成数据生成的多维评估框架

Beyond Marginals: A Multi-Dimensional Evaluation Framework for Multi-Table Synthetic Data Generation

Aparana Gupta, Anurup Dey, Suyash Dwivedi

arXiv 2610.06854首次发表:更新:

发表机构

Microsoft(微软)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

针对多表合成数据缺乏统一评估框架的问题,提出SynEval六维评估框架,联合评估保真度、结构、完整性、效用、隐私和边缘情况,并生成加权质量分数。

AI 中文摘要

合成数据生成对于隐私合规、机器学习增强和软件测试至关重要。虽然单表评估已很成熟,但多表(关系型)合成——企业中的主要用例——缺乏统一的评估框架。现有方法孤立地评估边际列分布,忽视了联合分布、跨表结构完整性、下游效用和生产就绪的边缘情况。我们提出了SynEval,一个用于多表合成数据库的六维评估框架。SynEval联合评估每列保真度、多变量结构保留(包括新颖的条件分布检查)、跨表完整性、机器学习效用、隐私保护和边缘情况鲁棒性。该框架产生统一的加权质量分数,支持按表和按维度下钻,并且与生成器无关,可对任意一对真实和合成CSV文件夹进行操作,自动进行模式推断。SynEval是一个框架,将条件分布检查P(Y|X)、跨表基数验证和生产就绪边缘情况测试整合到关系型合成数据的单一评估流程中。

英文摘要

Synthetic data generation is critical for privacy compliance, machine learning augmentation, and software testing. While single-table evaluation is well established, multi-table (relational) synthesis, the dominant enterprise use case, lacks a unified evaluation framework. Existing approaches assess marginal column distributions in isolation, overlooking joint distributions, cross-table structural integrity, downstream utility, and production-readiness edge cases. We present SynEval, a six-dimensional evaluation framework for multi-table synthetic databases. SynEval jointly assesses per-column fidelity, multivariate structure preservation including a novel conditional distribution check, cross-table integrity, ML utility, privacy protection, and edge-case robustness. The framework produces a unified weighted quality score with per-table and per-dimension drill-down, and is generator-agnostic, operating on any pair of real and synthetic CSV folders with automatic schema inference. SynEval is a framework to combine conditional distribution checks P(Y|X), cross-table cardinality validation, and production-readiness edge-case testing within a single evaluation pipeline for relational synthetic data.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑