arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~
arXiv 2607.17178cs.LGcs.AI

DADIR:密度感知数据级不平衡回归框架

DADIR: Density-Aware Data-level Imbalanced Regression Framework

Shermin Shahbazi, Hossein Mohammadi, Mohsen Afsharchi

首次发表
浏览论文内容

中文总结 AI 辅助

针对不平衡回归难题,提出DADIR框架,含密度感知自适应划分、密度正则化条件变分自编码器和潜在空间数据平衡三个组件,能有效识别少数区域、保留稀疏区域信息并生成合成数据,提升不平衡回归数据集预测性能。

中文摘要 AI 辅助

不平衡学习解决数据分布中代表性不足区域的预测建模问题。尽管在分类中已广泛研究,但不平衡回归因连续目标变量和异构密度分布仍具挑战性。现有数据级方法常依赖固定目标划分或合成样本生成,未联合考虑密度变化和局部特征空间结构。我们提出DADIR,一个在平衡过程中利用密度信息的密度感知数据级不平衡回归框架。DADIR由三个组件组成:密度感知自适应划分(DAAP),根据密度变化递归划分目标空间;密度正则化条件变分自编码器(DR-CVAE),学习潜在特征时保留稀疏区域表示;潜在空间数据平衡,结合特征级聚类和过采样生成结构一致的合成样本。实验表明该框架能有效识别少数区域,保留稀疏区域信息,生成逼真合成数据,直接用于现有回归模型可提升预测性能。

英文摘要

Imbalanced learning addresses predictive modeling problems with underrepresented regions of the data distribution. Although widely studied in classification, imbalanced regression remains challenging because of continuous target variables and heterogeneous density distributions. Existing data-level methods often rely on fixed target partitioning or synthetic sample generation without jointly considering density variations and local feature-space structure. We propose DADIR, a Density-Aware Data-level Imbalanced Regression framework that exploits density information throughout the balancing process. DADIR comprises three components: (1) Density-Aware Adaptive Partitioning (DAAP), which recursively partitions the target space according to density variations; (2) a Density-Regularized Conditional Variational Autoencoder (DR-CVAE), which preserves sparse-region representations while learning latent features; and (3) latent-space data balancing, which combines feature-level clustering with oversampling to generate structurally consistent synthetic samples. Together, these components identify minority regions more effectively, preserve sparse-region information, and generate realistic synthetic data. The resulting balanced dataset can be used directly with existing regression models without modifying their architecture or learning objective. Experiments on diverse imbalanced regression datasets demonstrate consistent improvements in predictive performance, particularly in underrepresented regions, while also improving overall accuracy.

发表机构

  • University of Zanjan(赞詹大学)

机构由 AI 辅助整理,请以论文原文为准。

↑