山西大学大数据科学与产业研究院

基于邻域视角的关联关系挖掘方法

Authors: 成红红, 钱宇华, 胡治国, 梁吉业

Abstract:

识别海量变量间潜在的复杂关联关系,判断不同形式关联关系的强弱,是大数据关联关系挖掘的重要任务之一.然而,数据分布的不确定性、关联关系的多样性,使得基于分布假设的关联关系度量和基于数据驱动的非参数度量方法的适用性、准确性难以保证.因此,设计一种对关联关系形式无偏的有效关联度量方法变得至关重要.本文从大数据背景下潜在关联关系应被公平排序的需求出发,回顾了目前关联度量的公理化条件,给出了大数据关联关系度量可能需满足的性质;讨论了两类基于邻域视角的度量方法存在的不足;提出了本文基于k-NN粒的关联度量方法,称为最大邻域系数.人造数据集和真实数据集实验从不同角度验证了本文所提方法的有效性和优越性.最后指出了实验中发现的有趣现象和有待解决的理论问题,以引起对该领域更深入的思考和研究.

Keywords： 大数据,复杂关联关系挖掘,关联度量,数据驱动,粒计算,k-NN粒

基于邻域视角的关联关系挖掘方法.pdf

Wed Nov 25 11:00:00 CST 2020