基于Hash改进的k-means算法并行化设计

快速导航

期刊信息

1973年创刊

《计算机工程与科学》的办刊宗旨是为计算机界同行发表有创见的学术论文，介绍有特色的科研成果，探讨有新意的学术观点提供理想园地；�...查看更多>>

通知公告

您现在所在位置：首页 > 期刊导读 > 2016年 > 10 > 信息摘要

【出处】：

【作者】：张波 ; 徐蔚鸿 ; 陈沅涛 ; 朱玲

【摘要】为了解决k-means算法在Hadoop平台下处理海量高维数据时聚类效果差,以及已有的改进算法不利于并行化等问题,提出了一种基于Hash改进的并行化方案.将海量高维的数据映射到一个压缩的标识空间,进而挖掘其聚类关系,选取初始聚类中心,避免了传统k-means算法对随机选取初始聚类中心的敏感性,减少了k-means算法的迭代次数.又结合MapReduce框架将算法整体并行化,并通过Partition、Combine等机制加强了并行化程度和执行效率.实验表明,该算法不仅提高了聚类的准确率和稳定性,同时具有良好的处理速度.

上一篇：无线Mesh网络中基于业务价值的组播带宽分配方案
下一篇：基于负载预测的虚拟机动态调度算法研究与实现