nJcx's Blog

十年生死两茫茫,写程序,到天亮。相顾无言,惟有泪千行

流量日志审计中常用的聚类算法(K-Means)


算法介绍

K-means算法是聚类方法的一种,,属于非监督学习算法,是十大经典数据挖掘算法之一。K-means算法的基本思想是:以空间中k个点为中心进行聚类,对最靠近他们的对象归类。通过迭代的方法,逐次更新各聚类中心的值,直至得到最好的聚类结果。

k-means 算法接受参数 k ,然后将事先输入的n个数据对象划分为 k个聚类以便使得所获得的聚类满足,同一聚类中的对象相似度较高,而不同聚类中的对象相似度较小。聚类相似度是利用各聚类中对象的均值所获得一个“中心对象”(引力中心)来进行计算的。

应用