转载

用 Python 实现 K-近邻算法

写在前面

最近开始学习机器学习嘛，网上找到一本关于机器学习的书籍，名字叫做《机器学习实战》。很巧的是，这本书里的算法是用Python语言实现的，刚好之前我学过一些Python基础知识，所以这本书对于我来说，无疑是雪中送炭啊。接下来，我还是给大家讲讲实际的东西吧。

什么是K-近邻算法？

简单的说，K-近邻算法就是采用测量不同特征值之间的距离方法来进行分类。它的工作原理是：存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每一数据与所属分类的对应关系，输入没有标签的新数据之后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取出样本集中特征最相似数据的分类标签。一般来说，我们只选择样本数据集中前k个最相似的数据，这就是K-近邻算法名称的由来。

提问：亲，你造K-近邻算法是属于监督学习还是无监督学习呢？

使用Python导入数据

从K-近邻算法的工作原理中我们可以看出，要想实施这个算法来进行数据分类，我们手头上得需要样本数据，没有样本数据怎么建立分类函数呢。所以，我们第一步就是导入样本数据集合。

建立名为kNN.py的模块，写入代码：

from numpy import * import operator  def createDataSet():     group = array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]])     labels = ['A','A','B','B']     return group, labels

代码中，我们需要导入Python的两个模块：科学计算包NumPy和运算符模块。NumPy函数库是Python开发环境的一个独立模块，大多数Python版本里没有默认安装NumPy函数库，因此这里我们需要单独安装这个模块。

下载戳这里：NumPy（http://sourceforge.net/projects/numpy/files/）

用 Python 实现 K-近邻算法

有很多的版本，这里我选择的是numpy-1.7.0-win32-superpack-python2.7.exe。

实现K-近邻算法

K-近邻算法的具体思想如下：

（1）计算已知类别数据集中的点与当前点之间的距离

（2）按照距离递增次序排序

（3）选取与当前点距离最小的k个点

（4）确定前k个点所在类别的出现频率

（5）返回前k个点中出现频率最高的类别作为当前点的预测分类

Python语言实现K-近邻算法的代码如下：

# coding : utf-8  from numpy import * import operator  import kNN  group, labels = kNN.createDataSet()  def classify(inX, dataSet, labels, k):     dataSetSize = dataSet.shape[0]       diffMat = tile(inX, (dataSetSize,1)) - dataSet     sqDiffMat = diffMat**2     sqDistances = sqDiffMat.sum(axis=1)     distances = sqDistances**0.5     sortedDistances = distances.argsort()     classCount = {}     for i in range(k):         numOflabel = labels[sortedDistances[i]]         classCount[numOflabel] = classCount.get(numOflabel,0) + 1     sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1),reverse=True)     return sortedClassCount[0][0]  my = classify([0,0], group, labels, 3) print my

运算结果如下：

用 Python 实现 K-近邻算法