SVM全称支持向量机,是一种经典的监督学习算法,主要用来解决分类和回归问题。它的核心思路是在特征空间中找到一个超平面,把不同类别的样本分开,并且让这个超平面离两边最近的数据点距离最大,这些最近的点就叫做支持向量。如果数据本身线性不可分,SVM会通过核函数把数据映射到更高维的空间,从而变得可分。

SVM的主要概念
理解下面几个词,就能看懂SVM的大部分内容:
- 超平面:在二维里是一条线,三维里是一个面,更高维里就是分隔边界。
- 支持向量:离分隔面最近的样本点,决定了超平面的位置。
- 核函数:常用的有线性、多项式、高斯径向基(RBF)等,用来处理非线性问题。
用Python训练一个SVM分类器
在Python中,我们一般使用scikit-learn来完成SVM建模。下面以鸢尾花数据集为例,展示完整的训练与预测流程。
# 导入所需库
from sklearn import datasets
from sklearn.model_selection import train_test_split
from sklearn.svm import SVC
from sklearn.metrics import accuracy_score
# 加载鸢尾花数据
iris = datasets.load_iris()
X = iris.data
y = iris.target
# 划分训练集和测试集
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
# 创建SVM分类器,使用径向基核
model = SVC(kernel='rbf', C=1.0, gamma='scale')
# 训练模型
model.fit(X_train, y_train)
# 在测试集上预测
y_pred = model.predict(X_test)
# 输出准确率
print('准确率:', accuracy_score(y_test, y_pred))
参数简单说明
在SVC中,几个常用参数含义如下:
| 参数 | 作用 |
|---|---|
| kernel | 选择核函数类型,如linear、rbf、poly |
| C | 惩罚系数,越大越不允许分类出错 |
| gamma | 核函数的影响范围,值越小覆盖越广 |
使用建议
如果你的特征数量很大,可以先做标准化处理,再用线性核试试。数据量不大且关系复杂时,RBF核往往表现更好。SVM对特征缩放敏感,实际项目中建议配合StandardScaler一起使用。