【AI知识】有监视学习分类使命之支持向量机

打印 上一主题 下一主题

主题 993|帖子 993|积分 2979

1.支持向量机概念
支持向量机(Support Vector Machine, SVM) 是一种有监视学习算法,重要用于分类使命(也可用于回归使命,即支持向量回归,SVR)。SVM的核心头脑是找到一个最优的超平面(hyperplane) 来将不同类别的数据分开,且最大化类别间边界(间隔),从而提高模子的泛化本领。
如,在二分类标题中,SVM的目标是找到一个最优的超平面(即决定边界),该平面能够将数据集中的正负类样本分开,下面都以二分类标题为例说明:
支持向量机的几个概念:


  • 超平面(Hyperplane) : 超平面将数据空间分割成两个部门。在二维空间中,超平面是一条直线;在三维空间中,超平面是一个平面;在高维空间中,超平面是一个维度比数据空间少1的超平面。对于一个二维空间中的分类标题,SVM的使命就是找到一个直线(超平面),将正负类样本分开。
  • 最大化间隔: SVM的关键头脑是最大化分隔正负类的间隔。间隔是指从数据点到超平面的垂直距离。在SVM中,支持向量是距离决定边界近来的那些点,这些点决定了超平面的最优位置。假设我们的数据点有两个类别,+1 和 -1 类,我们希望找到一个超平面,使得这个平面把两类数据完全分开,并且两类数据到超平面的距离最大。
细节我有点看不懂了。。。。
SVM实例+可视化:
  1. import numpy as np
  2. import matplotlib.pyplot as plt
  3. from sklearn import datasets
  4. from sklearn.svm import SVC
  5. from sklearn.model_selection import train_test_split
  6. from sklearn.preprocessing import StandardScaler
  7. # 创建线性可分数据集
  8. def generate_linear_data():
  9.     # 使用sklearn生成一个线性可分的数据集
  10.     X, y = datasets.make_classification(n_samples=200, n_features=2, n_informative=2,
  11.                                          n_redundant=0, n_clusters_per_class=1, class_sep=2)
  12.     return X, y
  13. # 创建非线性可分数据集
  14. def generate_nonlinear_data():
  15.     # 使用sklearn生成一个非线性可分的数据集
  16.     # 它生成的是一个包含两个类别的数据集,其中样本数据分布在两个同心圆形状的区域内
  17.     X, y = datasets.make_circles(n_samples=200, noise=0.1, factor=0.5)
  18.     return X, y
  19. # 绘制SVM的决策边界
  20. def plot_decision_boundary(X, y, clf):
  21.     h = 0.02  # 网格间距
  22.     x_min, x_max = X[:, 0].min() - 1, X[:, 0].max() + 1
  23.     y_min, y_max = X[:, 1].min() - 1, X[:, 1].max() + 1
  24.     xx, yy = np.meshgrid(np.arange(x_min, x_max, h), np.arange(y_min, y_max, h))
  25.     Z = clf.predict(np.c_[xx.ravel(), yy.ravel()])
  26.     Z = Z.reshape(xx.shape)
  27.     plt.contourf(xx, yy, Z, alpha=0.3)
  28.     plt.scatter(X[:, 0], X[:, 1], c=y, marker='o', edgecolors='k', s=50)
  29.     plt.title("SVM Decision Boundary")
  30.     plt.show()
  31. # 训练并可视化SVM模型
  32. def train_and_visualize(X, y, kernel_type='linear'):
  33.     # 切分数据集为训练集和测试集
  34.     X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3, random_state=42)
  35.     # 数据标准化
  36.     scaler = StandardScaler()
  37.     X_train = scaler.fit_transform(X_train)
  38.     X_test = scaler.transform(X_test)
  39.     # 初始化SVM分类器
  40.     clf = SVC(kernel=kernel_type)
  41.    
  42.     # 训练SVM
  43.     clf.fit(X_train, y_train)
  44.     # 打印支持向量信息
  45.     print(f"Number of support vectors: {len(clf.support_)}")
  46.     # 可视化决策边界
  47.     plot_decision_boundary(X_train, y_train, clf)
  48. # 主函数
  49. def main():
  50.     # 1. 线性可分数据
  51.     print("Training with linearly separable data...")
  52.     X_linear, y_linear = generate_linear_data()
  53.     train_and_visualize(X_linear, y_linear, kernel_type='linear')
  54.     # 2. 非线性可分数据
  55.     print("Training with non-linearly separable data...")
  56.     X_nonlinear, y_nonlinear = generate_nonlinear_data()
  57.     train_and_visualize(X_nonlinear, y_nonlinear, kernel_type='rbf')
  58. if __name__ == "__main__":
  59.     main()
复制代码



免责声明:如果侵犯了您的权益,请联系站长,我们会及时删除侵权内容,谢谢合作!更多信息从访问主页:qidao123.com:ToB企服之家,中国第一个企服评测及商务社交产业平台。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

x
回复

使用道具 举报

0 个回复

倒序浏览

快速回复

您需要登录后才可以回帖 登录 or 立即注册

本版积分规则

九天猎人

金牌会员
这个人很懒什么都没写!
快速回复 返回顶部 返回列表