《数据挖掘方法与模型》读书笔记

书籍信息

  • 作者: Daniel T. Larose
  • 出版: John Wiley & Sons, 2006
  • 页数: 340页
  • 类型: mixed(文本+图表)

核心内容概述

本书是数据挖掘领域的经典教材,采用”白盒”方法(white-box approach),强调理解算法和统计模型背后的结构,而非盲目使用黑盒软件。

主要内容框架

第一章:降维方法

  • 主成分分析(PCA)
  • 因子分析
  • 用户自定义组合变量
  • 公因子方差与共同度

第二章:回归建模

  • 简单线性回归
  • 最小二乘估计
  • 决定系数R²
  • 回归假设验证
  • Box-Cox变换

第三章:多元回归与模型构建

  • 多元回归模型推断
  • 分类预测变量的处理
  • 多重共线性问题
  • 变量选择方法(逐步回归、向前选择、向后消去)
  • Mallows’ Cp统计量

第四章:逻辑回归

  • 简单逻辑回归
  • 最大似然估计
  • 多项逻辑回归
  • 模型验证

第五章:朴素贝叶斯估计与贝叶斯网络

  • 贝叶斯方法
  • 最大后验概率分类
  • 朴素贝叶斯分类
  • 贝叶斯信念网络

第六章:遗传算法

  • 遗传算法基本框架
  • 选择、交叉、变异算子
  • 实值变量的遗传算法
  • 用遗传算法训练神经网络

第七章:案例研究——直邮营销响应建模

  • CRISP-DM框架应用
  • 数据理解与准备
  • 模型构建与评估
  • 模型组合策略

关键技术概念

1. CRISP-DM标准流程

跨行业数据挖掘标准流程,包含六个阶段:

  1. 商业理解
  2. 数据理解
  3. 数据准备
  4. 建模
  5. 评估
  6. 部署

2. 主成分分析(PCA)

  • 通过正交变换将相关变量转换为不相关的主成分
  • 解决多重共线性问题
  • 通过特征值准则确定提取的组件数量

3. 逻辑回归

  • 用于二分类问题的回归分析
  • 通过logit变换建模概率
  • 使用最大似然估计参数

4. 贝叶斯方法

  • 结合先验知识与样本信息
  • 朴素贝叶斯假设条件独立
  • 贝叶斯网络表示变量间的依赖关系

5. 遗传算法

  • 模拟自然选择的优化算法
  • 主要算子:选择、交叉、变异
  • 可用于神经网络训练

实践要点

  1. 数据预处理重要性

    • 标准化与归一化
    • 处理缺失值
    • 变量变换达到正态性
  2. 模型评估方法

    • 使用成本效益表而非单纯错误率
    • 验证集划分
    • 交叉验证
  3. 模型组合策略

    • 投票法
    • 平均响应概率
    • 连续组合法

与其他知识的关联

机器学习基础 - 回归分析方法 统计学原理 - 假设检验与置信区间 数据处理 - 数据清洗与预处理 算法导论 - 优化算法比较