《数据挖掘方法与模型》读书笔记
书籍信息
- 作者: Daniel T. Larose
- 出版: John Wiley & Sons, 2006
- 页数: 340页
- 类型: mixed(文本+图表)
核心内容概述
本书是数据挖掘领域的经典教材,采用”白盒”方法(white-box approach),强调理解算法和统计模型背后的结构,而非盲目使用黑盒软件。
主要内容框架
第一章:降维方法
- 主成分分析(PCA)
- 因子分析
- 用户自定义组合变量
- 公因子方差与共同度
第二章:回归建模
- 简单线性回归
- 最小二乘估计
- 决定系数R²
- 回归假设验证
- Box-Cox变换
第三章:多元回归与模型构建
- 多元回归模型推断
- 分类预测变量的处理
- 多重共线性问题
- 变量选择方法(逐步回归、向前选择、向后消去)
- Mallows’ Cp统计量
第四章:逻辑回归
- 简单逻辑回归
- 最大似然估计
- 多项逻辑回归
- 模型验证
第五章:朴素贝叶斯估计与贝叶斯网络
- 贝叶斯方法
- 最大后验概率分类
- 朴素贝叶斯分类
- 贝叶斯信念网络
第六章:遗传算法
- 遗传算法基本框架
- 选择、交叉、变异算子
- 实值变量的遗传算法
- 用遗传算法训练神经网络
第七章:案例研究——直邮营销响应建模
- CRISP-DM框架应用
- 数据理解与准备
- 模型构建与评估
- 模型组合策略
关键技术概念
1. CRISP-DM标准流程
跨行业数据挖掘标准流程,包含六个阶段:
- 商业理解
- 数据理解
- 数据准备
- 建模
- 评估
- 部署
2. 主成分分析(PCA)
- 通过正交变换将相关变量转换为不相关的主成分
- 解决多重共线性问题
- 通过特征值准则确定提取的组件数量
3. 逻辑回归
- 用于二分类问题的回归分析
- 通过logit变换建模概率
- 使用最大似然估计参数
4. 贝叶斯方法
- 结合先验知识与样本信息
- 朴素贝叶斯假设条件独立
- 贝叶斯网络表示变量间的依赖关系
5. 遗传算法
- 模拟自然选择的优化算法
- 主要算子:选择、交叉、变异
- 可用于神经网络训练
实践要点
-
数据预处理重要性
- 标准化与归一化
- 处理缺失值
- 变量变换达到正态性
-
模型评估方法
- 使用成本效益表而非单纯错误率
- 验证集划分
- 交叉验证
-
模型组合策略
- 投票法
- 平均响应概率
- 连续组合法
与其他知识的关联
机器学习基础 - 回归分析方法 统计学原理 - 假设检验与置信区间 数据处理 - 数据清洗与预处理 算法导论 - 优化算法比较