Data Mining: Concepts and Techniques

核心信息

  • 作者:Jiawei Han (UIUC), Micheline Kamber
  • 出版社:Morgan Kaufmann (Elsevier),2006
  • 页数:772页
  • 版本:第二版
  • 主题:数据挖掘基础理论与技术

目录结构

Part I: 基础概念

Chapter 1: Introduction

  • 数据 mining 的动机与重要性
  • 数据 mining 的定义
  • 可挖掘的数据类型:关系数据库、数据仓库、事务数据库、高级系统
  • 数据 mining 功能:概念描述、频繁模式挖掘、分类预测、聚类分析、异常检测、演化分析

Chapter 2: Data Preprocessing

  • 数据概括:集中趋势、离散程度、图形显示
  • 数据清洗:缺失值处理、噪声数据
  • 数据集成与变换
  • 数据约简:数据立方体聚合、属性子集选择、维度约简
  • 数据离散化与概念层次生成

Chapter 3: Data Warehouse and OLAP Technology

  • 数据仓库的定义与特点
  • 多维数据模型:星型、雪花型、星座型模式
  • 数据仓库架构:三层架构
  • OLAP操作:切片、切块、旋转、钻取
  • 从数据仓库到数据 mining

Part II: 核心技术

Chapter 4: Data Cube Computation and Data Generalization

  • 高效数据立方体计算方法:
    • Multiway Array Aggregation
    • BUC算法(Iceberg Cubes)
    • Star-cubing
  • 属性导向归纳(Attribute-Oriented Induction)
  • 类比较挖掘

Chapter 5: Mining Frequent Patterns, Associations, and Correlations

  • 基本概念:频繁项集、闭项集、关联规则
  • Apriori算法:候选生成方法
  • 无候选生成的频繁项集挖掘
  • 垂直数据格式挖掘
  • 闭频繁项集挖掘
  • 多级关联规则
  • 约束关联规则挖掘
  • 从关联分析到相关分析

Chapter 6: Classification and Prediction

  • 决策树归纳:
    • 属性选择度量(信息增益、增益率、Gini指数)
    • 树剪枝
    • 可扩展性
  • 贝叶斯分类:
    • 朴素贝叶斯
    • 贝叶斯信念网络
  • 规则分类
  • 反向传播神经网络
  • 支持向量机(SVM)
  • 关联分类
  • 惰性学习器(k-NN)
  • 其他方法:遗传算法、粗糙集、模糊集
  • 预测方法:线性回归、非线性回归
  • 准确率评估:交叉验证、Bootstrap、ROC曲线
  • 集成方法:Bagging、Boosting

Chapter 7: Cluster Analysis

  • 聚类方法分类:
    • 划分方法:k-Means、k-Medoids、CLARANS
    • 层次方法:BIRCH、ROCK、Chameleon
    • 基于密度的方法:DBSCAN、OPTICS、DENCLUE
    • 基于网格的方法:STING、WaveCluster
    • 基于模型的方法:EM算法、概念聚类
  • 高维数据聚类:CLIQUE、PROCLUS

Chapter 8: Mining Stream, Time-Series, and Sequence Data

  • 流数据 mining
  • 时间序列数据分析
  • 序列模式挖掘

Chapter 9: Graph Mining, Social Network Analysis, and Multirelational Data Mining

  • 图结构挖掘
  • 社交网络分析
  • 多关系数据 mining

Chapter 10: Mining Object, Spatial, Multimedia, Text, and Web Data

  • 对象数据 mining
  • 空间数据挖掘
  • 多媒体数据 mining
  • 文本数据 mining
  • Web数据挖掘

Chapter 11: Applications and Trends in Data Mining

  • 数据挖掘应用案例
  • 发展趋势

核心知识点

1. Apriori算法原理

  • 利用频繁项集的子集也是频繁项集的性质
  • 通过候选生成和剪枝减少搜索空间
  • 时间复杂度:O(2

2. 决策树选择度量

  • 信息增益(Information Gain):ID3算法
  • 增益率(Gain Ratio):C4.5算法
  • Gini指数:CART算法

3. k-Means聚类

  • 需要指定聚类数k
  • 对初始中心敏感
  • 适合球形聚类

4. DBSCAN密度聚类

  • 基于密度的定义
  • 能发现任意形状的聚类
  • 对噪声鲁棒

与其他知识的关联

推荐理由

  • 数据挖掘领域的经典教材
  • 理论扎实,案例丰富
  • 适合数据 mining 初学者系统学习
  • 第二版增加了图 mining、流数据等新兴主题