数据科学考试复习精简版

基于PPT第1-8章 + 图片OCR | 保留全部考点信息 | 2026.06

# 数据科学 — 考试复习精简版

基于PPT第1-8章 + 图片OCR | 2026.06


1. 数据定义、数据科学含义、大数据新理念

数据与数据科学

  • 数据:未经加工的原始素材,是"新的石油"(世界经济论坛2011)
  • 数据科学:= 计算机科学(黑客技巧)+ 数学统计 + 领域知识(Drew Conway维恩图);黑客+领域知识(缺统计)是"危险地带"
  • 数据产品:把数据变成可交付的产品(如阿里云DataWorks、AI产品)
  • 大数据时代新理念

  • 第四范式(Jim Gray 2007):实验归纳→模型推演→仿真模拟→数据密集型科学发现
  • 第五范式 AI4S:AI驱动的科学研究
  • Peter Norvig 2009:简单模型 + 大量数据 > 复杂模型
  • 核心转变:样本=总体、关注关联而非因果、看大趋势不追求精确

  • 2. 预处理动机、统计规律、噪声处理

    预处理两大动机

  • 原始数据存在质量问题(缺失/噪声/不一致/不完整)
  • 数据不符合算法要求(类型、取值范围)
  • 第一数字定律(Benford's Law)

  • $P(d) = \log_{10}(1+\frac{1}{d})$,d=1..9;1出现~30.1%,9仅4.6%
  • 用途:数字舞弊识别、数据可信性测试
  • 条件:相似事物号码、非规律排序、无固有限值、未被人为修饰
  • ⚠️ 只能识别"可能有问题",需多方法交叉验证
  • 小概率原理

  • 概率≤0.05的事件在一次试验中几乎不可能发生
  • 用途:假设检验的理论基础(显著性检验)、异常值识别
  • 噪声处理四法

    方法核心操作
    **分箱**按个数/范围分箱→均值/中值/边界平滑
    **聚类**发现离群点作为噪声(层次法/划分法)
    **回归**用函数拟合数据来光滑
    领域知识处理错误数据/虚假数据(需实战经验)

    3. 数据质量、审计、鉴别、缺失处理、脱敏

    数据质量六大属性

    完整性、一致性、准确性、时效性、自描述性、安全性

    数据鉴别三法

    方法特点
    **MAC**(消息鉴别码)MAC=C(K,M),需加密,速度较慢
    **Hash函数**不需加密,速度快,广泛用于Streaming算法
    **数字签名**私钥加密公钥解密,不可否认、可验证

    数据审计

  • 预定义审计:利用源数据自带验证规则
  • 自定义审计:变量定义规则(取值范围/有效值列表)+ 函数定义规则
  • 可视化审计:图表发现难以用统计方法检测的问题
  • 缺失数据处理

    类型特征处理
    MCAR与所有变量不相关忽略/删除/插值
    MAR与其他观测变量相关需分析原因
    NMAR非以上两类模型选择法/模式混合法

    六种方法:忽略元组→人工填写→全局常量→属性均值→同类均值→最可能值(回归/贝叶斯/决策树)

    数据脱敏三大原则

    不可逆性、可用性、一致性(实现:替换-Hash映射/过滤)


    4. 探索性与验证性数据分析

    EDA(探索性)四大特征

    特征核心内容
    **耐抗性**对局部不良不敏感;用集中趋势/离散程度/分布状态描述
    **残差**实际值−拟合值;残差分析考察模型合理性
    **重新表达**变换函数T(xi)简化分析(对数/平方根变换等)
    **启示**发现新规律(需结合领域知识)

    CDA(验证性)核心方法

  • 参数估计:点估计(矩估计/最大似然/最小二乘)+ 区间估计(置信区间/置信水平)
  • 估计量三准则:无偏性(期望相等)、有效性(方差小)、一致性(极限趋近)
  • 假设检验:见第9题

  • 5. 表数据概念与存储

  • = 行(索引)× 列(名称)的二维集合,本质是row-based存储
  • CSV:最通用的纯文本数据交换格式
  • Row-based → 适合OLTP;Column-based(key-value)→ 适合OLAP、稀疏数据友好
  • 演变:结构化(schema-first)→ 半结构化(XML/HTML/JSON)→ 非结构化(图片/视频)

  • 6. ETL与基于实例学习

    ETL

    Extract(抽取)→ Transform(转换清洗集成)→ Load(加载到目标)

    规模ETL工具
    商务Excel + 手动复制粘贴
    程序员wget, curl, BeautifulSoup, lxml
    大企业Informatica, DataStage, Talend
    互联网Flume, Sqoop, Pig, Crunch, Oozie → Hadoop/Spark

    为何需要:数据源异构、数据质量差、集成需求、网络性能约束

    基于实例学习(Lazy Learning)

  • 思路:存储样本→新查询时分析关系→赋予目标函数值
  • 三种方法:k-近邻(欧氏距离投票)、局部加权回归(高斯核)、基于案例推理(符号逻辑)
  • 优点:灵活;缺点:分类时计算开销大

  • 7-8. 数据V特征与格式对比

    3V → 更多V

    Volume(TB→PB→ZB)、Velocity(实时流式)、Variety(结构多样)+ Veracity、Value、Variability

    三种数据结构

    结构化半结构化非结构化
    关系**先结构后数据****先数据后结构**无结构
    代表RDBMS表XML/HTML/JSON图片/视频/文档
    特点Schema严格/SQL自描述灵活体积大/难分析

    XML vs HTML vs JSON

    XMLHTMLJSON
    目的**传输数据****显示数据****数据交换**
    简洁冗长(闭合标签)标签固定简洁(键值对)
    数据类型仅文本仅文本String/Num/Boolean/Array/Object
    解析需DOM读取节点浏览器渲染直接赋值变量
    存储占空间大占空间大MongoDB等采用

    9. 概率分布、离散程度、假设检验

    离散型分布

    分布特征
    二项n次伯努利试验,n大p小时≈泊松
    泊松单位时间随机事件次数,$E=Var=\lambda$,$\lambda=np$时≈二项

    连续型分布

    分布核心特征
    **正态** $N(\mu,\sigma^2)$μ定位置,σ²定宽度;标准正态$\mu=0,\sigma^2=1$;$Z=\frac{X-\mu}{\sigma}$转化
    **$\chi^2$**n个标准正态平方和;$E=n,Var=2n$;n大→正态;刻画样本方差
    **t分布**σ未知时用S代替;尾部比正态宽;n≥30→接近正态
    **F分布**两个卡方比率;用于方差分析/回归显著性检验

    假设检验五步

  • 提出 $H_0$ / $H_1$
  • 选统计量(大样本Z / 小样本t / 分类$\chi^2$)
  • 定显著性水平α(0.01/0.05/0.10)
  • 计算统计量,与临界值比较
  • 决策:落在拒绝域→拒绝$H_0$
  • 两类错误:弃真(α)↔ 取伪(β),矛盾,优先控α。双侧怕大怕小、左侧怕小不怕大、右侧怕大不怕小。


    10. 统计量与数据结构模式

    重要统计量

    类别统计量说明
    集中趋势均值/中位数/众数中位数稳健(耐抗)
    离散程度**标准差**/方差/极差/IQR/CV$S=\sqrt{\frac{\sum(x_i-\bar{x})^2}{n-1}}$
    分布形状偏度/峰度不对称性和陡峭程度
    标准化**z-score**$z=\frac{x-\mu}{\sigma}$(距离均值几个标准差)

    结构模式谱

    
    结构化(schema-first) → 半结构化(self-describing) → 非结构化(no schema)
    RDBMS                  XML/HTML/JSON              图片/视频
    

    11. NoSQL四大类型

    兴起原因

    RDBMS三大局限:不要求严格事务、不要求读写实时性、不需要复杂SQL → 去结构化,用空间换性能

    RDBMS vs NoSQL

    维度RDBMSNoSQL
    理论基础关系代数无统一理论
    数据规模**超大**(横向扩展)
    模式**固定****灵活**
    一致性**强一致ACID**弱一致BASE(最终一致)
    扩展性**好**
    标准化SQL标准无标准
    场景银行/电信关键业务互联网/数据分析

    四大类型速查

    类型代表产品数据模型典型场景
    **键值**Redis, MemcachedKey→任意Value缓存、会话
    **列族**HBase, Cassandra, BigTable稀疏多维映射(row,column,time)→string分布式存储、几百TB
    **文档**MongoDB, CouchDB自包含JSON文档半结构化数据、高并发
    **图形**Neo4J节点+边社交网络、推荐引擎

    12. DIKW模型

    
    智慧(灵魂)→ Why?   — 预测未来、最优判断
      ↑
    知识(核心)→ How?   — 理解规律、指导决策
      ↑
    信息(支撑)→ Who/What/Where/When?  — 处理组织后的数据
      ↑
    数据(基础)           — 原始事实和数字
    

    案例:奥巴马竞选 = DIKUW贯穿 → 模型预测6.6万次模拟/天 → 以数据驱动决策连任


    13. 人工神经网络

    组成

    输入层 → 隐含层(N层)→ 输出层,每层由人工神经元(感知器/Sigmoid单元等)组成

    感知器

    $$o = \begin{cases} 1 & w_0 + \sum w_i x_i > 0 \\ -1 & \text{otherwise} \end{cases}$$

    学习任务:确定权重$w_i$

    激发函数四种

    阈值型(阶跃/感知器)→ 分段线性型 → Sigmoid型(S型,饱和)→ 双曲正切型

    连接方式

  • 前向网络:输入→隐层→输出单向,用于BP算法
  • 反馈网络:相互连接,信号往返至稳定或振荡
  • 学习算法

    算法适用优点缺点
    **梯度下降**单神经元理论基础好局部极小
    **BP算法**多层网络处理非线性、深度学习基础**计算量超大**、收敛慢、局部极小

    适用场景

    属性-值对输入、输出可为向量、容忍数据错误、可长时间训练、求值快但不需要理解为什么


    14. 爬虫、BP算法问题、k-Means与质心

    网络爬虫

  • 三阶段:载入(GET/POST→HTML/JSON)→ 解析 → 存储
  • 动态加载处理:抓包分析(快但难)+ Selenium模拟浏览器(简单但慢)
  • 反爬:验证码、封IP/账号、返回假数据
  • 应对:减频率、多Cookie、多代理IP
  • BP算法三大问题

  • 计算量超大(Google上千层需上千台机器)
  • 收敛速度慢
  • 局部极小(梯度最速下降法的固有问题)
  • k-Means聚类

  • 随机选K个初始中心
  • 按最小距离分配→计算新均值→重新分配
  • 迭代至不再变化
  • 初始质心确定两法

  • 选批次距离最远的K个点(逐一选离已选点最远的)
  • Canopy粗聚类→得K值→K-Means细聚类(Canopy不需预设K)
  • 距离:欧氏/明可夫斯基(λ=2→欧氏, λ=1→曼哈顿)/切比雪夫(λ→∞)


    15. 决策树与强化学习

    决策树

  • 根节点→中间节点(属性测试)→边(属性值)→叶节点(类别)
  • 路径上属性间 "逻辑与"
  • ID3核心:信息熵下降最快 = 最好属性
  • 前提:属性-值实例、离散输出值、容忍错误和缺失
  • ID3→C4.5改进:信息增益率替代增益、剪枝、连续属性离散化
  • 强化学习

  • 三要素:状态S × 动作A × 回报r
  • MDP:$r_t=r(s_t,a_t)$,$s_{t+1}=\delta(s_t,a_t)$,只依赖当前(不依赖历史)
  • 目标:学策略$\pi:S\to A$最大化累积回报期望
  • Q-learning核心公式
  • $$Q(s,a) = R(s,a) + \gamma \cdot \max_{a'} Q(s', a')$$

    $\gamma \to 0$重立即回报,$\gamma \to 1$重未来回报


    16-17. 学习系统定义、基本活动、控制活动

    学习系统定义(Mitchell 1997)

    系统在任务T上的性能P随经验E改进 → 该系统在从E中学习

    四项基本活动

  • 训练经验选择 → 三个问题(下详)
  • 目标函数选择 → 把改进P转化为学习目标函数,无法求精确T则用函数逼近得近似V
  • 目标函数表示 → 选表达方式(线性/多项式/ANN),确定参数
  • 函数逼近算法 → 估计训练值 + 调整权值(最小化误差平方和)
  • 训练经验选择的三个关键问题

    问题选项
    直接/间接反馈直接=明确对错;间接=只有结果需**信用分配**自分析
    控制程度不控(施教者主导)→部分控(困难时提问)→完全控(自我对弈进化)
    分布相似性训练集与实际数据分布**越相似结果越可靠**

    四核心模块

    执行器(用V解决问题)→ 评价器(评估性能反馈)→ 泛化器(产生输出假设)→ 实验生成器(生成新问题探索)


    18. 推荐系统

    定义与模块

    分析用户历史→了解喜好→主动推荐;三模块:用户建模 + 推荐对象建模 + 推荐算法

    人口统计学推荐

    基于年龄/性别等Profile计算相似度→缺点:太粗糙、涉敏感信息

    UserCF vs ItemCF(核心考点)

    维度UserCFItemCF
    思路找相似用户→推荐他们的喜好找相似物品→推荐给喜欢过原物品的用户
    相似度公式$W_{uv}=\frac{\N(u)\cap N(v)\}{\sqrt{\N(u)\\cdot\N(v)\}}$$W_{ij}=\frac{\N(i)\cap N(j)\}{\N(i)\}$
    改进冷门物品权重更高(更体现兴趣)喜欢i的人中多少也喜欢j
    场景新闻(物品更新快)电商/电影(**工业界主流**)
    可解释性**强**
    复杂度与用户数²成正比与物品数²成正比

    评价方法

  • 用户满意度(最重要,购买率/点击率/停留时间/转化率)
  • 覆盖率:$H=-\sum p(i)\log p(i)$(熵越大→长尾发掘越好)

  • 20. MapReduce

    核心定义

    分布式计算模型,输入输出均为 ,分MapReduce两阶段

    函数签名map(K1,V1)→list(K2,V2)reduce(K2,list(V2))→list(K3,V3)

    关键技术

  • 主从结构 Master-Slave
  • Shuffle:Map输出按key排序分组送Reduce
  • Combiner:Map端合并降低传输量
  • 容错:Worker→ping检测+任务转移;Master→checkpoint恢复
  • 推测执行:慢节点任务在空闲节点并行执行副本
  • 应用案例

  • NCDC最高气温:Map提取(年份,气温)→Reduce找每年最大值
  • Word Count:Map拆词→Reduce求和
  • Yahoo:搜索引擎四组件全部基于Hadoop
  • MRv2 → YARN

    JobTracker拆为ResourceManager(资源管理)+ ApplicationMaster(作业控制),支持多种计算框架


    21-22. 预测与kNN/k-Means应用

    Google流感预测(GFT)

    $$\text{logit}(P) = \beta_0 + \beta_1 \cdot \text{logit}(Q) + \varepsilon$$

  • P=ILI就诊百分比,Q=相关搜索/总搜索
  • 比CDC提前2周预测流感爆发
  • 教训(2013年高估2倍):大数据浮夸 + 算法动态性/用户行为变化
  • kNN(分类+预测)

  • 一句话:K个最近邻居投票决定
  • 电影分类案例:计算欧氏距离→找K近邻→多数标签胜出
  • 数值预测:K近邻Y值取平均
  • K值影响大:K=3 vs K=5 结果可能不同
  • k-Means应用

  • 亚洲15支足球队战绩→K=3聚类→一流(日韩伊沙)/二流/三流(中国)
  • 关键:将现实属性抽象为向量即可聚类
  • kNN vs k-Means

    kNNk-Means
    类型监督学习(分类)无监督学习(聚类)
    原理近邻投票距离分簇

    23. Q-learning应用

    Path Finder案例

  • 6个房间(0-5),5号=目标,reward=100
  • 初始化Q=0矩阵,反复episode训练
  • $\gamma=0.8$,$Q(s,a) = R + \gamma \cdot \max Q(s',all)$
  • 训练完毕后规范化Q矩阵→可找任意状态到目标的最优路径
  • AlphaGo中的强化学习

  • AlphaGo 2.0:放弃监督学习(不用人类棋谱)、放弃蒙特卡洛暴力搜索、强化学习为主力
  • 两台机器从随机走棋开始自我对弈→一周后超越人类
  • 三个阶段:2005前规则法→2006-15蒙特卡洛→2015后蒙特卡洛+深度学习+强化学习

  • 24. Apriori算法与优化

    核心概念

  • 支持度:$sup(X\to Y) = |X\cup Y|/N$(同时出现频率)
  • 置信度:$conf(X\to Y) = |X\cup Y|/|X|$(X前提下Y的概率)
  • 强规则:同时满足min_sup和min_conf
  • 频繁项集:满足min_sup的k项集
  • Apriori两大定律(剪枝核心)

  • 频繁项集的所有子集必频繁
  • 非频繁项集的所有超集必不频繁
  • → 大量剪枝,避免穷举所有候选组合

    优化思路

    策略方法
    精度换速度容忍误差、采样数据
    大数据化小分块处理
    **FP-Growth****只需2次扫描**,构造FP-tree,共用前缀压缩数据

    FP-Growth三步

  • 第一次扫描→频繁1项集,按支持度降序排列
  • 第二次扫描→过滤非频繁项,插入FP-tree(共用前缀)
  • 分而自治:对每个频繁项构造条件模式基CPB→条件FP-tree→递归挖掘
  • 降序原因:频繁项在树上层 → 更多共用前缀 → 更紧凑


    附录:其他重要考点速记

    数据变换五种

    平滑→特征构造→聚集→标准化(0-1/z-score/log)→数据泛化

    回归分析

  • 一元线性:$y=\beta_0+\beta_1 x+\varepsilon$,最小二乘法估计
  • 判定系数:$R^2=SSR/SST \in [0,1]$,越近1拟合越好
  • 显著性检验:F检验,$H_0:\beta_1=0$
  • 贝叶斯学习

  • 贝叶斯法则:$P(h|D)=\frac{P(D|h)\cdot P(h)}{P(D)}$
  • MAP(极大后验假设)、ML(极大似然假设,先验相同)
  • 朴素贝叶斯:假设属性条件独立 → $v_{NB}=\arg\max P(v_j)\prod P(a_i|v_j)$
  • 简单快速,稀疏数据好,但不能建模模式
  • 时间序列四要素

    趋势 + 季节变动 + 循环波动 + 不规则波动

    数据准备模型

    特征化 → 清洗 → 集成 → 转化 → 序列化/反序列化(空间省+时间快

    Redis vs Memcached

    Redis="强化版Memcached",支持持久化、数据恢复、更多数据类型

    Spark vs Hadoop

    Spark用1/10资源获3倍速度;核心优势:内存计算、DAG执行引擎、RDD

    大数据的两大应对思路

  • 大数据分解为小规模
  • 用精度换速度

  • 报告完 · 保留所有考点核心信息