# 数据科学 — 考试复习精简版
基于PPT第1-8章 + 图片OCR | 2026.06
| 方法 | 核心操作 |
|---|---|
| **分箱** | 按个数/范围分箱→均值/中值/边界平滑 |
| **聚类** | 发现离群点作为噪声(层次法/划分法) |
| **回归** | 用函数拟合数据来光滑 |
| 领域知识 | 处理错误数据/虚假数据(需实战经验) |
完整性、一致性、准确性、时效性、自描述性、安全性
| 方法 | 特点 |
|---|---|
| **MAC**(消息鉴别码) | MAC=C(K,M),需加密,速度较慢 |
| **Hash函数** | 不需加密,速度快,广泛用于Streaming算法 |
| **数字签名** | 私钥加密公钥解密,不可否认、可验证 |
| 类型 | 特征 | 处理 |
|---|---|---|
| MCAR | 与所有变量不相关 | 忽略/删除/插值 |
| MAR | 与其他观测变量相关 | 需分析原因 |
| NMAR | 非以上两类 | 模型选择法/模式混合法 |
六种方法:忽略元组→人工填写→全局常量→属性均值→同类均值→最可能值(回归/贝叶斯/决策树)
不可逆性、可用性、一致性(实现:替换-Hash映射/过滤)
| 特征 | 核心内容 |
|---|---|
| **耐抗性** | 对局部不良不敏感;用集中趋势/离散程度/分布状态描述 |
| **残差** | 实际值−拟合值;残差分析考察模型合理性 |
| **重新表达** | 变换函数T(xi)简化分析(对数/平方根变换等) |
| **启示** | 发现新规律(需结合领域知识) |
Extract(抽取)→ Transform(转换清洗集成)→ Load(加载到目标)
| 规模 | ETL工具 |
|---|---|
| 商务 | Excel + 手动复制粘贴 |
| 程序员 | wget, curl, BeautifulSoup, lxml |
| 大企业 | Informatica, DataStage, Talend |
| 互联网 | Flume, Sqoop, Pig, Crunch, Oozie → Hadoop/Spark |
为何需要:数据源异构、数据质量差、集成需求、网络性能约束
Volume(TB→PB→ZB)、Velocity(实时流式)、Variety(结构多样)+ Veracity、Value、Variability
| 结构化 | 半结构化 | 非结构化 | |
|---|---|---|---|
| 关系 | **先结构后数据** | **先数据后结构** | 无结构 |
| 代表 | RDBMS表 | XML/HTML/JSON | 图片/视频/文档 |
| 特点 | Schema严格/SQL | 自描述灵活 | 体积大/难分析 |
| XML | HTML | JSON | |
|---|---|---|---|
| 目的 | **传输数据** | **显示数据** | **数据交换** |
| 简洁 | 冗长(闭合标签) | 标签固定 | 简洁(键值对) |
| 数据类型 | 仅文本 | 仅文本 | String/Num/Boolean/Array/Object |
| 解析 | 需DOM读取节点 | 浏览器渲染 | 直接赋值变量 |
| 存储 | 占空间大 | 占空间大 | MongoDB等采用 |
| 分布 | 特征 |
|---|---|
| 二项 | n次伯努利试验,n大p小时≈泊松 |
| 泊松 | 单位时间随机事件次数,$E=Var=\lambda$,$\lambda=np$时≈二项 |
| 分布 | 核心特征 |
|---|---|
| **正态** $N(\mu,\sigma^2)$ | μ定位置,σ²定宽度;标准正态$\mu=0,\sigma^2=1$;$Z=\frac{X-\mu}{\sigma}$转化 |
| **$\chi^2$** | n个标准正态平方和;$E=n,Var=2n$;n大→正态;刻画样本方差 |
| **t分布** | σ未知时用S代替;尾部比正态宽;n≥30→接近正态 |
| **F分布** | 两个卡方比率;用于方差分析/回归显著性检验 |
两类错误:弃真(α)↔ 取伪(β),矛盾,优先控α。双侧怕大怕小、左侧怕小不怕大、右侧怕大不怕小。
| 类别 | 统计量 | 说明 |
|---|---|---|
| 集中趋势 | 均值/中位数/众数 | 中位数稳健(耐抗) |
| 离散程度 | **标准差**/方差/极差/IQR/CV | $S=\sqrt{\frac{\sum(x_i-\bar{x})^2}{n-1}}$ |
| 分布形状 | 偏度/峰度 | 不对称性和陡峭程度 |
| 标准化 | **z-score** | $z=\frac{x-\mu}{\sigma}$(距离均值几个标准差) |
结构化(schema-first) → 半结构化(self-describing) → 非结构化(no schema)
RDBMS XML/HTML/JSON 图片/视频
RDBMS三大局限:不要求严格事务、不要求读写实时性、不需要复杂SQL → 去结构化,用空间换性能
| 维度 | RDBMS | NoSQL |
|---|---|---|
| 理论基础 | 关系代数 | 无统一理论 |
| 数据规模 | 大 | **超大**(横向扩展) |
| 模式 | **固定** | **灵活** |
| 一致性 | **强一致ACID** | 弱一致BASE(最终一致) |
| 扩展性 | 差 | **好** |
| 标准化 | SQL标准 | 无标准 |
| 场景 | 银行/电信关键业务 | 互联网/数据分析 |
| 类型 | 代表产品 | 数据模型 | 典型场景 |
|---|---|---|---|
| **键值** | Redis, Memcached | Key→任意Value | 缓存、会话 |
| **列族** | HBase, Cassandra, BigTable | 稀疏多维映射(row,column,time)→string | 分布式存储、几百TB |
| **文档** | MongoDB, CouchDB | 自包含JSON文档 | 半结构化数据、高并发 |
| **图形** | Neo4J | 节点+边 | 社交网络、推荐引擎 |
智慧(灵魂)→ Why? — 预测未来、最优判断
↑
知识(核心)→ How? — 理解规律、指导决策
↑
信息(支撑)→ Who/What/Where/When? — 处理组织后的数据
↑
数据(基础) — 原始事实和数字
案例:奥巴马竞选 = DIKUW贯穿 → 模型预测6.6万次模拟/天 → 以数据驱动决策连任
输入层 → 隐含层(N层)→ 输出层,每层由人工神经元(感知器/Sigmoid单元等)组成
$$o = \begin{cases} 1 & w_0 + \sum w_i x_i > 0 \\ -1 & \text{otherwise} \end{cases}$$
学习任务:确定权重$w_i$
阈值型(阶跃/感知器)→ 分段线性型 → Sigmoid型(S型,饱和)→ 双曲正切型
| 算法 | 适用 | 优点 | 缺点 |
|---|---|---|---|
| **梯度下降** | 单神经元 | 理论基础好 | 局部极小 |
| **BP算法** | 多层网络 | 处理非线性、深度学习基础 | **计算量超大**、收敛慢、局部极小 |
属性-值对输入、输出可为向量、容忍数据错误、可长时间训练、求值快但不需要理解为什么
初始质心确定两法:
距离:欧氏/明可夫斯基(λ=2→欧氏, λ=1→曼哈顿)/切比雪夫(λ→∞)
$$Q(s,a) = R(s,a) + \gamma \cdot \max_{a'} Q(s', a')$$
$\gamma \to 0$重立即回报,$\gamma \to 1$重未来回报
系统在任务T上的性能P随经验E改进 → 该系统在从E中学习
| 问题 | 选项 |
|---|---|
| 直接/间接反馈 | 直接=明确对错;间接=只有结果需**信用分配**自分析 |
| 控制程度 | 不控(施教者主导)→部分控(困难时提问)→完全控(自我对弈进化) |
| 分布相似性 | 训练集与实际数据分布**越相似结果越可靠** |
执行器(用V解决问题)→ 评价器(评估性能反馈)→ 泛化器(产生输出假设)→ 实验生成器(生成新问题探索)
分析用户历史→了解喜好→主动推荐;三模块:用户建模 + 推荐对象建模 + 推荐算法
基于年龄/性别等Profile计算相似度→缺点:太粗糙、涉敏感信息
| 维度 | UserCF | ItemCF | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 思路 | 找相似用户→推荐他们的喜好 | 找相似物品→推荐给喜欢过原物品的用户 | ||||||||||
| 相似度公式 | $W_{uv}=\frac{\ | N(u)\cap N(v)\ | }{\sqrt{\ | N(u)\ | \cdot\ | N(v)\ | }}$ | $W_{ij}=\frac{\ | N(i)\cap N(j)\ | }{\ | N(i)\ | }$ |
| 改进 | 冷门物品权重更高(更体现兴趣) | 喜欢i的人中多少也喜欢j | ||||||||||
| 场景 | 新闻(物品更新快) | 电商/电影(**工业界主流**) | ||||||||||
| 可解释性 | 弱 | **强** | ||||||||||
| 复杂度 | 与用户数²成正比 | 与物品数²成正比 |
分布式计算模型,输入输出均为
函数签名:map(K1,V1)→list(K2,V2) → reduce(K2,list(V2))→list(K3,V3)
JobTracker拆为ResourceManager(资源管理)+ ApplicationMaster(作业控制),支持多种计算框架
$$\text{logit}(P) = \beta_0 + \beta_1 \cdot \text{logit}(Q) + \varepsilon$$
| kNN | k-Means | |
|---|---|---|
| 类型 | 监督学习(分类) | 无监督学习(聚类) |
| 原理 | 近邻投票 | 距离分簇 |
→ 大量剪枝,避免穷举所有候选组合
| 策略 | 方法 |
|---|---|
| 精度换速度 | 容忍误差、采样数据 |
| 大数据化小 | 分块处理 |
| **FP-Growth** | **只需2次扫描**,构造FP-tree,共用前缀压缩数据 |
降序原因:频繁项在树上层 → 更多共用前缀 → 更紧凑
平滑→特征构造→聚集→标准化(0-1/z-score/log)→数据泛化
趋势 + 季节变动 + 循环波动 + 不规则波动
特征化 → 清洗 → 集成 → 转化 → 序列化/反序列化(空间省+时间快)
Redis="强化版Memcached",支持持久化、数据恢复、更多数据类型
Spark用1/10资源获3倍速度;核心优势:内存计算、DAG执行引擎、RDD
报告完 · 保留所有考点核心信息