正确答案是 D) SQL查询优化。
数据挖掘是从大量数据中发现隐含的、先前未知的、潜在有用模式或知识的过程,其核心任务包括:
- 分类(如预测客户是否会流失)
- 聚类(如将用户分群)
- 关联规则发现(如“啤酒与尿布”关系)
- 此外还有回归、异常检测、序列模式挖掘、文本挖掘等。
而SQL查询优化属于数据库管理系统(DBMS)的查询处理与性能调优范畴,目标是提升查询执行效率(如选择索引、重写执行计划),不涉及从数据中发现新知识或模式,因此不属于数据挖掘任务。
回归分析属于数据挖掘任务,是因为它旨在从历史数据中学习变量间的潜在关系模型,并用于预测未知样本的连续型目标值(如房价、销售额、用户停留时长),具有模式发现、泛化能力和知识产出特征——这正是数据挖掘的核心目标:从海量数据中提取隐含的、可操作的、非平凡的知识。
而简单的统计描述(如均值、标准差、频数统计)属于描述性统计(Descriptive Statistics),其作用是概括已有数据的基本特征,不构建模型、不进行预测、不推断未知、也不挖掘变量间复杂依赖关系。它缺乏“发现新知识”的挖掘本质,仅是对数据表层的总结,属于数据分析的初级阶段,而非数据挖掘。
简言之:
✅ 回归分析 → 建模 + 泛化 + 预测 → 发现规律 → 属于数据挖掘;
❌ 均值计算 → 汇总已知 → 无模型/无泛化 → 描述现状 → 不属于数据挖掘(但常作为预处理或探索性分析步骤)。
数据挖掘中的预测性任务(Predictive Tasks)与描述性任务(Descriptive Tasks)在目标、建模逻辑、输出形式及评估方式上存在本质差异:
🔹目标差异:
- 预测性任务(如分类、回归):目标是构建一个能泛化到未见样本的模型,以准确预测未知实例的目标变量值(离散类标号或连续数值)。强调“未来推断”和“因果/相关关系建模”。
- 描述性任务(如聚类、关联规则、序列模式):目标是发现数据内在结构或共现规律,帮助理解数据分布、分组特征或行为模式,不预设目标变量,不进行外推预测,重在“解释现状”与“知识发现”。
🔹评估方式差异:
| 任务类型 | 典型评估指标 | 说明 |
|---|---|---|
| 预测性(分类) | 准确率、精确率、召回率、F1-score、AUC | 基于已知真值标签(ground truth)对比预测结果,依赖标注数据集和严格划分的训练/测试集。 |
| 预测性(回归) | RMSE、MAE、R²、MAPE | 衡量预测值与真实连续值之间的误差大小,同样需真实标签。 |
| 描述性(聚类) | 轮廓系数、Calinski-Harabasz指数、Davies-Bouldin指数 | 无监督评估:仅基于数据本身结构(如簇内紧密度、簇间分离度),无需真实标签;若有人工标注,可用ARI、NMI等外部指标辅助验证。 |
| 描述性(关联规则) | 支持度(support)、置信度(confidence)、提升度(lift) | 基于规则在数据中的统计显著性与实用性判断,强调业务可解释性与意外性,而非“对错”,无标准真值对照。 |
✅ 关键区别总结:
- 预测性任务 =有监督 + 目标导向 + 可验证性高(有黄金标准);
- 描述性任务 =常无监督 + 探索导向 + 评估具主观性/多维性(结构+语义+业务价值)。