SPSS+Clementine+数据挖掘入门+ - 图文(2)

2020-06-03 12:24

Models

经过训练的模型会出现在这一栏中，这就像是真表（Truth Table）的概念那样，训练过的模型可以加入的数据流中用于预测和打分。另外，模型还可以导出为支持PMML协议的XML文件，但是PMML没有给定所有模型的规范，很多厂商都在PMML的基础上对模型内容进行了扩展，Clementine除了可以导出扩展的SPSS SmartScore，还可以导出标准的PMML 3.1。

SPSS Clementine 数据挖掘入门 (2)

下面使用Adventure Works数据库中的Target Mail作例子，通过建立分类树和神经网络模型，决策树用来预测哪些人会响应促销，神经网络用来预测年收入。

Target Mail数据在SQL Server样本数据库AdventureWorksDW中的dbo.vTargetMail视图，关于Target Mail详见：

http://technet.microsoft.com/zh-cn/library/ms124623.aspx#DataMining

或者我之前的随笔：

http://www.cnblogs.com/esestt/archive/2007/06/06/773705.html

1. 定义数据源

将一个Datebase源组件加入到数据流设计区，双击组件，设置数据源为dbo.vTargetMail视图。

在Types栏中点“Read Values”，会自动读取数据个字段的Type、Values等信息。

Values是字段包含的值，比如在数据集中NumberCardsOwned字段的值是从0到4的数，HouseOwnerFlag只有1和0两种值。Type是依据Values判断字段的类型，Flag类型只包含两种值，类似于boolean；Set是指包含有限个值，类似于enumeration；Ragnge是连续性数值，类似于float。通过了解字段的类型和值，我们可以确定哪些字段能用来作为预测因子，像AddressLine、Phone、DateFirstPurchase等字段是无用的，因为这些字段的值是无序和无意义的。

Direction表明字段的用法，“In”在SQL Server中叫做“Input”,“Out”在SQL Server中叫做“PredictOnly”,“Both”在SQL Server中叫做“Predict”，“Partition”用于对数据分组。

2. 理解数据

在建模之前，我们需要了解数据集中都有哪些字段，这些字段如何分布，它们之间是否隐含着相关性等信息。只有了解这些信息后才能决定使用哪些字段，应用何种挖掘算法和算法参数。

在除了在建立数据源时Clementine能告诉我们值类型外，还能使用输出和图形组件对数据进行探索。

例如先将一个统计组件和一个条形图组件拖入数据流设计区，跟数据源组件连在一起，配置好这些组件后，点上方绿色的箭头。

等一会，然后这两个组件就会输出统计报告和条形图，这些输出会保存在管理区中（因为条形图是高级可视化组件，其输出不会出现在管理区），以后只要在管理区双击输出就可以看打开报告。

共6页:

SPSS+Clementine+数据挖掘入门+ - 图文(2).doc 将本文的Word文档下载到电脑下载失败或者文档不完整，请联系客服人员解决！

下载这篇word文档