★ OLAP建模的一般过程
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
src="http://aosustudio.com.cn//Upload/Articles/070325/fd048511-18fd-4b65-a776-a48ec09fc11d/faccd019-5221-4abd-80c4-e1969869c7b9.html" frameborder="0" width="100%" scrolling="no" height="270"> |
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
当前,市场竞争异常激烈,各商家企业为了能在竞争中占据优势,费劲心思。使用过OLAP技术的企业都知道,OLAP技术能给企业带来新的生机和活力。OLAP技术把企业大量的数据变成了客户需要的信息,把这些信息变成了价值,提高了企业的产值和效益,增强了客户自身的竞争实力。 “啤酒与尿布”的故事家喻户晓,在IT界里,几乎是数据挖掘的代名词,那么各商家企业受了多少启发,数据挖掘又给他们带来了多少价值呢? 客户需求 客户面对大量的信息,用OLAP进行多维分析。如:一个网上书店,用OLAP技术可以浏览到什么时间,那个类别的客户买了多少书等信息,如果想动态的获得深层次的信息,比如:哪些书籍可以打包推荐,哪些书籍可以在销售中关联推出等等,就要用到数据挖掘技术了。 当客户在使用OLAP技术进行数据的多维分析的时候,联想到“啤酒与尿布”的故事,客户不禁会有疑问,能不能通过数据挖掘来对数据进行深层次的分析呢,能不能将数据挖掘和OLAP结合起来进行分析呢? SQL Server 2005 数据挖掘: SQL Server 2005的Data Mining是SQL Server2005分析服务(Analysis Services)中的一部分。数据挖掘通常被称为“从大型数据库提取有效、可信和可行信息的过程”。换言之,数据挖掘派生数据中存在的模式和趋势。这些模式和趋势可以被收集在一起并定义为挖掘模型。挖掘模型可以应用于特定的业务方案,例如:预测销售额、向特定客户发送邮件、确定可能需要搭售的产品、查找客户将产品放入购物车的顺序序列。 SQL Server 2005的Data Mining拥有多种算法(如图1所示)。
图1 Microsoft 决策树算法、Microsoft Naive Bayes 算法、Microsoft 聚类分析算法、Microsoft 神经网络算法 (SSAS),可以预测离散属性,例如,预测目标邮件活动的收件人是否会购买某个产品。 Microsoft 决策树算法、Microsoft 时序算法可以预测连续属性,预测连续属性,例如,预测下一年的销量。 Microsoft 顺序分析和聚类分析算法预测顺序,例如,执行公司网站的点击流分析。 Microsoft 关联算法、Microsoft 决策树算法查找交易中的常见项的组,例如,使用市场篮分析来建议客户购买其他产品。 Microsoft 聚类分析算法、Microsoft 顺序分析和聚类分析算法,查找相似项的组,例如,将人口统计数据分割为组以便更好地理解属性之间的关系。 巅峰之旅之案例一:网上书店关联销售 提出问题 网上书店现在有了很强的市场和比较固定的大量的客户。为了促进网上书店的销售量的增长,各网上书店采取了各种方式,给客户提供更多更丰富的书籍,提供更优质服务,等方式吸引更多的读者。 是不是这样就够了呢?这里,给众多网上书店的商家们提供一种非常好的促进销售量增长,吸引读者的方法,就是关联销售分析。这种方法就是给客户提供其他的相关书籍,也就是在客户购买了一种书籍之后,推荐给客户其他的相关的书籍。这种措施的运用给他们带来了可观的效益。 首先必须明确的是,这里介绍的关联销售并不是,根据网上书店的销售记录进行的比例统计,也区别于简单的概率分析统计,是用的关联规则算法。“啤酒和尿布”的故事足以证明了该算法的强大功能和产生的震撼效果。 那么,怎么来实现这样一个效果呢? 解决步骤 首先,我们有数据源,也就是销售记录。这里我们做数据挖掘模型,要用到两张表,一张表是我们的会员,用会员ID号来代替;另一张表是我们那个会员买了什么书。表结构是这样的:
表1:User 表2:Sales 我们应用SQL Server 2005的Data Mining工具,建立数据挖掘模型。 具体步骤如下: 第一步:定义数据源。选取的为网上书店的销售记录数据源(最主要的是User表和Sales表)。 第二步:定义数据源视图。在此我们要建立好数据挖掘中事例表和嵌套表,并定义两者之间的关系,定义User为事例表(Case Table),Sales为嵌套表(Nested Table)。 第三步:选取Microsoft Association Rules(关联规则)算法,建立挖掘模型,如图2所示。 图2 第四步、设置算法参数,部署挖掘模型。 第五步、浏览察看挖掘模型。对于关联规则算法来说,三个查看的选项卡。 A:项集:“项集”选项卡显示被模型识别为经常发现一起出现的项集的列表。在这里指的是经过关联规则算法处理后,发现关联在一起的书籍的集合。 B:规则:“规则”选项卡显示关联算法发现的规则。“规则”选项卡包含一个具有以下列的网格:“概率”、“重要性”和“规则”。概率说明出现规则结果的可能性。重要性用于度量规则的用途。尽管规则出现的概率可能很高,但规则自身的用途可能并不重要。重要性列就是说明这一情况的。例如,如果每个项集都包含属性的某个特定状态,那么,即使概率非常高,预测状态的规则也并不重要。重要性越高,规则越重要。 C:关联网络:节点间的箭头代表项之间有关联。箭头的方向表示按照算法发现的规则确定的项之间的关联。(如图3所示) 图3 效果展示 1、我们可以看到在上图中,绿色的是我们选择的节点,橙色的是可以预测所选节点的节点,也就是说如果消费者买了《月光宝盒(2VCD)》的话,那么我们可以给该消费者推荐《乱世佳人(上集,2VCD)》。紫色的是和所选节点能够双向预测的,即买了《大圣娶亲》,推荐《乱世佳人(上集,2VCD)》;同样,买了《乱世佳人(上集,2VCD)》,推荐《大圣娶亲》。这样我们就很容易看到经过关联算法计算出来的书籍之间的关联性。如图3所示效果。 2、我们也可以通过写DMX语句来实现预测查询。 SELECT PredictAssociation([User].[Sales],include_statistics,10) From [User] NATURAL PREDICTION JOIN (SELECT (SELECT '月光宝盒(2VCD)' AS [Book Name]) AS [Sales]) AS t 得到的结果集为:
表3:数据挖掘预测结果集Result Book Name就是书籍的名字,$SUPPORT是在我们的结果集众,出现《月光宝盒(2VCD)》之后,又购买《大圣娶亲(2VCD)》的次数是1317,$PROBABILITY是出现的相关性强度,$ADJUSTEDPROBABILITY是修正后的相关性强度。这样,我们就可以按照挖掘信息,给客户推荐相关的书籍了。 巅峰之旅之案例二:客户类别销售分析 这个案例的前提是我们已经建立好了一个OLAP的多维数据库Sales,事实表为FactInternetSales,有 五个维度,分别是DimCurrency,DimCustomer,DimProduct,DimTime,DimPromotion。(多维数据库的结构如图4所示) 图4 提出问题 利用OLAP建立的多维数据库Sales,我们可以实现多角度的浏览和分析。例如:我们可以分析2004年第一季度的M生产线产品的销售量情况,还可以实现灵活的交叉分析,等等。但是,如果我们要分析,某个维度的多个属性的综合的销售量,例如:客户维度里有Birth Date、English Education、House Owner Flag、Number Cars Owned、Yearly Income等属性,在多维数据库里面分析的时候, 我们可以把客户维度的Number Cars Owned属性放在展示区域的行上,把度量值Order Quantity放在列上,查看拥有0-4辆汽车的客户的订购所有产品的数量。同样,我们也可以类似的查看其他属性的情况。但是,如果我们要把客户维度的某些属性综合考虑来分类,例如:我们要把高收入、高学历、高消费的客户作为一个群体,把高收入,低学历、高消费的客户作为一个群体,等等,然后,基于这些群体来浏览分析,销售情况,如何来实现呢? 解决步骤 用过聚类算法的大概比较清楚,聚类算法,是用来给事物分类的。那么怎么用聚类算法的这个特性,和OLAP进行正和呢。请看下面这个案例: 第一步:建立挖掘模型。这里需要注意的是:以前我们在建立数据挖掘模型的时候是基于关系型数据源。 A:而在这里,我们要基于多维数据库Sales,选取维度DimCustomer为数据挖掘模型的数据源。 B:按照向导,选取事例键Dim Customer, C:在选取事例级别列对话框里面,选择一些属性和度量值,我们这里选取English Education、House Owner Flag、Number Cars Owned、Yearly Income、Sales Amount。如图5所示。 D:在完成对话框里面,我们输入挖掘结构名称CustomerSturcture,输入挖掘模型名称CustomerClustering。必须注意的是,一是一定要选择创建挖掘模型维度,输入挖掘模型维度的名称CustomerClustering;二是一定要选择使用挖掘模型维度创建多维数据集Sales_DM。 E:设置算法参数。 然后对创建的挖掘结构和挖掘模型进行处理。 图5 此时,共享维度里面会自动添加了一个CustomerClustering维度,也就是数据挖掘维度。 第二步:处理CustomerClustering维度。 第三步:处理多维数据集Salse_DM。 处理后的多维数据集Sales_DM,就包含了数据挖掘维度CustomerClustering。这样,我们就可以把经过聚类算法分类后的客户维度,来进行多维数据分析。如图6所示。 图6 效果展示 这些Cluster是我们用聚类算法建立的挖掘模型的维度成员,每个Cluster都是我们所选属性的一个综合的结果,但是代表着一个明显的特征。我们还可以在数据挖掘模型里面,对各个Cluster进行名称的标示,如Cluster 1是高收入高消费高学历的群体,我们就可以给他命名,把所有的Cluster都命名为能代表本身特性的名称,这样,使得多为数据库的信息就更丰富了。 总结 在激烈的市场竞争中,要想把海量的数据转化为信息,提高自身的信息化建设水平,增强企业的核心竞争力,BI技术是您明智的选择。应用OLAP技术建立多维数据库,进行多维分析,并把数据挖掘算法应用于多维数据库中,会进一步增加信息量,让您掌握更多的市场先机。祝您成功! |
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
|
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
src="http://aosustudio.com.cn/ad/GoogleSerch.htm" frameborder="0" width="100%" scrolling="no" height="30"> |
||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||||
★ OLAP建模的一般过程相关推荐
- amesim子模型_AMESim进行实际物理建模及建模的一般过程
AMESim进行实际物理建模及建模的一般过程 注意:本例模型是比较正确的模型,但是参数设置并不是按照实际参数设置的,给出这个模型的目的是让大家知道如何对照物理模型建模! 建模的出发点: 1.首先要搞清 ...
- 厂房效果图制作|工厂大棚鸟瞰图|建模出图过程详细思路解析
关于厂房,工厂园区规划,及钢结构类项目效果图制作过程中所经常遇到的一些问题,在这里予以汇总整理,并对场景搭建的流程给予简述. 三维场景创建,首先需要把CAD平面规划图纸,或是PDF电子版文档,或是手绘 ...
- 2023年五一数学建模 B 题过程与结果
文章目录 第一问 第二问 数据时序分析 Auto-ARIMA 第二问求解 解的情况 A->Q: D-> A Q-V 总快递数 第三问 第四问 遗传算法求解 第五问 X-11 分解 趋势:采 ...
- 2023年电工杯数学建模竞赛A题:电采暖负荷参与电力系统功率调节的技术经济分析具体建模过程以及代码结果
建设以新能源为主体的新型电力系统是应对全球气候变化挑战的重要举措.高比例新能源接入导致电力系统调节能力稀缺,亟需开发新的调节资源,如火电深度调峰.建设抽水蓄能电站.配置储能和挖掘负荷中的调节能力等.现 ...
- 维度建模的基本概念及过程
维度建模的基本概念及过程 摘要:本文首先介绍维度模型中的维度表和事实表这2个基本构成要素的基础知识:其次,介绍设计维度模型的4个基本步骤:再次,围绕某银行为实现业务价值链数据集成的需要,介绍多维体系结 ...
- 3000字长文为你解读数据仓库与复杂业务数据建模全流程
近日,2022年个推TechDay"治数训练营"系列直播课第一期圆满举办.个推资深大数据研发工程师为大家深入浅出地介绍了数据仓库的前世今生以及数据建模的常用方法. 本文对" ...
- 数据仓库电商建模_真实电商数据仓库全流程开发详解,资源教程下载
课程名称 Hadoop大数据视频教程-第一季:真实电商数据仓库全流程开发详解(共46讲),资源教程下载 课程目录 第一部分:数据仓库基础理论与技术圈 第一章:互联网电商大数据环境 第二章:商业智能与数 ...
- 商务智能-第五章 多维建模
Lecture5-Dimensional Modeling 多维建模 1. 维度建模中的基本概念 事实表 维度表 事实与维度的融合 星型模型 雪花模型 数据立方体 1.1. 事实表 事实表是维度建模的 ...
- 附加 集合数据_浩辰3D软件新手教程:三维建模设计中如何重用CAD模型数据?
在日常三维建模设计过程中,经常会遇到CAD模型数据的重复,那么如何重用CAD模型数据呢?下面小编就来给大家介绍一下在进行三维建模设计的过程中重用CAD模型数据的操作教程吧! 对CAD数据的重用,就如同 ...
最新文章
- 苹果又魔改安卓? iOS 15 正式发布、可跨设备移动文件,这届 WWDC21 带来了什么?...
- websphere安装应用失败_如何使用安卓手机给任天堂Switch安装游戏NSUSBloader mobile
- 两路服务器型号,两路服务器 核数
- 每天都在红绿灯前面梭行,不如自己来实现个红绿灯?
- restTemplate使用和踩坑总结
- 内核中的UDP socket流程(5)——inet_create
- css高度100%(百分比高度)
- HTML常用标签及属性
- [深入浅出WP8.1(Runtime)]文本框(TextBox)
- 离散数学蕴含式的问题
- 《西点军校的经典法则》序 -- 責任(せきにん)、栄誉(えいよ)、国家(こっか)...
- 用计算机写高中数学程序框图,画“程序框图”,高中数学最实用基本技能之一...
- 皇冠与锚-JS实现(拒绝赌博)
- Vue中解决数据量过大导致页面崩溃;解决方案
- iOS 的 APP 在系统中如何适应 iPhone 5s/6/6 Plus 三种屏幕的尺寸?
- 利用Python爬取音乐资源,小白福音
- mysql Events及存储过程查看
- electron builder 打包错误相关问题
- 华为IPsec实现支部与支部间借助总部进行隧道中转
- Web网页设计之jQuery_1. 认识jQuery
热门文章
- office2003和office2007共享(doc用03打开,docx用07打开)
- html中marquee改变颜色,html中marquee标签的用法
- web前端——jQuery
- 微信小程序实现气泡弹出框
- 新农慕课python答案、第七周_中国大学MOOC(慕课)_Python机器学习应用_章节答案期末答案...
- JS的EventSource实时接收服务端推送的数据
- 【致敬嵌入式攻城狮第2期活动预热征文】蜂鸣器加流水灯按键检测的实现
- 《沈剑架构师训练营》第4章 - 微服务架构
- Android监听开机广播自启动程序
- java 泛型转实体_将实体类名称转换为泛型实体类