0
  • 聊天消息
  • 系统消息
  • 评论与回复
登录后你可以
  • 下载海量资料
  • 学习在线课程
  • 观看威廉希尔官方网站 视频
  • 写文章/发帖/加入社区
会员中心
创作中心

完善资料让更多小伙伴认识你,还能领取20积分哦,立即完善>

3天内不再提示

大数据挖掘是什么,数据挖掘的方法主要有哪些?

jmiy_worldofai 来源:YXQ 2019-04-17 10:42 次阅读

数据挖掘(Data Mining)是从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、但又是潜在有用的信息和知识的过程。

数据挖掘对象

根据信息存储格式,用于挖掘的对象有关系数据库、面向对象数据库、数据仓库、文本数据源、多媒体数据库、空间数据库、时态数据库、异质数据库以及Internet等。

数据挖掘流程

定义问题:清晰地定义出业务问题,确定数据挖掘的目的。

数据准备:数据准备包括:选择数据–在大型数据库和数据仓库目标中 提取数据挖掘的目标数据集;数据预处理–进行数据再加工,包括检查数据的完整性及数据的一致性、去噪声,填补丢失的域,删除无效数据等。

数据挖掘:根据数据功能的类型和和数据的特点选择相应的算法,在净化和转换过的数据集上进行数据挖掘。

结果分析:对数据挖掘的结果进行解释和评价,转换成为能够最终被用户理解的知识。

数据挖掘分类

直接数据挖掘:目标是利用可用的数据建立一个模型,这个模型对剩余的数据,对一个特定的变量(可以理解成数据库中表的属性,即列)进行描述。

间接数据挖掘:目标中没有选出某一具体的变量,用模型进行描述;而是在所有的变量中建立起某种关系。

数据挖掘的方法

神经网络方法

神经网络由于本身良好的鲁棒性、自组织自适应性、并行处理、分布存储和高度容错等特性非常适合解决数据挖掘的问题,因此近年来越来越受到人们的关注。

遗传算法

遗传算法是一种基于生物自然选择与遗传机理的随机搜索算法,是一种仿生全局优化方法。遗传算法具有的隐含并行性、易于和其它模型结合等性质使得它在数据挖掘中被加以应用。

决策树方法

决策树是一种常用于预测模型的算法,它通过将大量数据有目的分类,从中找到一些有价值的,潜在的信息。它的主要优点是描述简单,分类速度快,特别适合大规模的数据处理。

粗集方法

粗集理论是一种研究不精确、不确定知识的数学工具。粗集方法有几个优点:不需要给出额外信息;简化输入信息的表达空间;算法简单,易于操作。粗集处理的对象是类似二维关系表的信息表。

覆盖正例排斥反例方法

它是利用覆盖所有正例、排斥所有反例的思想来寻找规则。首先在正例集合中任选一个种子,到反例集合中逐个比较。与字段取值构成的选择子相容则舍去,相反则保留。按此思想循环所有正例种子,将得到正例的规则(选择子的合取式)。

统计分析方法

在数据库字段项之间存在两种关系:函数关系和相关关系,对它们的分析可采用统计学方法,即利用统计学原理对数据库中的信息进行分析。可进行常用统计、回归分析、相关分析、差异分析等。

模糊集方法

即利用模糊集合理论对实际问题进行模糊评判、模糊决策、模糊模式识别和模糊聚类分析。系统的复杂性越高,模糊性越强,一般模糊集合理论是用隶属度来刻画模糊事物的亦此亦彼性的。

数据挖掘任务

关联分析

两个或两个以上变量的取值之间存在某种规律性,就称为关联。数据关联是数据库中存在的一类重要的、可被发现的知识。关联分为简单关联、时序关联和因果关联。关联分析的目的是找出数据库中隐藏的关联网。一般用支持度和可信度两个阀值来度量关联规则的相关性,还不断引入兴趣度、相关性等参数,使得所挖掘的规则更符合需求。

聚类分析

聚类是把数据按照相似性归纳成若干类别,同一类中的数据彼此相似,不同类中的数据相异。聚类分析可以建立宏观的概念,发现数据的分布模式,以及可能的数据属性之间的相互关系。

分类

分类就是找出一个类别的概念描述,它代表了这类数据的整体信息,即该类的内涵描述,并用这种描述来构造模型,一般用规则或决策树模式表示。分类是利用训练数据集通过一定的算法而求得分类规则。分类可被用于规则描述和预测。

预测

预测是利用历史数据找出变化规律,建立模型,并由此模型对未来数据的种类及特征进行预测。预测关心的是精度和不确定性,通常用预测方差来度量。

时序模式

时序模式是指通过时间序列搜索出的重复发生概率较高的模式。与回归一样,它也是用己知的数据预测未来的值,但这些数据的区别是变量所处时间的不同。

偏差分析

在偏差中包括很多有用的知识,数据库中的数据存在很多异常情况,发现数据库中数据存在的异常情况是非常重要的。偏差检验的基本方法就是寻找观察结果与参照之间的差别。

声明:本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人,不代表电子发烧友网立场。文章及其配图仅供工程师学习之用,如有内容侵权或者其他违规问题,请联系本站处理。 举报投诉
  • 算法
    +关注

    关注

    23

    文章

    4608

    浏览量

    92845
  • 数据挖掘
    +关注

    关注

    1

    文章

    406

    浏览量

    24234

原文标题:大数据挖掘是什么,数据挖掘的方法主要有哪些?

文章出处:【微信号:worldofai,微信公众号:worldofai】欢迎添加关注!文章转载请注明出处。

收藏 人收藏

    评论

    相关推荐

    基于Kepware的Hadoop大数据应用构建-提升数据价值利用效能

    处理超大数据集。 Hadoop的生态系统非常丰富,包括许多相关工具和威廉希尔官方网站 ,如Hive、Pig、HBase等,这些工具可以方便地构建复杂的大数据应用。Hadoop广泛应用于各种场景,包括数据处理和分析、
    的头像 发表于 10-08 15:12 150次阅读
    基于Kepware的Hadoop<b class='flag-5'>大数据</b>应用构建-提升<b class='flag-5'>数据</b>价值利用效能

    SMT锡膏钢网的清洗工艺主要有哪些?

    成本,就需要选择合适的清洗工艺及清洗剂。下面佳金源锡膏厂家来讲解一下SMT锡膏钢网的清洗工艺主要有哪些?一、手工浸泡擦洗方式:手工浸泡擦洗就是把SMT钢网浸泡入清
    的头像 发表于 08-26 16:22 594次阅读
    SMT锡膏钢网的清洗工艺<b class='flag-5'>主要有</b>哪些?

    中科曙光受邀参加第十届中国数据挖掘会议

    近日,国内数据挖掘领域最主要的学术活动之一—第十届中国数据挖掘会议(CCDM2024)于山东泰安举行,中科曙光参与并分享了曙光AI构建产学研
    的头像 发表于 08-01 10:43 583次阅读

    工业控制设备间主要有哪些有线通信威廉希尔官方网站 ?

    信威廉希尔官方网站 的详细介绍。       1.串行通信威廉希尔官方网站       串行通信威廉希尔官方网站 是一种最基本的有线通信威廉希尔官方网站 ,广泛应用于工业控制领域。它通过一条数据线(TX)和一条接收线(RX)实现数据的发送和接收。串行通信威廉希尔官方网站 主要有以下几种:    
    的头像 发表于 06-23 16:38 857次阅读

    NFC功能是什么?主要有哪些应用?

    NFC是一种新兴的威廉希尔官方网站 ,即近距离无线通讯威廉希尔官方网站 ,使用了NFC威廉希尔官方网站 的设备可以在彼此靠近的情况下进行数据交换,是由非接触式射频识别(RFID)及互连互通威廉希尔官方网站 整合演变而来的。 NFC在单一芯片上结合感应式读卡器、感应式卡片和点对点的功能,能在短距离内与兼容设备进行识别和数据
    的头像 发表于 06-20 16:57 1814次阅读
    NFC功能是什么?<b class='flag-5'>主要有</b>哪些应用?

    工业网关主要有哪些功能?

    和智能化水平。本文将详细解析工业网关的主要功能,以便读者更好地理解和应用。 一、数据采集与上传 工业网关的首要功能之一是数据采集与上传。它能够连接工业现场的各种设备,如PLC、传感器、仪表等,并通过串口/网口(如RS4
    的头像 发表于 06-17 15:19 416次阅读
    工业网关<b class='flag-5'>主要有</b>哪些功能?

    双绞线连接方式主要有哪几种

    双绞线的连接方式主要有以下几种: 直插式连接(RJ45):这是最常见的连接方法,通过插入RJ45接头(也叫网线头)将双绞线连接到设备端口,如计算机、交换机、路由器等。这种方式使两端的线序相同,适用于
    的头像 发表于 05-10 10:49 1729次阅读

    边缘计算网关主要有哪些功能?

    数据处理效率以及减轻云数据中心压力等方面发挥了重要作用。接下来,我们将详细探讨边缘计算网关的主要功能。 一、数据采集与处理 边缘计算网关具备强大的
    的头像 发表于 04-16 15:24 864次阅读

    X安规电容和CBB电容主要有哪些区别呢?

    X安规电容主要指X1和X2安规电容器,而CBB电容的种类就更多了,主要有CBB21/CBB22、MPB盒装电容、CBB81谐振电容、MMKP82双面金属化电容等。
    的头像 发表于 04-08 11:18 1622次阅读

    多路复用威廉希尔官方网站 主要有几种类型?它们各有什么特点?

    多路复用威廉希尔官方网站 主要有几种类型?它们各有什么特点? 多路复用威廉希尔官方网站 主要有以下几种类型:进程多路复用、I/O多路复用、信号驱动I/O和异步I/O。每种类型都有其特点和应用场景。 1. 进程多路复用:进程
    的头像 发表于 03-28 15:36 2893次阅读

    挖掘机生产装配线无线通讯应用

    一、应用背景 山东某挖掘机机械有限公司主要产品有装载机、挖掘机、道路机械及核心关键零部件等系列工程机械产品。为加速新旧动能转换,全新挖掘机整机装配线配合劳动组合的调整,提高装配水平和生
    的头像 发表于 02-22 09:44 394次阅读
    <b class='flag-5'>挖掘</b>机生产装配线无线通讯应用

    编码器的类型主要有哪几种?

    编码器类型主要有两种:绝对编码器和增量编码器。
    的头像 发表于 02-20 18:14 1987次阅读

    请问TC234和TC275主要有哪些区别?

    TC234 和TC275主要有哪些区别?
    发表于 02-20 06:30

    数据挖掘的应用领域,并举例说明

    数据挖掘(Data Mining)是一种从大量数据中提取出有意义的信息和模式的威廉希尔官方网站 。它结合了数据库、统计学、机器学习和人工智能等领域的理论和方法
    的头像 发表于 02-03 14:19 3077次阅读

    Volteq推出电动遥控迷你挖掘机Sky 1000

    Sky 1000 不仅支持常规的直立操作模式,同时也支持远程遥控,用户仅需手持遥控器,即可从最远处约 48.8 米处轻松操控挖掘机。此举让操作者拥有更广阔的观察视角,降低安全风险。针对可能出现的突发事件,遥控器及挖掘机本机均配置了紧急停止按钮。
    的头像 发表于 01-15 14:39 889次阅读