如果企业没有为获得最佳性能而预先准备数据,那将不会更好地为那些消耗数据的用户提供服务。实际上,不良的数据准备是导致大数据项目失败的主要原因,而管理此类项目的人负担不起,只是出于这个原因,对于企业来说,拥有大数据准备策略和方法并如实执行是至关重要的。
数据准备策略应包含以下元素:
1. 对当前和将来的业务问题有透彻的了解,期望数据能为企业带来答案。
了解要应用大数据分析的业务领域可以为数据建立业务环境,并有助于制定数据收集和执行策略。此阶段的目标是确定企业中哪些数据与关键业务问题相关,哪些无关。企业还可以随着业务需求的变化扩展业务问题和要查找的数据,但是一开始最好还是密切关注数据。
2. 数据集中化。
数据必须规范化以便一致,并且企业中的每个人都使用相同的数据。因此,即使可以选择针对特定业务领域填充此主数据的不同子集,也必须将所有分析数据存储在IT维护的集中式存储库中。
3. 标识必须馈入中央分析信息存储库的数据源。
一旦确定了业务案例和问题,就应确定可用于汇总回答业务中紧迫问题的数据集和源。这些数据源可以来自企业内部或外部。
4. 识别可能相关的未来数据源。
同时,现在开始识别将来业务可能需要的其他数据集或源还为时过早。这些数据源最初不会准备数据,但是它们的标识将为将来的数据准备提供一个路线图。
5. 定义的数据准备方法。
有三个基本步骤可将干净数据移入中央数据存储库。首先,从数据源中提取数据。然后,将其转换为与其要到达的数据目标兼容的格式。最后,将其加载到目标存储库中。重要的部分是转型。如果相同的数据字段将流入新的目的地,但该目的地的格式不同于原始目的地,则必须将数据转换为新格式,以便数据正常工作并在目的地中保持一致。如果人工完成,这是一个繁琐的步骤,因此需要自动化工具。
6.选择有效的数据准备工具。市场上有许多数据准备工具,因此建议企业尝试使用它们,并与提供强大支持和培训的供应商合作。目标应该是准备数据以使其具有最高质量,并选择易于使用的工具,并提供自动执行数据准备步骤的工具。
近几年,互联网行业蓬勃发展,在互联网浪潮的冲击下,互联网创业已成为一种比较...
本文转载自微信公众号「bugstack虫洞栈」,作者小傅哥 。转载本文请联系bugstack...
TIOBE 公布了 2021 年 3 月的编程语言排行榜。 本月 TIOBE 指数没有什么有趣的变...
溢价 域名 的续费价格如何?通常来说,因为溢价域名的价值高于普通域名,所以溢...
在Python开发过程中,我们难免会遇到多重条件判断的情况的情况,此时除了用很多...
本文转载自公众号读芯术(ID:AI_Discovery)。 这一刻你正在应对什么挑战?这位前...
背景 我们知道 如果在Kubernetes中支持GPU设备调度 需要做如下的工作 节点上安装...
前言 统计科学家使用交互式的统计工具(比如R)来回答数据中的问题,获得全景的认...
基本介绍 给定 n 个权值作为 n 个叶子节点,构造一颗二叉树,若该树的带权路径长...
想了解更多内容,请访问: 51CTO和华为官方战略合作共建的鸿蒙技术社区 https://...