如果企业没有为获得最佳性能而预先准备数据,那将不会更好地为那些消耗数据的用户提供服务。实际上,不良的数据准备是导致大数据项目失败的主要原因,而管理此类项目的人负担不起,只是出于这个原因,对于企业来说,拥有大数据准备策略和方法并如实执行是至关重要的。
数据准备策略应包含以下元素:
1. 对当前和将来的业务问题有透彻的了解,期望数据能为企业带来答案。
了解要应用大数据分析的业务领域可以为数据建立业务环境,并有助于制定数据收集和执行策略。此阶段的目标是确定企业中哪些数据与关键业务问题相关,哪些无关。企业还可以随着业务需求的变化扩展业务问题和要查找的数据,但是一开始最好还是密切关注数据。
2. 数据集中化。
数据必须规范化以便一致,并且企业中的每个人都使用相同的数据。因此,即使可以选择针对特定业务领域填充此主数据的不同子集,也必须将所有分析数据存储在IT维护的集中式存储库中。
3. 标识必须馈入中央分析信息存储库的数据源。
一旦确定了业务案例和问题,就应确定可用于汇总回答业务中紧迫问题的数据集和源。这些数据源可以来自企业内部或外部。
4. 识别可能相关的未来数据源。
同时,现在开始识别将来业务可能需要的其他数据集或源还为时过早。这些数据源最初不会准备数据,但是它们的标识将为将来的数据准备提供一个路线图。
5. 定义的数据准备方法。
有三个基本步骤可将干净数据移入中央数据存储库。首先,从数据源中提取数据。然后,将其转换为与其要到达的数据目标兼容的格式。最后,将其加载到目标存储库中。重要的部分是转型。如果相同的数据字段将流入新的目的地,但该目的地的格式不同于原始目的地,则必须将数据转换为新格式,以便数据正常工作并在目的地中保持一致。如果人工完成,这是一个繁琐的步骤,因此需要自动化工具。
6.选择有效的数据准备工具。市场上有许多数据准备工具,因此建议企业尝试使用它们,并与提供强大支持和培训的供应商合作。目标应该是准备数据以使其具有最高质量,并选择易于使用的工具,并提供自动执行数据准备步骤的工具。