结构化数据vs.非结构化数据:结构化数据由明确定义的数据类型组成,其模式可以使其易于搜索。而非结构化数据通常由不容易搜索的数据组成,其中包括音频、视频和社交媒体发布等格式。
结构化数据vs.非结构化数据非结构化数据与结构化数据并不表示两者之间存在真正的冲突。客户不是基于他们的数据结构选择,而是在使用他们的应用程序中选择:关系数据库用于结构化数据,大多数其他类型的应用程序用于非结构化数据。
然而,结构化数据分析的难易程度与非结构化数据的分析难度之间的关系日益紧张。结构化数据分析是一个成熟的流程和技术。非结构化数据分析是一个新兴行业,在研发方面需投入大量的资金,但这不是一项成熟的技术。企业内部的结构化数据与非结构化数据问题决定了他们是否应该投资于非结构化数据的分析,以及将这二者结合是否成为一种更好的商业智能?
什么是结构化数据?
一些关系数据库确实存储或指向非结构化数据,例如客户关系管理(CRM)应用程序。由于备忘录字段不会将自己放到传统的数据库查询中,因此其集成可能不理想。尽管如此,大部分客户关系管理(CRM)数据都是结构化的。
什么是非结构化数据?
非结构化数据本质上是结构化数据之外的一切数据。非结构化数据具有内部结构,但不通过预定义的数据模型或模式进行结构化。它可能是文本的或非文本的,也可能是人为的或机器生成的。它也可以存储在像NoSQL这样的非关系数据库中。
典型的人为非结构化数据包括:
文本文件:文字处理、电子表格、演示文稿、电子邮件、日志。
电子邮件:由于其元数据,电子邮件具有一些内部结构,人们有时将其称之为半结构化。但是,其消息字段是非结构化的,传统的分析工具无法解析它。
社交媒体:来自Facebook、Twitter和LinkedIn的数据。
移动数据:短信、地点。
媒体:MP3、数码照片、音频文件、视频文件。
业务应用程序:MSOffice文档、生产力应用程序。
典型的机器生成的非结构化数据包括:
卫星图像:天气数据、地形、军事活动。
科学数据:石油和天然气勘探、空间勘探、地震图像、大气数据。
数字监控:监控照片和视频。
传感器数据:交通、天气、海洋传感器。
具包容性的大数据分析可以使用结构化数据和非结构化数据。
结构化数据与非结构化数据:有什么区别?
除了存储在关系数据库和存储在一个关系数据库之外的明显区别之外,大的区别在于分析结构化数据与非结构化数据的便利性。针对结构化数据存在成熟的分析工具,但用于挖掘非结构化数据的分析工具正处于萌芽和发展阶段。
用户可以通过文本非结构化数据运行简单的内容搜索。但是,缺乏有序的内部结构使得传统数据挖掘工具的目标失败,企业从富有价值的数据源(如媒体、网络、博客、客户交互,以及社交媒体数据)获得的价值很小。即使非结构化数据分析工具在市场上出现,但没有任何一个供应商或工具集是明确的赢家。许多客户不愿意投资于具有不确定发展路线图的分析工具。
除此之外,非结构化数据比结构化数据要多得多。非结构化数据占企业数据的80%以上,并且以每年55%和65%的速度增长。如果没有工具来分析这些海量数据,组织会在商业智能表上留下大量有价值的数据。
传统上,结构化数据对大数据应用程序来说更容易消化,但如今的数据分析解决方案正在这方面取得重大进展。
半结构化数据如何适用于结构化和非结构化数据
半结构化数据维护用于识别单独数据元素的内部标记和标签,从而实现信息分组和层次结构。文档和数据库都可以是半结构化的。这种类型的数据只代表结构化/半结构化/非结构化数据的5%-10%,但具有关键的业务用例。
电子邮件是半结构化数据类型的一个非常常见的例子。而更高级的分析工具对于线程跟踪,近似重复数据删除和概念搜索是必需的。电子邮件的本地元数据可以实现分类和关键字搜索,无需任何其他工具。
电子邮件是一个巨大的用例,但大多数半结构化的开发中心都在缓解数据传输问题。与基于Web的数据共享和传输一样,共享传感器数据也是一个不断增长的用例:电子数据交换(EDI),许多社交媒体平台,文档标记语言和NoSQL数据库。
半结构化数据的例子
开放标准JSON(JavaScriptObjectNotation)是另一种半结构化数据交换格式。Java隐含在名称中,但其他类似C语言的编程语言可以识别它。其结构由名称/值对(或对象、散列表等)和有序值列表(或数组、序列、列表)组成。由于结构在各种语言之间可以互换,JSON擅长在Web应用程序和服务器之间传输数据。
NoSQL半结构化数据也是许多NoSQL(不仅是SQL)数据库的重要组成部分。NoSQL数据库与关系数据库不同,因为它们不会将组织(模式)与数据分开。这使得NoSQL成为存储不容易适应记录和表格格式的信息(比如长度不同的文本)的更好选择。它还允许数据库之间进行更容易的数据交换。一些较新的NoSQL数据库(如MongoDB和Couchbase)也通过将它们以JSON格式本地存储来包含半结构化文档。
在大数据环境中,NoSQL不需要管理员将运营和分析数据库分离为单独的部署。NoSQL是可操作的数据库,并托管用于商业智能的本地分析工具。在Hadoop环境中,NoSQL数据库摄取并管理传入数据并提供分析结果。
结构化数据与非结构化数据:下一代工具是游戏规则改变者
可以使用新工具分析非结构化数据,特别是给定用例参数。大多数这些工具都基于机器学习。结构化数据分析也可以使用机器学习,但海量数据和许多不同类型的非结构化数据都需要它。
使用机器学习智能进行非结构化数据分析可使组织:
1.分析数字通信的合规性。违反合规性将会使企业损失数百万美元的费用、诉讼和业务损失。模式识别和电子邮件线程分析软件可以搜索海量的电子邮件和聊天数据,以防潜在的不合规情况。最近的一个例子就是大众汽车公司可能通过使用分析来监控可疑消息的通信,从而避免了巨额罚款和声誉损失。
在电子数据展示中,数据科学家使用关键字搜索非结构化数据并获得有关数据的合理构想。
无论企业的业务具体是什么,其目标都是挖掘业务价值,无论数据是结构化的还是非结构化的。这两种类型的数据都可能具有很高的价值,而较新的工具可以汇总、查询、分析和利用所有数据类型,以便在整个企业数据范围内获得更加深入的业务洞察力。