企业知识图谱概述
定义与目的
企业知识图谱是一种结合实例数据的知识领域模型,旨在表示统一跨域或组织的信息,丰富上下文和语义。它通过紧密相关的业务对象和主题链接、分类,并连接现有的数据和文档,形成机器可读且人类可理解的信息表示。知识图谱的目标是解决数据孤岛、异构数据源、混合非结构化和结构化数据等问题,实现跨数据的语义链接、共享数据和内容、统一词汇以及统一的应用程序视图,从而提高效率、抓住机会并做出更好的决策。
知识图谱历史
知识图谱的概念起源于1982年荷兰格罗宁根大学和特温特大学的“知识图谱”项目,随后发展出特定主题知识库(如Wordnet和Geonames),以及通用基于图的知识库(如DBpedia、Freebase)。Google在2012年推出知识图谱,进一步推动了其应用。近年来,大型数据公司如Airbnb、亚马逊、苹果等也开始采用知识图谱技术。
知识图谱组件
知识图谱主要由以下组件构成:
- 数据存储:包括图形数据库(如基于RDF的三重存储或标记的属性图)和搜索索引。
- 分类:受控、有组织的概念集合,用于标记和分类内容,便于查找和检索。分类法是知识组织系统(KOS),基于明确的概念,并以层次结构组织。标准包括SKOS(简单知识组织系统)。
- 本体:知识领域的模型,定义实体的类型、属性及其相互关系,包含类、关系和属性,以三元组语句链接。W3C提供的标准包括Web本体语言(OWL)和RDF-Schema。
构建知识图谱
构建知识图谱的步骤包括:
- 确定用例。
- 清点和整理相关数据及内容。
- 识别并映射数据之间的关系,设计并实施本体论。
- 在图数据库中集成示例数据。
- 作为概念验证测试,连接到本体论/分类法。
- 连接到或构建用户应用程序和界面。
- 使用数据管道、自动标注和AI技术进行自动化和扩展。
所需的核心软件和技术包括图形数据库管理软件、基于W3C标准的分类/本体管理软件、搜索软件(如Solr或Elasticsearch)、前端(Web)应用程序,以及ETL工具、文本挖掘/NLP工具、机器学习工具等。
知识图谱应用程序
组织通常会构建基于Web浏览器的知识图应用程序,实现组织内部的语义链接、共享数据和内容、统一词汇以及统一的应用程序视图。
挑战与要求
构建知识图谱需要特定的业务/用例、足够的时间、精力和专业知识,以及数据质量所有利益相关者的承诺。涉及的角色包括解决方案架构师、软件工程师、Web开发人员、信息架构师、数据架构师、数据分析师、数据工程师和数据科学家。