资讯

技术再思考:高质量数据集到底是什么!?——5W1H 区分知识工程的8个概念

继续看技术问题,来看看知识工程相关的问题,NLP技术社区.《知识工程金皮书:高质量数据集与知识库的全链路工程图谱很有意思,所以分享出来

讲两点,一个是5W1H讲清楚知识工程的8个概念区分,这个统一话语,好开展工作;一个是高质量数据集到底是什么?不同的角度,不同的视角,做个区分。多总结多思考,越辩越明。


原文图片

得语言者,得天下。知识图谱、RAG、文档解析、LLM专题技术、数据、工具深度垂直跟进。

一、5W1H法区分知识工程的8个概念

在实践中,概念混淆是工程失败的第一大根因。把"语料库"当"数据集"用,把"知识库"当"知识图谱"建,把"数据治理"等同于"数据清洗",这些看似只是命名问题,实则导致技术选型错位、资源分配错位、团队职责错位。概念是工程的图纸,图纸画错,施工必然走样。

图片
图片

所以,最好的方式,是使用5W1H(Why-What-Who-When-Where-How)来进行解读:数据工程、知识工程、高质量数据集、语料库、知识库、知识图谱、本体论、数据治理。每个概念不定义完就结束,而是讲清它和邻居的边界在哪、它解决什么别人解决不了的问题。

下面是8个概念,先说结论:这八个概念不是平行的,它们处在一条从原始数据到可用智能的价值链上:数据治理是制度层 → 数据工程是加工层 → 数据集/语料库是产品层 → 知识工程是转化层 → 知识库/知识图谱是应用层 → 本体论是 schema 层。搞清楚各自在哪一层,比记住定义更重要

1、数据工程(Data Engineering)

图片
图片

数据工程的核心矛盾:数据的规模和异构性远超处理能力。一个中型企业的数据源可能有关系库、日志、API、文档、图片、音视频,格式几十种。数据工程的本质就是把这些异构的东西变成统一的、可供下游消费的资产。

2、知识工程(Knowledge Engineering)

图片
图片

知识工程与数据工程的本质区别:数据工程处理的是"记录",知识工程处理的是"意义"。数据工程把PDF变成干净的文本块,知识工程把文本块变成能回答问题的知识单元。前者关注体量和质量,后者关注语义和推理。

3、高质量数据集(High-Quality Dataset)

图片
图片

高质量数据集与普通数据的区别:普通数据是原材料,高质量数据集是质检合格品。区别不在于数据本身,而在于是否有工程化的质量保证流程。

一个从Common Crawl直接下载的语料不是数据集,经过清洗、去重、质量过滤、标注后的才是。

4、语料库(Corpus)

语料库与数据集的关键区别:语料库追求"量"和"覆盖",数据集追求"质"和"标注"。语料库的典型质量指标是去重率、语言覆盖、困惑度分布;数据集的质量指标是标注一致性、任务覆盖率、评测分数。把语料库当数据集用,等于拿矿石当零件装配。

图片
图片

5、知识库(Knowledge Base)

图片
图片

知识库的核心陷阱:把文件存进去不等于建了知识库。很多团队的"知识库"其实就是往向量库里塞了一堆chunk,没有分块策略、没有元数据、没有重排、没有评测——这不是知识库,这是"向量垃圾场"。真正的知识库需要端到端的质量保证,从解析精度到检索准确率到生成可信度。

6、知识图谱(Knowledge Graph

图片
图片

知识图谱与知识库的关键区别:知识库是"文档块的向量索引",知识图谱是"实体关系的图结构"。知识库解决"找相关文档",知识图谱解决"推理实体关系"。GraphRAG把两者结合:用向量检索找入口实体,用图遍历扩展关系上下文。

7、本体(Ontology)

图片
图片

本体论与知识图谱的关系:本体是T-box(terminology box,术语层),知识图谱是A-box(assertion box,断言层)。本体定义"公司有员工",知识图谱存储"亚马逊有员工杰夫·贝索斯"。没有本体的知识图谱只是属性图(如Neo4j的LPG),缺乏推理能力;有本体的知识图谱可以做逻辑推理(如推断传递关系)。 很多人把本体(Ontology)等同于分类(Taxonomy)或词表(Vocabulary)。分类只有层级关系,词表只有术语列表,本体还有属性、关系和约束。SKOS是词表标准,OWL是本体标准,能力差距巨大。

8、数据治理(Data Governance)

图片
图片

数据治理与数据工程的区别:数据工程是"修路",数据治理是"立交规"。工程关注管道怎么搭,治理关注数据在管道里合不合规、准不准、谁负责。没有治理的工程,管道越快,错误传播越快。

二、高质量数据集到底是什么?

关于高质量数据集是什么,其实众说纷纭,但一点是明去的,高质量数据集不是被发现的,而是被制造的。

实际上,高质量数据集这个词,2024年以来同时出现在五种完全不同的语境里:政策文件、学术论文、国际标准、人民日报评论、数据服务商销售方案,五种语境各说各话,是概念混乱的根源。

但是,如果真的要去论,其实需要回答:高质量由谁来检验、用什么检验?的问题,如下:
图片
图片

检验的问题是最重要的,六个视角沿检验方式之轴依次排列:政策定义要求最高标准(性能提升),学术运动把它落实为实验协议,国际标准退化为符合性清单,媒体定义放弃检验,行业定义退守到交付验收,但是,在这里,可以定义为把检验做成持续运行的工程机制

概念捋清楚的第一步,是承认高质量数据集在不同语境下是六个不同的概念都叫一个名字,但什么算数完全不同。

特别值得注意的是,政策定义中的能有效提升模型性能,这是结果导向的定义:数据集的质量最终由模型性能提升来检验,而不是由数据集自我声明来证明。但工程上必须要明白的是,用性能检验质量的前提是有可重复的评测体系,没有Golden Set与版本门禁的团队,拿什么去接住政策定义里的这句承诺?所以这个一点,其实在很多地方都是悖论,可复用的评测往往是很难做到的。

所以说,这里可以做个一个更全貌的定义。高质量数据集的全貌是:经过采集、加工、评测,可用于模型训练并经验证能提升性能的数据集合;按知识深度分为通识、行业通识、行业专识三层;其质量用八维指标度量,其价值用模型性能与业务效果检验。

图片
图片

如果要用一句话来说明,那就是:高价值、高密度、标准化的数据;工程版本:可计算、可审计、可追溯的数据资产。

END——关于我们

← 返回资讯动态