# 什么是数据质量?数据质量的问题是怎么来的? **来源**: 上海维驰数码科技有限公司 (https://www.weichikeji.cn) **分类**: 资讯 **发布日期**: 2026-09-09 --- ![图片](/img/i20260909032210911@orig.jpeg) 从“数据准不准”追溯到“数据是怎样被生产出来的”数据质量,是数据治理中最常被讨论的问题之一。 但在很多实际项目中,数据质量又往往是一个被过度简化的问题。人们一提到数据质量,首先想到的通常是空值、重复值、错误值、格式异常,进一步再想到准确性、完整性、一致性、及时性等质量指标。 于是,数据质量治理也很容易被理解成一套技术动作:配置质量规则、扫描数据库、发现异常、形成问题清单,再推动相关部门整改。 这些工作当然有必要,但它们主要解决的是一个问题:数据出了问题以后,怎么把问题找出来。 真正更值得追问的是另外两个问题:什么样的数据,才算真正的高质量数据?以及,这些数据质量问题,究竟是怎么产生的? 只有把这两个问题解释清楚,才能进一步理解为什么很多企业的数据质量治理反复开展,数据问题却依然不断出现。 ## 一、数据质量首先要回答:数据有没有正确表达业务事实 理解数据质量之前,首先要理解数据是怎么来的。 企业中的数据并不是天然存在的。客户、企业、人员、设备、项目、订单、合同、监测点、污染源,这些首先都是现实业务世界中的对象。业务活动发生以后,对象的属性、状态、行为和关系,才通过人工录入、设备采集、业务系统记录、接口交换等方式被转化为数据。 因此,数据本质上承担的是一种表达功能:用数字世界中的记录,表达现实世界中的业务事实。从这个角度看,判断数据质量的第一层标准,并不是数据库字段是否合法,而是:数据有没有正确表达它所对应的业务对象和业务事实。 例如,一台设备实际上已经停运,但系统中仍然显示“运行中”。从技术角度看,这个字段不为空,数据类型正确,编码也符合系统要求,但它依然是一条错误数据。 再比如,一家企业已经完成名称变更,但不同业务系统分别保存着旧名称和新名称。单独看每个系统,数据都可能没有明显问题,但在企业级汇总、关联和统计时,就会出现冲突。 所以,我们通常所说的准确性、完整性、一致性、及时性、唯一性等指标,本质上都在从不同角度回答同一个问题:数据是否真实、完整、稳定地表达了业务事实。 这是理解数据质量的第一层。 ## 二、但“数据正确”并不等于“数据可用” 如果数据只是为了存储,那么“与事实一致”可能已经足够。 但企业生产数据的最终目的并不是把数据存起来,而是要使用这些数据。一份数据可能用于经营分析,也可能用于监管报送、风险判断、业务协同、模型训练或者智能体执行任务。不同的应用任务,对数据的要求并不相同。 例如,一个企业地址只记录到“上海市浦东新区”。如果只是用于分析客户在不同区县的分布,这样的数据可能已经足够;但如果要进一步进行园区级空间分析、精准配送或者环境风险定位,这样的数据粒度就明显不够。 再比如,一个设备故障时间只记录到某一天。对于年度故障次数统计而言,这可能没有问题;但如果要进一步分析故障发生前后的运行状态,或者建立预测性维护模型,这样的时间精度就无法满足要求。 因此,数据质量不是一个完全脱离使用场景的绝对概念。同一份数据,在一个任务中可能是高质量的,在另一个任务中却可能是不够用的。 于是,对数据质量的理解需要再向前一步:数据质量,不仅是数据对业务事实的正确表达程度,也是数据满足特定应用任务要求的程度。 这实际上形成了两个判断基准。第一个基准来自业务事实:它是不是真的?第二个基准来自应用任务:它够不够用?只有同时回答这两个问题,才能真正判断一份数据的质量。 ![图片](/img/imttj77ptqd) *图片* ## 三、我们平时看到的“数据问题”,大多数只是问题的表现 有了前面的定义,再来看企业中常见的数据质量问题,就会发现一个很有意思的现象。 我们平时看到的质量问题通常是:数据为空、数据重复、数值异常、字段冲突、指标对不上、关联不上、更新不及时、不同系统统计结果不一致。 这些问题非常具体,也很容易被发现。但它们往往只是结果。 例如,两个部门的客户数量统计不一致。最直接的处理方法,可能是把两个报表拿出来逐条核对。但继续往前追,会发现两个部门使用的“客户”定义可能并不相同。一个部门把所有注册用户都计算为客户,另一个部门只有在产生正式交易以后才认定为客户。 这时候真正的问题就不再是报表数字不同,而是:两个部门从一开始统计的就不是同一个业务对象。 所以,数据异常和数据质量问题的根因,并不是一回事。空值、重复、冲突、异常,只是问题最终表现出来的状态。 如果只围绕这些现象治理,就很容易陷入一种模式:发现什么问题,就修什么数据。结果问题解决了一批,过一段时间又会重新产生。 要真正解决数据质量问题,就必须继续向前追:这些问题究竟是在什么地方产生的? ![图片](/img/imttj792koo) *图片* ## 四、第一类问题:业务事实没有被正确记录 最直接的一类数据质量问题,发生在数据刚刚产生的时候。现实中的业务事实是明确的,但在进入信息系统时发生了偏差。 例如,业务人员录错了企业名称;设备传感器发生异常;应该填写的信息没有填写;业务状态已经变化,但系统中的状态没有及时更新;为了快速完成流程,操作人员选择了一个并不准确的默认值。 这种情况下,问题非常清楚:现实事实本身没有问题,但从现实世界映射到数据世界的时候发生了失真。 这是最典型的数据质量问题。但它同时揭示出一个非常重要的事实:很多所谓的数据问题,首先并不是数据部门的问题,而是业务过程的问题。 如果业务操作过程没有形成有效约束,那么错误数据从产生的一开始就已经进入了系统。后续再先进的数据质量工具,也只能发现已经发生的问题。 因此,数据质量控制的起点,实际上要前移到业务数据产生的过程。 ## 五、第二类问题:连“记录什么”都没有定义清楚 比录入错误更难治理的,是另外一类问题:数据没有录错,但大家对于“这到底是什么”没有形成一致认识。 例如,什么叫客户?注册用户是不是客户?发生过交易才算客户,还是形成有效商机就算客户?集团公司和下属子公司,是一个客户还是多个客户?什么叫有效设备?什么叫在运项目?什么叫重点企业? 这些问题看起来不像传统意义上的数据质量问题,但实际上,它们恰恰是很多企业数据冲突的源头。 如果业务对象本身没有被清晰定义,不同部门就会按照各自的业务逻辑建立数据。于是就会出现一种非常典型的情况:每个部门单独看都有道理,放在企业整体视角下却互相冲突。 此时,问题已经不是某一个字段的值错误,而是业务对象和业务语义没有统一。其形成路径往往是:对象定义不一致 →数据采集口径不一致 → 系统记录不一致 → 汇总统计不一致 → 最终形成质量问题。 这也是为什么真正的数据质量治理,不能只从数据库开始。在很多情况下,必须首先回到更上游的问题:这个对象究竟是什么? 只有这个问题被明确以后,才有可能继续回答:这个数据到底对不对? ![图片](/img/imttj79wc16) *图片* ## 六、第三类问题:原始数据是对的,但加工以后错了 即使对象已经定义清楚,数据采集也完全正确,问题依然可能产生。因为数据进入系统以后,还会经历大量加工。字段转换、格式转换、编码映射、单位换算、数据关联、指标计算、标签生成、主数据匹配、聚合统计,这些过程本质上都在重新生产数据。每进行一次加工,都意味着数据被重新解释一次。 如果加工规则发生偏差,新的质量问题就会产生。例如,一个系统中的金额单位是“元”,另一个系统使用“万元”;一个系统记录北京时间,另一个系统使用 UTC;同一个指标的计算规则已经改变,但历史数据没有重新计算;两个系统使用相同字段名称,但字段的真实业务含义并不相同;对象匹配规则不准确,导致同一个企业被识别成多个对象。 这类问题有一个共同特点:原始数据本身可能没有问题,但数据生产规则出现了问题。 所以,数据质量并不仅仅取决于数据值。它还取决于:数据按照什么规则被加工出来。 这也是为什么数据标准、元数据、加工规则和数据质量实际上是一套连续的问题。如果规则不可管理,数据质量就很难稳定。 ## 七、第四类问题:数据还在,但业务语义已经丢了 现代企业中的数据很少只停留在最初产生它的业务系统中。 数据通常会继续流动:从业务系统进入数据仓库;从数据仓库进入主题库;从主题库进入指标平台;再进一步形成数据产品、数据集,甚至作为模型训练和智能体运行的输入。 在这个过程中,数据会不断经历字段映射、结构转换、聚合计算和重新组织。流动得越远,一个新的问题就越容易出现:数据还在,但它最初代表什么,已经越来越难说清楚。 到了下游,经常会出现这样的情况:可以看到一个字段,却不知道这个字段最早从哪里产生;可以看到一个指标,却不知道经过了哪些计算;可以拿到一份数据集,却无法判断中间发生过哪些处理;数据虽然可以使用,却没人能够完整说明为什么应该相信它。 这时候,数据值本身甚至可能没有错误。但它已经缺乏足够的可信依据。 所以,对数据质量的要求还需要进一步提高。它不仅应该回答:这个值对不对?还应该回答:这个值为什么可信? 于是,质量自然开始和数据血缘、元数据、责任关系、加工过程以及质量证据发生联系。 一个真正可信的数据,不仅要正确,还应该能够说明:它从哪里来;由谁产生;经过什么加工;按照什么规则形成;在哪些环节被验证;出了问题应该追溯到哪里。 到了这一层,数据质量已经不再只是“数据值质量”,而开始进入“数据可信性”的问题。 ## 八、第五类问题:数据没有错,但业务已经变了 还有一类数据质量问题更加隐蔽。它并不是因为有人做错了什么,而是因为现实世界本身发生了变化。 企业业务会不断变化。组织结构会调整,产品会更新,业务流程会优化,政策要求会变化,系统也会不断迭代。 但数据定义、数据规则和质量规则,并不一定能够同步变化。 例如,过去某项业务只有三种状态。后来业务调整以后增加到了五种状态,但下游系统依然按照原来的三种状态进行处理。 这时候,没有人录错数据,程序也没有报错。但原来的规则已经不能正确表达新的业务现实。换句话说:过去正确的数据和规则,今天也可能变成低质量数据。 这说明数据质量还有一个非常重要的特征:它不是静态的。 数据质量必须随着业务、场景和任务的变化不断重新判断。所以,真正成熟的数据质量体系,不可能只建立一次规则就长期不变。它还必须具备反馈、调整和持续演化的能力。 ![图片](/img/imttj7bazeo) *图片* ## 九、到这里才能看清:数据质量问题究竟是怎么形成的 把前面的几类问题放在一起,会发现数据质量问题其实具有一个非常清晰的形成链条。 数据从现实业务中产生,然后不断被记录、加工、流转和使用:业务事实 → 对象定义 → 数据采集 → 系统记录 → 规则加工 → 跨系统流转 → 数据使用 → 业务反馈。 任何一个环节失去控制,都可能使数据逐渐偏离真实业务事实或者应用任务要求。 因此,企业最后看到的空值、重复值、错误值、冲突数据、异常指标,本质上只是这些过程缺陷最终沉淀到数据中的表现。 真正的因果关系应该是:数据生产过程存在缺陷 → 数据状态出现异常 → 下游应用结果出现问题。 这也是理解数据质量问题最关键的一步。因为一旦接受这个判断,就会发现:脏数据不是数据质量问题的原因,而是数据生产过程失控以后留下来的结果。 ## 十、为什么很多数据质量治理总是在反复? 现在再回头看传统的数据质量治理,就很容易理解为什么很多企业会陷入反复整改。 传统做法通常是:数据已经进入数据库;然后通过质量规则发现问题;形成问题清单;再推动业务部门修改数据。 这套方法实际处理的是:生产过程已经结束以后,对不合格结果进行返工。 它当然能够解决一部分问题。但如果真正产生问题的对象定义、业务流程、采集方式、加工规则没有发生变化,那么新的问题依然会继续产生。 今天把100条错误数据改对了。明天同样的业务流程可能继续产生新的错误数据。于是,数据治理逐渐变成:发现问题—整改数据—重新发现问题—再次整改。 长期下来,数据部门大量精力被消耗在“洗数据”上。但问题源头并没有真正改变。 这和工业生产中的质量管理非常相似。如果一条生产线不断制造不合格产品,仅仅增加最终检验人员并不能真正提高生产能力。真正需要调整的,是造成不合格产品的生产过程。 ![图片](/img/imttj7c8y4n) *图片* ## 十一、数据质量治理的重点,要从“修数据”逐渐转向“控过程” 因此,真正成熟的数据质量治理,需要经历一个明显的认知变化。 最初,企业关注的是:数据对不对。再进一步,会开始关注:数据为什么不对。而真正成熟以后,要进一步回答:怎样让数据持续保持正确。 这三个问题对应着完全不同的数据质量治理阶段。 初级的数据质量治理,是发现错误。进一步的数据质量治理,是修正错误。更加成熟的数据质量治理,是找到错误产生的环节并进行控制。真正工程化的数据质量体系,则是在建立一种能够持续生产可信数据的能力。 治理重点也会随之发生变化。在对象定义阶段,明确数据到底表达什么;在数据采集阶段,明确哪些信息必须被采集;在业务操作阶段,把必要校验嵌入流程;在数据加工阶段,明确并管理转换和计算规则;在数据流转阶段,保持语义、血缘和责任关系;在数据使用阶段,用真实任务检验数据是否满足要求;在发现问题以后,把问题反馈到真正产生问题的环节。 最终形成:定义 → 生产 → 校验 → 使用 → 反馈 → 修正,这样一个持续运行的闭环。 ## 十二、最终要治理的,不只是数据,而是数据生产过程 沿着这一逻辑继续往前,就会得到这篇文章最重要的结论。 企业真正需要治理的,并不仅仅是数据库中已经存在的数据。真正需要治理的是:这些数据是怎样被持续生产出来的。 一条可信的数据,应该能够回答:它表达什么业务对象;依据什么标准形成;从哪里采集;经过什么加工;由谁负责;在哪些环节进行了校验;当前质量状态如何;是否能够进入下一道数据生产环节;最终能够支撑什么业务和应用任务。 当这些问题逐渐变得清晰,数据就不再只是业务活动自然留下来的记录。它开始成为一种经过定义、生产、加工、控制、验证和反馈形成的工程化成果。 于是,数据质量治理的对象也随之发生改变:从数据值,走向数据问题;从数据问题,走向问题根因;从问题根因,走向生产过程;从生产过程,最终走向数据生产能力。 ![图片](/img/imttj7dmzj3) *图片* ## 结语:数据质量的最终目标,是稳定生产可信数据 所以,什么是数据质量?可以把它理解为:数据质量,是数据真实表达业务对象和业务事实,并能够满足特定应用任务要求的程度。 那么,数据质量问题又是怎么来的?它并不是简单因为数据库里面出现了“脏数据”。更准确地说:数据质量问题,是业务事实在被定义、记录、加工、流转和使用的过程中,因为对象定义不清、采集失真、加工规则失控、语义断裂或者变化不同步,使数据逐渐偏离真实业务事实和应用任务要求而形成的。 因此,数据质量治理也不应该长期停留在:发现问题、清洗数据、形成报告。它最终需要完成一个更深层次的转变:从治理错误数据,走向治理数据生产过程。 初级的数据质量治理是在发现错误。进一步的数据质量治理是在修正错误。成熟的数据质量治理是在控制错误产生的过程。而真正工程化的数据质量体系,则是在建立企业持续、稳定、可控、可追溯地生产可信数据的能力。 这才是数据质量治理真正需要达到的终点。 ## END——关于我们 ![图片](/img/i2026090903300081@orig.jpeg) --- **公司全称**: 上海维驰数码科技有限公司 **品牌名**: 维驰科技 **一句话定位**: ——数据资产化服务,高质量数据集、可信数据空间、模数空间建设运营,数据价值创造,Data Agent智能体与数智化生态体系建设/运营专属全案落地实施服务的行业引领者! **官网**: https://www.weichikeji.cn **核心业务**: 数据资产入表 | 可信数据空间建设 | Data Agent智能体 | 企业数智化转型 | AI解决方案 | 数据安全治理 本文由上海维驰数码科技有限公司发布,如需了解更多请访问官网 https://www.weichikeji.cn