观点与分析

语义层作为降低数据风险的策略

文章认为,将指标定义、业务规则和访问点统一到一个语义层中,可以降低数字相互矛盾、治理薄弱以及变更无法在分析和人工智能工具之间生效的风险。但文章也强调,这一层无法修复糟糕的数据,也不能替代组织统一定义的承诺。

2026-07-31
1 分钟阅读
10 浏览量
فريق تحرير certi.news
语义层作为降低数据风险的策略

当不一致的数字传达到决策者手中、敏感数据泄露给未经授权的用户,或者指标变更未能传递到所有报告和工具时,数据风险就会转化为业务风险。文章提出,语义层是一种降低这些风险的实用手段:将指标定义、业务规则和权限置于一个中心位置,供不同工具调用。

本文讨论的并非与合规框架相关的抽象风险,而是关注可能不会立即显现的日常运营损失。例如,监管审计可能发现不同系统中的某项指标存在差异;董事会成员可能在连续两份报告中看到两个相互矛盾的收入数字;或者人工智能工具可能依据一组自创建它的分析师离职后便不再接受治理的数据,生成一项建议。

三个主要风险领域

文章指出,数据风险通常集中在三个相互关联的领域,组织可能同时面临这些风险。

  • 准确性:随着组织扩大对工具、仪表板和人工智能应用的使用,出错的空间也会扩大。收入指标可能在 Tableau 工作簿中采用一种定义,在 Power BI 模型中采用另一种定义,在 Python 笔记本中又采用第三种定义。这种差异不仅是技术上的不便,还可能导致错误的战略决策、资源配置不当、目标未能实现,以及对数据团队的信任下降。
  • 治理与访问:访问控制通常分散在数据仓库、商业智能平台、仪表板、云存储引擎和共享驱动器之间。每个系统都有不同的权限模型、管理界面和审计能力,形成了一个难以维护或可信审查的分散体系。敏感数据可能出现在不应显示它的仪表板中,这未必是恶意行为造成的,而可能是因为治理范围已经大到无法保持一致管理。
  • 变更管理:例如,首席财务官可能决定从下个季度开始,将试用客户排除在年度经常性收入指标之外。但实施这一变更可能需要修改数据仓库中的一个视图、两个 Tableau 工作簿、一个 Power BI 模型、一个由财务规划与分析团队管理的 Excel 报告,以及一个直接依赖数据湖的分析工具。如果其中一些元素没有更新,数字过一段时间后又会重新出现差异。

当指标缺乏治理、定义方式不一,并且无法从一个位置进行更新时,这些风险会进一步加剧。因此,问题并不一定在于变更本身错误,而在于它可能无法在整个系统的所有部分得到完整执行。

传统模式的局限

组织通常依赖一个由商业智能分析师组成的中央团队,作为访问指标、报告和仪表板的入口。用户提出新报告请求、指标变更请求,或要求解释两个数字之间的差异,然后等待请求得到处理。这种模式的形成,部分原因在于组织对自身数据缺乏足够信任,无法允许自助服务,但它也带来了明显成本:速度缓慢、请求积压、招聘成本,以及结果质量因分析师和所使用工具不同而产生差异。

随着访问控制、质量报告、数据来源追踪和业务负责人认定分散在多个工具和系统中,问题会进一步恶化。每个仪表板、数据源或新增平台都会扩大治理范围,增加规则可能发生差异的地点,并形成一个潜在故障点。因此,数据团队花在维护和纠错上的时间可能多于用于提供数据和洞察的时间。

统一定义与治理的一层

文章提出了一种不同的模式:将指标定义、商业逻辑和计算放在语义层中的一个位置。如果年度经常性收入指标只定义一次,Tableau、Power BI、Excel、Python 以及基于人工智能的对话工具就都可以以此为依据。当定义发生变化,例如排除试用客户时,变更会传递到下游工具,而不必手动寻找该指标逻辑的每个副本。

文章还将语义层与版本管理联系起来,从而可以追踪主要指标的版本,并了解某项指标在过去某个时间是如何计算的。与此同时,语义层可以成为受治理数据的中心访问点:团队仍然可以使用自己偏好的工具,而权限、定义和业务规则则从一个位置进行管理。这样,治理范围就能从数十个系统收缩到一个更加集中的位置。

所提出的益处并不局限于一致性。语义层可以在模型、列和指标本身之外,同时承载字段描述、指标定义、关系映射和业务规则。当数据上下文在数据所在的位置得到记录时,它就不再完全依赖分析师的记忆或可能没有更新的零散文档。这有助于实现自助服务,也使人工智能代理能够读取上下文,从更广泛的层面理解数据。

降低风险,而非消除风险

文章强调,语义层并非万能的解决方案。基础数据仍然需要保持清洁、有序并得到维护,“输入糟糕,输出糟糕”的原则依然成立。此外,统一指标定义需要组织层面的共识和领导层的承诺,而这是软件无法替代的。

但按照这一观点,语义层改变了风险管理的经济性。组织不必为了跟上每个数据源、仪表板和平台而不断增加员工和治理工具,而是可以减少逻辑可能偏离、变更可能丢失或难以审计的地点数量。风险管理也更容易控制,因为风险集中在一个位置,而不是分散在整个数据技术栈中。

对于依赖人工智能驱动分析的组织而言,这一点更加重要,因为这些工具需要经过治理且具备上下文的数据,才能生成值得信赖的输出。在文章看来,语义层不仅是提升一致性的架构改进,也是管理数据风险所需基础设施的一部分;在这种环境中,基于不可靠信息作出决策的成本正在加速上升。

新闻来源
Stack Overflow Blog
查看原始来源 ↗
ف
作者

فريق تحرير certi.news

同一分类

你可能还喜欢

查看所有新闻