Риски данных превращаются в бизнес-риски, когда до лиц, принимающих решения, доходят несогласованные числовые показатели, конфиденциальные данные становятся доступны неуполномоченным пользователям или изменения метрик не распространяются на все отчёты и инструменты. В статье семантический слой рассматривается как практический способ ограничить эти риски за счёт размещения определений метрик, бизнес-правил и разрешений в централизованной точке, к которой могут обращаться различные инструменты.
В статье рассматриваются не риски в абстрактном смысле, связанном с рамками соответствия требованиям, а повседневные операционные потери, которые могут проявиться не сразу. Регуляторная проверка может выявить различие в одной из метрик между системами, член совета директоров может заметить два противоречащих друг другу показателя выручки в двух последовательных отчётах, а инструмент искусственного интеллекта может выдать рекомендацию на основе данных, которые не подвергались управлению с момента ухода аналитика, создавшего их.
Три основные области рисков
Согласно статье, риски данных обычно сосредоточены в трёх взаимосвязанных областях, и организации могут столкнуться с ними одновременно.
- Точность: по мере того как организации расширяют использование инструментов, информационных панелей и приложений на основе искусственного интеллекта, увеличивается и пространство для ошибок. Метрика выручки может быть определена одним способом в книге Tableau, другим — в модели Power BI, а третьим — в записной книжке Python. Это различие является не просто техническим неудобством, а может привести к ошибочным стратегическим решениям, неправильному распределению ресурсов, недостижению целей и снижению доверия к команде данных.
- Управление и доступ: средства контроля доступа обычно распределены между хранилищем данных, платформами бизнес-аналитики, информационными панелями, облачными системами хранения и общими дисками. У каждой системы своя модель разрешений, интерфейс администрирования и возможности аудита, что создаёт разрозненную среду, которую сложно поддерживать или уверенно проверять. Конфиденциальные данные могут попасть на информационную панель, где их не должно быть, — не обязательно из-за злонамеренных действий, а потому, что область управления стала слишком широкой для согласованного администрирования.
- Управление изменениями: финансовый директор, например, может решить исключить пробных клиентов из метрики годового регулярного дохода начиная со следующего квартала. Однако для применения изменения может потребоваться изменить представление в хранилище данных, две книги Tableau, модель Power BI, отчёт Excel, которым управляет команда финансового планирования и анализа, а также инструмент аналитики, напрямую использующий озеро данных. Если некоторые из этих элементов не будут обновлены, через некоторое время числовые показатели снова начнут расходиться.
Эти риски усугубляются, когда метрика не регулируется, определяется по-разному и не может быть обновлена из одного места. Поэтому проблема не обязательно заключается в том, что само изменение неверно, а в вероятности того, что оно не будет полностью применено во всех частях среды.
Ограничения традиционной модели
Организации обычно полагаются на централизованную команду аналитиков бизнес-аналитики, которая служит шлюзом к метрикам, отчётам и информационным панелям. Пользователь запрашивает новый отчёт, изменение метрики или объяснение различия между двумя числовыми показателями, а затем ждёт обработки запроса. Эта модель отчасти возникла потому, что организации недостаточно доверяют своим данным, чтобы разрешить самообслуживание, однако у неё есть очевидные издержки: медлительность, узкие места в обработке запросов, стоимость найма сотрудников и различия в качестве результатов в зависимости от аналитика и используемых им инструментов.
Проблема усугубляется распределением средств контроля доступа, отчётов о качестве, отслеживания происхождения данных и определения владельцев бизнеса между несколькими инструментами и системами. Каждая информационная панель, источник данных или дополнительная платформа добавляет новую поверхность управления, ещё одно место, где правила могут различаться, и потенциальную точку отказа. В результате команды данных могут тратить больше времени на обслуживание и исправления, чем на предоставление данных и аналитических выводов.
Единый слой для определения и управления
В статье предлагается иная модель: разместить определения метрик, бизнес-логику и вычисления в одном месте внутри семантического слоя. Если метрика годового регулярного дохода определена один раз, на неё могут опираться Tableau, Power BI, Excel, Python и диалоговый инструмент на основе искусственного интеллекта. При изменении определения, например при исключении пробных клиентов, изменение передаётся последующим инструментам вместо ручного поиска каждой логической версии метрики.
Статья также связывает семантический слой с управлением версиями, что позволяет отслеживать версии ключевых метрик и узнавать, как метрика рассчитывалась в прошлом. Параллельно семантический слой может стать централизованной точкой доступа к управляемым данным, чтобы команды использовали предпочитаемые инструменты, а разрешения, определения и бизнес-правила управлялись из одного места. Благодаря этому область управления сокращается с десятков систем до более сфокусированной точки.
Предлагаемая польза не ограничивается согласованностью. Семантический слой может содержать описания полей, определения метрик, карты взаимосвязей и бизнес-правила наряду с самими моделями, столбцами и метриками. Когда контекст данных документируется там, где находятся данные, он перестаёт полностью зависеть от памяти аналитиков или разрозненной документации, которая может не обновляться. Это поддерживает самообслуживание, а также позволяет агентам искусственного интеллекта считывать контекст для более глубокого понимания данных.
Снижение рисков, а не их устранение
В статье подчёркивается, что семантический слой не является полным решением. Базовые данные должны быть чистыми, структурированными и поддерживаемыми, а правило «плохие входные данные — плохие выходные данные» по-прежнему действует. Кроме того, унификация определений метрик требует организационного согласия и приверженности руководства — того, что программное обеспечение заменить не может.
Однако семантический слой, согласно этому подходу, меняет экономику управления рисками. Вместо найма дополнительных сотрудников и внедрения новых инструментов управления для каждого источника, панели и платформы он сокращает количество мест, где логика может отклониться, изменение может потеряться или проверка может оказаться затруднительной. Управление рисками становится более контролируемым, поскольку концентрируется в одном месте, а не распределяется по всему стеку данных.
Это особенно важно для организаций, использующих аналитику на основе искусственного интеллекта, поскольку таким инструментам необходимы управляемые данные, сопровождаемые контекстом, чтобы они могли выдавать результаты, которым можно доверять. С точки зрения статьи, семантический слой представляет собой не только архитектурное улучшение согласованности, но и часть инфраструктуры, необходимой для управления рисками данных в среде, где стоимость решений, основанных на ненадёжной информации, растёт.