Data Quality круг Громова — исследование российских решений для управления качеством данных
Подробный анализ российских DQ-систем. Рассмотрены технические характеристики — архитектура, алгоритмы профилирования и очистки, особенности интерфейса. Проанализированы модели лицензирования от разных вендоров. Проанализирован функционал систем и инструменты управления качеством данных. Независимыми экспертами проведено тестирование и оценка систем по чек-листу, включающему более 150 критериев. По результатам выявлены сильные и слабые стороны, определены лидеры рынка. Даны рекомендации по выбору оптимальной платформы с учётом задач и бюджета компании.
Также вендоры оценивались по ключевым критериям, среди них:
- Архитектура и развёртывание: on-premise, облако и гибридные сценарии, контейнеризация (Kubernetes/OpenShift), масштабируемость, отказоустойчивость, поддержка российских ОС (Astra Linux, ALT, РЕД ОС).
- Профилирование и правила качества: статистическое профилирование, семантическое распознавание (ИНН, адрес, телефон), библиотека типовых проверок, визуальный конструктор правил, версионирование.
- Очистка и обогащение: стандартизация ФИО/адресов/телефонов, поиск и объединение дубликатов (fuzzy/ML matching), адресная валидация по ФИАС/КЛАДР, автоматическое исправление по правилам.
- Мониторинг и аналитика: контроль свежести и объёма данных, выявление аномалий, отслеживание изменений схемы, управление инцидентами, дашборды по доменам.
- Интеграции и API: коннекторы к СУБД, lakehouse, Kafka, REST/GraphQL API, интеграция с BI, MDM, Data Catalog, CI/CD-пайплайнами, поддержка lineage (OpenLineage).
- Безопасность и комплаенс: SSO (OIDC/SAML/LDAP), шифрование, маскировка ПДн, row-level security, аудит действий, соответствие 152-ФЗ, интеграция с SIEM.