1. Задача
Производственно-сбытовая компания обратилась к нам с задачей построить масштабируемое озеро данных на AWS для консолидации информации из множества внутренних систем. Сложность задачи заключалась в том, что источники данных были крайне разнородны: они работали на разных технологиях (MySQL, CSV, XML) и имели различные форматы и структуры, что не позволяло компании получать целостную картину по производству и продажам. Дополнительно требовалось интегрировать облачное решение с уже существующим локальным BI-сервером заказчика без остановки текущих бизнес-процессов.
2. Какие работы производились
• Спроектирована и развёрнута двухуровневая архитектура озера данных: Stage Data (слой сырых данных) → Transformed Data (слой очищенных и структурированных данных), что обеспечивает гибкость при подключении новых источников.
• Внедрён AWS Redshift в качестве основного аналитического хранилища для быстрых и сложных аналитических запросов.
• Реализованы ETL-процессы на AWS Matillion с использованием Python для автоматизации загрузки, трансформации и очистки данных.
• Настроены коннекторы к разнородным источникам: MySQL (операционные системы), CSV и XML (внешние и внутренние выгрузки).
• Выполнена интеграция облачного озера данных с локальным BI-сервером заказчика — обеспечена бесшовная передача подготовленных данных в существующую BI-инфраструктуру.
• Проведён аудит текущих источников данных и требований бизнес-подразделений к аналитике.
• Разработана архитектура с учётом перспектив роста: возможность масштабирования и подключения новых источников без перестройки ядра.
• Организована передача знаний команде заказчика по работе с новой платформой и ETL-процессами.
• Обеспечено сопровождение на этапе ввода в промышленную эксплуатацию, включая мониторинг корректности загрузки данных и стабильности интеграции с локальным BI.
3. Какие сложности возникали
Ключевой сложностью стала интеграция облачного озера данных с локальным BI-сервером заказчика: требовалось обеспечить непрерывность текущих бизнес-процессов и не допустить простоев в период миграции и настройки. Это потребовало тщательной оркестрации между командами заказчика, отвечающими за локальную инфраструктуру, и нашей командой, работающей над облачной частью.
Дополнительно пришлось решать задачу нормализации данных из принципиально разных форматов (MySQL, CSV, XML), где структуры и качество данных сильно отличались — потребовалась гибкая настройка правил трансформации на каждом уровне архитектуры и быстрая адаптация к неожиданным особенностям данных по мере их поступления.
4. Результат
• Создано единое хранилище данных, консолидирующее информацию из всех внутренних систем компании в одной точке
• Снижено время подготовки отчётности за счёт автоматизации ETL-процессов и предобработанных данных в аналитическом хранилище
• Обеспечена возможность подключения новых источников данных без перестройки существующей архитектуры
• Достигнута бесшовная интеграция облачного решения с локальным BI-сервером без нарушения действующих бизнес-процессов
5. Мнение клиента и планы
Заказчик высоко оценил результат: компания получила современную, масштабируемую аналитическую платформу, которая закрыла потребность в целостной картине по производству и продажам. Мы продолжаем взаимодействие с клиентом — обсуждаются дальнейшие шаги по развитию озера данных, включая расширение списка подключаемых источников и углубление аналитических сценариев на базе накопленных данных.