Классическая архитектура корпоративного хранилища данных строится из последовательных слоев: Raw (Staging) для сырых данных, ODS для очищенной операционной копии, DDS для детальной истории и витрин данных (Data Marts) для готовой аналитики. Для развертывания узлов хранения аналитических кластеров на технологиях Greenplum или ClickHouse подходят серверные платформы QTECH QSRV-2624B и QSRV-4624B с поддержкой SSD-кэширования и RAID 0, 1, 5, 6, 10, 50, 60.
Проектирование единого хранилища данных начинается не с выбора СУБД, а с определения слоевой структуры, через которую данные проходят путь от исходной системы до готового отчета. Разбитая на уровни архитектура упрощает отладку пайплайна: при ошибке на этапе агрегации не нужно заново выгружать данные из источника, достаточно перезапустить обработку от предыдущего слоя.
Ниже разобрана базовая архитектура DWH, назначение каждого слоя от Raw до витрин данных, популярные технологии построения хранилищ и требования к серверному оборудованию для узлов высоконагруженного аналитического кластера.
Базовая архитектура корпоративного хранилища данных
Единое хранилище данных редко строится как монолитная база — типовая архитектура разбивает обработку на последовательные слои, каждый из которых решает свою задачу и может использовать отдельную технологию хранения. Такое разделение изолирует источник данных от конечных аналитических витрин и позволяет масштабировать каждый слой независимо от остальных.
Минимальный работоспособный набор слоев обычно включает Raw для хранения исходных данных, детальный слой (DDS) для истории изменений и витрины данных (Data Marts) для готовой к использованию аналитики. Промежуточный слой ODS добавляется, когда данные поступают из нескольких разнородных источников и требуют предварительной интеграции перед попаданием в детальный слой.
Разбор слоев: от Raw (DAPP) до ODS и DDS
Слой Raw, также известный как Staging или DAPP, принимает данные из исходных систем в неизменном виде, без трансформаций и очистки. Такой подход обеспечивает возможность повторной обработки данных при обнаружении ошибок на следующих этапах пайплайна, поскольку исходная информация сохраняется в первозданном состоянии.
- Raw (Staging/DAPP): сырые данные из источников без трансформаций, минимальный срок хранения.
- ODS (Operational Data Store): очищенные и структурированные данные, приближенные к состоянию исходной системы.
- DDS (Detail Data Store): детальный слой с полной историей изменений, ядро хранилища для исторического анализа.
- Data Marts (витрины данных): денормализованные предметно-ориентированные срезы для конкретных подразделений — финансов, продаж, HR.
ODS-слой применяется преимущественно при интеграции данных из нескольких разнородных источников: он выполняет роль единой точки сверки данных до того, как они попадут в исторический слой DDS. Слой DDS строится по строгим правилам моделирования и хранит полную историю изменений, что делает его основным источником для построения витрин и OLAP-кубов.
Популярные технологии построения (Greenplum, ClickHouse)
Greenplum использует архитектуру MPP (Massively Parallel Processing), распределяющую обработку запроса между несколькими узлами кластера, что делает СУБД эффективной для сложных ETL-процессов и запросов с множественными джойнами между таблицами. ClickHouse построен на колоночном хранении данных и специализируется на быстрых агрегациях по огромным объемам записей, что оптимально для витрин данных с аналитикой в режиме, близком к реальному времени.
Инженеры отмечают, что на практике эти технологии часто комбинируют в рамках одной архитектуры DWH: Greenplum обслуживает слои ODS и DDS с интенсивной ETL-нагрузкой, а ClickHouse отвечает за слой быстрых витрин, к которому напрямую обращаются BI-системы. Такое разделение снижает нагрузку на детальный слой и ускоряет отдачу данных конечным пользователям отчетности.
Оборудование QTECH для высоконагруженных аналитических кластеров
Узлы MPP-кластера для Greenplum или ClickHouse требуют серверов с большим объемом оперативной памяти для параллельной обработки распределенных запросов и высокой пропускной способностью дисковой подсистемы для последовательного чтения больших объемов данных при построении витрин. Платформы хранения данных QTECH QSRV-2624B и QSRV-4624B построены на 4 процессорах Intel Xeon Cascade Lake Scalable с числом ядер до 20 и тепловым пакетом до 165 Вт; QSRV-2624B поддерживает до 16 модулей DDR4 RDIMM/LRDIMM частотой до 2933 МГц, QSRV-4624B — до 12 модулей DDR4 RDIMM/LRDIMM частотой до 3200 МГц.
| Слой DWH | Требования к нагрузке | Рекомендуемая платформа QTECH |
|---|---|---|
| Raw / Staging | Высокая пропускная способность записи, умеренная надежность | JBOD-полка QSRV-424-BKP (24 отсека SAS 2.0) |
| ODS / DDS | Интенсивный ETL, множественные джойны, RAID с высокой отказоустойчивостью | QSRV-2624B (RAID 0,1,5,6,10,50,60, SSD-кэширование) |
| Data Marts / витрины | Быстрые агрегации, низкая задержка отклика | QSRV-4624B (до 12 модулей DDR4 3200 МГц, SSD-кэш) |
Аппаратный RAID-контроллер платформ QSRV-2624B и QSRV-4624B с поддержкой уровней 0, 1, 5, 6, 10, 50, 60, B3, B30 и возможностью SSD-кэширования позволяет гибко распределять нагрузку между слоями хранилища: детальный слой DDS размещается на емких SAS-томах, а витрины данных ускоряются за счет SSD-кэша. Совместимость с гипервизорами VMware, Hyper-V, KVM, Proxmox и OpenStack упрощает развертывание отдельных узлов кластера в виртуализованной среде без выделения физического сервера под каждый слой.
Обязательно ли реализовывать все слои DWH одновременно?
Нет, минимальный работоспособный набор слоев для функционирования хранилища обычно ограничивается Raw, DDS и витринами данных, тогда как ODS добавляется по мере роста числа источников и усложнения интеграции. Решение о необходимости промежуточных слоев принимается на этапе проектирования исходя из числа источников и требований к скорости построения отчетов.
Можно ли использовать одну СХД для всех слоев DWH?
Да, платформы QTECH QSRV-2624B и QSRV-4624B поддерживают разделение RAID-томов внутри одной физической платформы, что позволяет размещать разные слои хранилища — от сырых данных до витрин — на одном сервере с выделением отдельных дисковых групп под каждую задачу. Такой подход снижает капитальные затраты на старте проекта DWH при сохранении возможности изолировать нагрузку слоев друг от друга.
Какая СУБД лучше подходит для слоя ODS: Greenplum или ClickHouse?
Для слоя ODS, где требуется интеграция данных из множества источников со сложными джойнами, предпочтительнее Greenplum за счет MPP-архитектуры и полноценной поддержки ETL-процессов. ClickHouse эффективнее применять на уровне готовых витрин, где преобладают быстрые агрегирующие запросы без сложных связей между таблицами.
Как масштабировать хранилище при росте объема данных DWH?
Масштабирование на уровне слоя Raw и ODS выполняется добавлением дисковых полок JBOD к существующим серверным платформам, что увеличивает емкость без замены основного контроллера. Для слоя вычислительной обработки MPP-кластера масштабирование происходит горизонтально — добавлением новых серверных узлов на базе платформ QTECH с идентичной конфигурацией.
Нужен ли отдельный сервер для каждого узла MPP-кластера Greenplum?
В классической конфигурации Greenplum каждый сегмент кластера размещается на отдельном вычислительном узле для обеспечения параллельной обработки запросов. Платформы QTECH серии QSRV с поддержкой виртуализации VMware, Hyper-V и KVM позволяют также разворачивать несколько сегментов на одном физическом сервере в виде виртуальных машин при менее требовательных нагрузках.

