🤔 Аналитический кластер не всегда выгодно масштабировать целиком
Когда объем данных растет — нужно больше дисков. Если становится много тяжелых запросов — нужны дополнительные CPU. В ситуации, когда хранение и вычисления жестко связаны внутри одного кластера, вместе с нужным ресурсом приходится наращивать и второй.
➗Разделение compute и storage позволяет масштабировать их независимо. Данные остаются в общем слое хранения, например S3, а для обработки можно использовать отдельные вычислительные кластеры и движки. Такой подход лежит в основе современных Data Lakehouse-архитектур.
Что меняет разделение compute и storage:
🔹 под тяжелую обработку можно добавить compute, не расширяя хранилище
🔹 рост объема данных не требует одновременно покупать дополнительные вычислительные мощности
🔹 разные инструменты могут работать с одним набором данных без создания отдельных хранилищ
🔹 вычислительные ресурсы проще распределять между ETL, BI, ad hoc-запросами и другими нагрузками.
Важно учитывать, что данные передаются между storage и compute по сети, поэтому на производительность влияют пропускная способность, задержки и организация доступа к данным.
В статье VK Cloud разбираем, когда разделение compute и storage действительно нужно аналитической платформе, что оно дает и какие архитектурные компромиссы приходится учитывать.
Когда объем данных растет — нужно больше дисков. Если становится много тяжелых запросов — нужны дополнительные CPU. В ситуации, когда хранение и вычисления жестко связаны внутри одного кластера, вместе с нужным ресурсом приходится наращивать и второй.
➗Разделение compute и storage позволяет масштабировать их независимо. Данные остаются в общем слое хранения, например S3, а для обработки можно использовать отдельные вычислительные кластеры и движки. Такой подход лежит в основе современных Data Lakehouse-архитектур.
Что меняет разделение compute и storage:
🔹 под тяжелую обработку можно добавить compute, не расширяя хранилище
🔹 рост объема данных не требует одновременно покупать дополнительные вычислительные мощности
🔹 разные инструменты могут работать с одним набором данных без создания отдельных хранилищ
🔹 вычислительные ресурсы проще распределять между ETL, BI, ad hoc-запросами и другими нагрузками.
Важно учитывать, что данные передаются между storage и compute по сети, поэтому на производительность влияют пропускная способность, задержки и организация доступа к данным.
В статье VK Cloud разбираем, когда разделение compute и storage действительно нужно аналитической платформе, что оно дает и какие архитектурные компромиссы приходится учитывать.