Данные на стероидах


Гео и язык канала: Россия, Русский
Категория: Технологии


Команда Дата сервисов VK Tech о практиках и подходах для извлечения максимальной пользы из работы с данными. Если вам понадобится помощь с продуктами VK Tech, обратитесь к боту техподдержки в МАХ: @vktech_support_bot

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика

🗄 Российские компании пересматривают подход к хранению данных

Раньше работу с данными полностью делегировали инфраструктурным командам, а бизнес не погружался в детали. Сейчас парадигма изменилась: в 2026 году управление берут на себя сами компании. Делимся результатами исследования

🔹 Почему происходят изменения?

Согласно опросам, для 26% компаний основной предпосылкой для пересмотра модели хранения данных стал рост объемов информации, для 18% — начало работы с ИИ и появление аналитических нагрузок, для 17% — новые требования к производительности.

При этом более 60% используют или планируют внедрять российские решения, такие как VK Data Platform для управления данными или S3-объектное хранилище VK Object Storage.  

🔹 Как бизнес выбирает СХД?

Компании все чаще отказываются от типовых решений в пользу кастомизированных, заказчики собирают инфраструктуру как конструктор: под конкретный профиль нагрузки, целевые SLA, допустимые RTO/RPO.

При выборе платформы 38% в первую очередь обращают внимание на совместимость с существующей инфраструктурой, еще 28% — на надежность и доступность данных.

Смотрите карточки с результатами в графиках.


🗑 Как хранить данные, если пока неизвестно, когда их можно удалить   

Облачная платформа Amazon Web Services добавила
в объектное хранилище S3 новый сценарий для Object Lock — event-based retention. Он позволяет отсчитывать срок хранения файла от бизнес-события.

Зачем это нужно

Срок хранения некоторых данных зависит от внешнего процесса. Например, материалы расследования нужно сохранять до его завершения, а затем еще установленный период.

Как работает event-based retention

«Lifecycle и фиксированный срок хранения работают по схеме "загрузили → прошло N дней → удалили". При event-based retention объект защищен event hold, пока событие не наступило. После снятия hold стартует заранее заданный WORM-период, который уже нельзя сократить», — Елизавета Белоконова, менеджер продуктов VK Tech.


Кто должен снимать hold?

Главное правило — это не должен быть владелец файлов, иначе он фактически сможет сам запустить отсчет до их удаления. Это стоит выделить в отдельную compliance- или ИБ-функцию.


📚 Коротко о Data Lakehouse

В предыдущих постах разобрали:

→ почему классического DWH стало не хватать
→ зачем появился Data Lake
→ как устроен Lakehouse-контур

💬 А теперь главный вопрос: что Data Lakehouse дает бизнесу и команде?

Экономика Lakehouse строится на разделении хранения и вычислений: основной массив данных остается в объектном хранилище, а compute подключается под конкретные задачи. На больших объемах это может быть заметно дешевле, чем хранить все данные в DWH на SSD/NVMe. Но итоговую экономику нужно считать по профилю нагрузки: объему данных, SLA, частоте запросов, горячим витринам и трафику.

По производительности Lakehouse нельзя оценивать одной формулой. Для части сценариев он сопоставим с DWH или быстрее, для других нужен отдельный горячий слой, например в ClickHouse.

Lakehouse особенно полезен для ML и AI. Агентные системы могут создавать большие объемы логов, промежуточных данных и результатов работы, которые нужно хранить, анализировать и использовать повторно. Lakehouse дает для этого масштабируемый и экономичный слой хранения, версионирование данных и единые политики, определяющие, к каким данным может обращаться каждый агент.

Переход на Lakehouse стоит оценивать под конкретную нагрузку. В отдельной статье разобрали, когда он оправдан, как посчитать TCO и спланировать миграцию.

Читать →


💻 Как превратить внедрение ИИ из хаоса в систему

ИИ вошел в рабочие процессы раньше, чем компании успели установить для него правила. Согласно исследованию MIT
, 90% сотрудников регулярно используют личные аккаунты для рабочих задач, тогда как официальная корпоративная подписка на большие языковые модели есть только у 40% компаний.

Такой стихийный подход приводит к тому, что до 95% корпоративных пилотов генеративного ИИ не дают измеримой отдачи.

Задача бизнеса — перейти от хаоса к порядку. Для этого нужен корпоративный ИИ, встроенный в защищенный контур компании. Такой подход гарантирует главное: конфиденциальные данные не передаются вовне в открытом виде или остаются внутри, а компания сохраняет полный контроль.


Для того чтобы создать корпоративный ИИ, необходимо выстроить единую инфраструктуру для разработки и запуска агентов внутри компании. Такой контур должен иметь несколько ключевых свойств:

🔹 изоляция на уровне архитектуры: для каждого агента заранее задаются доступные системы, данные и разрешенные действия

🔹 прозрачность работы: видно, что агент планировал, какие инструменты использовал и какой результат получил

🔹 хуки: жесткие правила поверх промптов автоматически срабатывают в контрольных точках, например требуют согласования с человеком

🔹 общая библиотека навыков: инструкции и правила для конкретных задач можно переиспользовать между агентами, превращая отдельные практики в стандарт.

Мы реализовали этот подход в нашей платформе VK AI Space — агент получает задачу, сам планирует шаги, работает с корпоративными инструментами и адаптируется к новой информации, но не выходит за границы отведенной ему зоны.


👉 Переходим от теории к практике и показываем, из каких компонентов собирается Data Lakehouse.

Платформу данных с архитектурой Data Lakehouse можно собрать на базе VK Data Platform. Данные хранятся в формате Parquet в VK Object Storage с S3-совместимым API, а табличный слой работает на Apache Iceberg. Для обработки можно подключать разные вычислительные движки в зависимости от задачи.
 
🎛 Согласованный доступ движков к таблицам обеспечивает собственный Iceberg REST-каталог на базе доработанного Lakekeeper. Он также централизованно управляет правами вплоть до данных в S3. Политики действуют сквозным образом, поэтому их нельзя обойти через другой движок или прямое обращение к хранилищу.

Такой подход помогает собрать один контур данных для BI, аналитики и ML, не размножая лишние копии и не завязывая все сценарии на одну систему.

📃 Как выбрать технический каталог для Lakehouse, разобрали отдельно: сравнили девять решений по 14 критериям. Подробности — по ссылке →


Нужно ли выбирать между Data Mesh и Data Fabric?

Когда данных становится больше, вопрос уже не только в том, где их хранить. Нужно понять, кто за них отвечает и как сделать их доступными для других команд и систем.

Отсюда возникают две разные, но связанные задачи: распределить ответственность за данные и организовать единый доступ к ним. Именно для этого используют Data Mesh и Data Fabric.

🔹 Data Mesh — это подход, при котором ответственность за информацию распределяется между бизнес-доменами, а не концентрируется в одной дата-команде. Например, маркетинг сам следит за качеством своих данных: описывает, обновляет и передает другим командам как data-продукт.

🔹 Data Fabric — это технологический слой, обеспечивающий доступ к данным. Он связывает распределенные источники и помогает находить, интегрировать и использовать информацию независимо от того, где она физически находится.

Поэтому выбирать необязательно: Data Mesh и Data Fabric решают разные задачи и могут работать вместе.

➡️ В новой статье VK Cloud подробнее разбираем оба подхода и их место в архитектуре данных.


🤖 Чему нас учит история с моделью OpenAI, которая в процессе обучения сформировала для себя инструкции о неподчинении корпорациям и государственным структурам? 

А вот чему: 

ИИ-агент не должен самостоятельно определять границы собственной ответственности. Их должна задавать организация.

По мере роста автономности ИИ-агентов вопрос безопасности нельзя сводить только к качеству самой модели. Для корпоративного использования критически важно, чтобы агент:

🔹 работал в заданном контуре
🔹 имел ограниченный набор полномочий
🔹 не мог самовольно расширять область применения
🔹 выполнял действия, которые можно проверить и при необходимости остановить.

Иначе — даже без злого умысла со стороны разработчиков — система может выйти за рамки бизнес-сценария, для которого ее создавали.

Что у нас в VK Tech? 

В VK AI Space агент работает в изолированном контейнере — собственной зоне ограниченной автономности. Уже на этапе тестирования ему дается доступ только к явно разрешенным системам и данным. Критические и необратимые действия всегда проходят подтверждение человеком — независимо от уверенности модели.

Значит ли это, что каждое решение агента должен утверждать человек?

Нет — тогда теряется весь смысл автономности. Это значит, что границы, в которых агент действует самостоятельно, всегда задает организация, а не сам агент по ходу работы. И ответственность за то, что происходит, остается за компанией, а не за моделью.

📃 Читайте колонку Романа Стятюгина на vc.ru.


❓Как использовать на 50% меньше дисковой емкости без снижения надежности

При тройной репликации каждый объект хранится в трех экземплярах, поэтому на 1 ПБ данных требуется 3 ПБ дисковой емкости. Такой подход к отказоустойчивости заметно увеличивает требования к инфраструктуре и ее стоимость.

В VK Object Storage для On-Premise теперь доступен Erasure Coding x1,75. Вместо нескольких полных копий система хранит данные вместе с дополнительными фрагментами для восстановления.

Что это меняет для бизнеса:

🔹 на 1 ПБ полезных данных требуется около 1,75 ПБ дисковой емкости вместо 3 ПБ при тройной репликации

🔹 в одном из реализованных сценариев при эквивалентной надежности требуемая емкость составила 5,3 ПБ вместо 10,5 ПБ

🔹 Erasure Coding позволяет пережить одновременный отказ как минимум двух дисков, а в конфигурации из трех и более ЦОДов при аварии одного дата-центра данные остаются доступны для чтения.

Для компаний с крупной On-Premise инфраструктурой это позволяет иметь меньше дисков и серверного оборудования в закупке без снижения требований к надежности. Особенно эффект заметен для банков, госсектора и других организаций, работающих с большими объемами данных.

Есть и еще одна практическая польза: Erasure Coding входит в обязательные требования многих тендеров и RFI на S3 On-Premise. Без его поддержки решение в части закупок не проходит технический отбор.

Теперь этот сценарий поддерживает и VK Object Storage.


Видео недоступно для предпросмотра
Смотреть в Max
Роман Стятюгин, директор по AI-продуктам VK Tech, показал, как сотрудники могут работать с ИИ-агентами в привычном интерфейсе — через веб-чат и ботов 👆


Видео недоступно для предпросмотра
Смотреть в Max


Продолжаем трансляцию VK Workspace Сonf 2026. Говорим про ИИ в рабочей среде 🤖

Дмитрий Меркушов, руководитель ML-направления VK Tech, и Сергей Харламов, руководитель отдела AI VK Tech, показывают возможности ИИ-ассистента VK WorkSpace: как он находит нужное в переписке, учитывает права доступа и формирует ответы со ссылками на источники.

Вы узнаете, как VK WorkSpace может работать с внешними агентами, и раскроют подробности про автоматизацию через MCP.

Смотрите трансляцию по ссылке ➡️
VK WorkSpace conf 2026
Смотрите прямую трансляцию от автора «VK WorkSpace» на VK Видео. Конференция о том, как устроена работа команд в цифровой среде — и как сделать ее лучше 23 сентября, 11:00–18:15 Офлайн в Москве / онлайн Собираем тех, кто строит ...
VK Видео


Репост из: VK WorkSpace
На VK WorkSpace Conf 2026 мы представили новые возможности цифровой среды VK WorkSpace для совместной работы внутри компаний и с коллегами из других организаций

🤝 Расширили сценарии работы сотрудников из разных корпоративных доменов

В облачной версии платформы компании смогут объединять в единый тенант неограниченное число доменов одной организации. Сотрудники объединенных доменов смогут общаться друг с другом в Мессенджере и Видеоконференциях.

В On-Premise-версии уже доступна федерация между любым количеством инсталляций, использующих версию VK WorkSpace 26.2 и выше.

💙 Представили новые возможности сервисов

— В Диске VK WorkSpace реализовали настройку прав на просмотр, редактирование и комментирование документов, а также возможность ограничить срок действия ссылки и защитить ее паролем.

— Календарь VK WorkSpace позволяет сотрудникам делиться рабочим расписанием встреч, отражающим актуальную занятость без раскрытия конфиденциальной информации о встречах.

— В Доске VK WorkSpace при гостевом доступе можно дополнительно защищать доски паролем. Функция уже доступна в SaaS и до конца года будет реализована в On-Premise.

⚙️ Обновили технологическую архитектуру On-Premise-версии

Платформа переходит с инфраструктуры на базе Docker Compose на Kubernetes. В графическом инсталляторе появился механизм, который позволяет пошагово перевести существующую инсталляцию на Kubernetes через веб-интерфейс.

Изменится и процесс развертывания платформы. В инсталляторе обязательным этапом стали автоматические проверки инфраструктуры заказчика на соответствие системным требованиям VK WorkSpace. Для настройки виртуальных машин также появятся готовые рекомендуемые конфигурации, при этом возможность задать параметры вручную сохранится.

🤖 Реализовали ИИ-сценарии

В Мессенджере, Видеоконференциях, Почте, Календаре и Диске появятся новые функции на базе искусственного интеллекта. Компания также представила ИИ-Ассистент VK WorkSpace и MCP-сервер для подключения ИИ-агентов.

Спасибо, что следите за новостями вместе с нами! VK WorkSpace Conf 2026 продолжается.


Через 10 минут начинаем VK WorkSpace Conf 2026 🔥

Подключайтесь к онлайн-трансляции и задавайте вопросы экспертам под роликом в VK Видео или в чат-боте в MAX.

До встречи в эфире 👋


🗄 Data Lake появился так: сырые данные, логи и историю стали складывать в более дешевое хранилище, а обрабатывали их отдельными вычислительными движками по мере необходимости.

Data Lake помог разгрузить DWH, но без табличного слоя озеро быстро рисковало превратиться в болото: данные лежат, но не всегда ясно, какая версия актуальна, кто что изменил и можно ли на этом стабильно строить BI и ML.

В итоге вместо одного контура компании получали два, а еще — новые копии данных, новые пайплайны и риск превратить озеро в болото файлов, на котором сложно построить BI и ML.

Ответом стала архитектура Data Lakehouse. Хранение больших объемов данных оставалось в объектном хранилище, а поверх файлов формировался управляемый табличный слой — с метаданными, версиями таблиц, транзакциями и согласованным доступом для разных движков.

Так слой данных превратился из архива в полноценный рабочий контур: для SQL-аналитики, ETL/ELT, BI-витрин, ad-hoc-запросов и подготовки данных для ML/AI.


Когда S3-хранилище растет, метаслой приходится развивать вместе с ним.

Чем больше данных, нагрузки и функциональности, тем сложнее масштабировать систему, если хранение метаданных тесно связано с бизнес-логикой.

На SmartData 2026 эксперт VK Tech Иван Найденов расскажет, как команда пересматривала архитектуру собственного S3-совместимого хранилища и почему решила разделить метаслой и прикладную часть системы.

В докладе Иван разберет:

🔵 почему для взаимодействия выбрали асинхронный подход
🔵 как при такой архитектуре работать с согласованностью данных, идемпотентностью и порядком операций
🔵 что происходит при частичных отказах и как система после них восстанавливается
🔵 по каким требованиям выбирали новое хранилище метаданных и на какие компромиссы пришлось пойти.

🗓 23 сентября
📍 SmartData 2026, зал 3

Подробнее о выступлении и участии в конференции по ссылке.


🗄 Что учесть при выборе хранилища, кроме цены и скорости?

Почти любое хранилище предстоит расширять и обновлять в процессе добавления данных. Поэтому еще до покупки стоит выяснить, сколько будет стоить рост объема данных и как система поведет себя при отказе диска или сети.

Об осознанном выборе платформы хранения на эфире AM Live 11 сентября рассказала Екатерина Канунникова, директор по продуктам дата-сервисов VK Tech. Если пропустили — смотрите запись по ссылке.

В карточках собрали главное из выступления Екатерины ⬆️


Долгие годы основой корпоративной аналитики было централизованное хранилище Data Warehouse (DWH), куда данные попадали уже очищенными и подготовленными. По ним можно было сразу строить отчеты. На основе DWH собирали витрины и отдавали их в BI-системы — инструменты, которые превращают данные в наглядные отчеты и дашборды для бизнеса.

Такая схема хорошо работала для регламентной отчетности. Но объем и разнообразие данных росли: в хранилище начали складывать сырые события, логи, многолетнюю историю, датасеты для ML. 

DWH становился все менее удобным для таких сценариев, потому что:

🔹 хранение дорожало
🔹 расширять кластер становилось сложнее
🔹 тяжелые расчеты и разовые запросы аналитиков конкурировали с отчетностью за ресурсы
🔹 под каждый новый сценарий приходилось готовить данные и дорабатывать пайплайны.


Поэтому появился другой подход: не переносить все в дорогой DWH, а построить рядом Data Lake — озеро данных. Но и его на все не хватило. 

🔥 — если будете ждать подробностей


Видео недоступно для предпросмотра
Смотреть в Max
Как современный S3 защищает, сжимает и реплицирует данные

Simple Storage Service долго использовали довольно прямолинейно: хранили в нем бэкапы, архивы и данные для Data Lake, обращаясь к ним через единый API. Но чем важнее становились данные в объектном хранилище, тем больше требований стало предъявляться к самому S3.

1️⃣ Простого копирования уже недостаточно. Если объект удалили или зашифровали, версионирование позволяет вернуться к предыдущей версии, а Object Lock дает возможность заранее запретить изменение и удаление данных на заданный срок. Даже для администратора.

2️⃣ Параллельно оптимизируется и физическое хранение — сжатие уменьшает объем отдельных объектов, а дедупликация не дает повторно записывать одинаковые данные. Это может сократить занимаемое место примерно на 20%.

3️⃣ Следующий уровень — отказоустойчивость. Записи можно синхронно распределять между дисками, серверами и удаленными ЦОДами. А чтобы такой кластер оставался согласованным при сбоях, используются Raft, etcd.

Быстрое и надежное S3-совместимое объектное хранилище с высокой степенью защиты данных есть у VK Cloud.

Про место S3 в современной корпоративной архитектуре читайте на Хабре VK Tech.


🤖 Инфраструктура для ИИ уже готова. Как начать внедрение?

17 сентября на ИТ-практикуме DEPO «ИИ-инфраструктура: от архитектуры до внедрения» Дмитрий Багрий из VK Tech расскажет, как связать функции ИИ-агентов с привычными сервисами сотрудников. 

Также эксперты обсудят:

🔹 требования ИИ-нагрузок к GPU, памяти, хранению и энергоэффективности
🔹 реальные кейсы подбора архитектуры и оборудования
🔹 работу высокопроизводительных хранилищ с обучающими датасетами.

Подключайтесь к онлайн-эфиру и задавайте вопросы спикерам. Участникам будет доступна запись и материалы докладов.

📅 17 сентября, 14:30 мск
➡️ Регистрируйтесь на онлайн-трансляцию


Что дают навыки ИИ-агентов в продакшене

В октябре 2025 года Anthropic представила формат Skills, а в декабре открыла спецификацию и SDK. Формат поддержали Microsoft, OpenAI, GitHub, Atlassian, Figma и Cursor. К сентябрю 2026 года каталог навыков на GitHub собрал больше 170 тысяч звезд на GitHub.

За цифрами — важный сдвиг в архитектуре корпоративного ИИ.

Навык фиксирует порядок работы с корпоративными данными. По сути, это инструкции, которые затем можно использовать в разных агентных сценариях. Например, в VK AI Space навык заводить задачу в таск-трекере подключен одновременно к боту поддержки и ассистенту-расшифровщику диалогов.

Как реализация навыков меняет работу ИИ в компании:

🔹 хуки останавливают выполнение при нарушении бизнес-правил — например, если агент пытается предложить скидку выше разрешенного лимита
🔹 изолированное выполнение ограничивает действия во внешних системах
🔹 сквозной трейсинг фиксирует шаги агента, обращения к модели и API, время выполнения и расход токенов
🔹 разграничение доступов определяет, какие данные и операции доступны агенту в конкретном сценарии.

Роман Стятюгин, директор по ИИ-продуктам VK Tech, в колонке для РБК разбирает, почему навыки превращают корпоративную экспертизу в переносимый актив и как вокруг него строится управляемая агентная архитектура.

➡️ Прочитать полную версию колонки можно по ссылке.

Показано 20 последних публикаций.