Data Science: SQL и Аналитика данных


Гео и язык канала: Россия, Русский
Категория: Технологии


На простом языке: про работу с данными, современные технологии, AI, машинное обучение и, немного, SQL.
Менеджер: https://vk.cc/cUAKaQ

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика

🔥 Tabularis - единое open-source приложение для работы с SQL

Если приходится постоянно переключаться между разными клиентами для PostgreSQL, MySQL и SQLite, Tabularis собирает всё в одном desktop-приложении.

Что умеет:

⏺️ PostgreSQL, MySQL/MariaDB и SQLite из коробки
⏺️ SQL notebooks с Markdown, результатами и графиками
⏺️ визуальный конструктор запросов
⏺️ Visual EXPLAIN с интерактивным разбором query plan
⏺️ переменные между ячейками
⏺️ MCP-сервер для AI-агентов
⏺️ расширение поддержки других БД через плагины

Подходит как единое рабочее место для аналитики, разработки и отладки SQL.

Apache 2.0.


🔥 Исследователи нашли способ сократить расход токенов ИИ-агентов в 50 раз

Исследователи из Google и Университета Пердью представили (https://arxiv.org/html/2608.26263) SKILL.state — новый подход к памяти агентов. Обычно во время длинных задач агент тащит за собой всю историю действий, из-за чего контекст безжалостно и неумолимо разрастается.

Здесь же смысл в том, что вместо всей истории сохраняется только структурированное текущее состояние: важные факты, прогресс и данные, необходимые для следующего шага.

Остальные, промежуточные рассуждения удаляются.


Погружаемся с головой в сложный мир IT-компаний — команда Cloud․ru не просто пишет отчеты о своей работе, а делает ламповый и годный контент про ИИ, облако и инфраструктуру.

За 7 лет ребята выпустили более 130 сервисов, обзавелись своим публичным облаком Cloud․ru Evolution, платформой для частных и гибридных сред и крутой песочницей для генеративных нейросетей. А еще в их рядах уже 2000+ профи.

В соцсетях они щедро делятся экспертизой, свежими новостями, живым опытом команд и рассказывают, как на самом деле дышит IT-индустрия изнутри.

Подписывается и читаем — здесь.


SQL-запрос внезапно стал медленным? Проверь не только индексы, но и статистику

Оптимизатор выбирает план запроса на основе статистики по данным. Если она устарела, база может решить, что строк мало, выбрать Nested Loop и в итоге прогнать миллионы сравнений.

В PostgreSQL быстро обновить статистику можно так:


ANALYZE users;


А проверить, насколько оценки оптимизатора отличаются от реальности:


EXPLAIN (ANALYZE, BUFFERS)
SELECT *
FROM users
WHERE status = 'active';


Смотри на разницу между rows= и actual rows=.

Если PostgreSQL ожидал 100 строк, а реально получил 500 000, проблема может быть не в индексе, а в плохой статистике.

Особенно часто это всплывает после массовых INSERT, UPDATE, импорта данных или резкого изменения распределения значений.


Одна строка в конфиге ускорила production-ответ с 126–230 мс до менее чем 9 мс

Paweł Urbanek собрал очень практичный гайд по профилированию Rust, где оптимизации идут не по принципу «что интереснее», а по реальной отдаче.

Из кейсов:

N+1 SQL → 21 запрос превратили в один JOIN, функция ускорилась со 104 до 70 мкс.

Три последовательных HTTP-вызова → tokio::try_join!, итоговое время почти вдвое меньше.

Неправильно настроенный Brotli в maplibre/martin → скорость была всего 27,9 KB/s. Одна правка конфига дала примерно 57x ускорение, а latency упала до <9 мс.

Ещё жёстче кейс с write lock, который держали на всём HTTP round trip. После переноса блокировки P95 для читателей рухнул с 1,11 секунды до 9,42 мкс.

И отдельная классика Tokio: unbounded channel молча накопил 73 сообщения, потому что consumer не успевал. Никакой ошибки, просто медленное движение к OOM.

Полезный порядок из гайда:

сначала SQL и HTTP, потом locks и channels, и только после этого CPU profiling.

Потому что один лишний поход в базу обычно стоит дороже, чем сотни мелких оптимизаций внутри hot loop.

➡️ hotpath.rs/blog/profiling-rust-guide


Один SQL-запрос выполнялся за 298 мс.

Почти такой же - за 0,66 мс.

Разница в 451 раз из-за одной строки.

Ситуация обычная: cursor pagination, сортировка по date DESC, id DESC, лимит на 1000 записей и composite index по (date, id). На первый взгляд, все должно работать быстро.

Но EXPLAIN ANALYZE показывает другое: Postgres вроде бы использует Index Scan, но после этого выкидывает 900 000 строк через Filter.

То есть индекс есть, но запрос все равно тащит слишком много лишнего.

Проблема в условии:

`date < @date OR (date = @date AND id <= @lastId)`

Для разработчика это выглядит логично: сначала сравниваем дату, потом id.

Но для оптимизатора такой OR плохо ложится на composite index. В итоге база не может сразу пойти по нужному диапазону и вынуждена фильтровать огромный кусок данных.

Правильнее записать условие через tuple comparison:

`(date, id) <= (@date, @lastId)`

Смысл тот же, но для Postgres это уже понятный диапазон по составному индексу.

И результат: 298 мс превращаются в 0,66 мс.

Индекс сам по себе ничего не гарантирует.

Важно не только создать индекс, но и написать запрос так, чтобы оптимизатор реально смог его использовать.


Ox Alpha уже доступна бесплатно на Yenisei
Пока все обсуждают новые флагманские модели, появилась открытая — Ox Alpha.

Что в ней интересного:
1 млн токенов контекста — можно работать с большими репозиториями, документацией и длинными логами.
Заточена под кодинг и reasoning — модель позиционируется для сложных задач разработки и автономной работы AI-агентов.
Мультимодальность — понимает не только текст, но и изображения и видео.
До 131K токенов на ответ — простор для больших задач без постоянного дробления контекста.

И главное: прямо сейчас Ox Alpha можно попробовать бесплатно на Yenisei.

Заходите на yenisei.ru, выбирайте Ox Alpha и тестируйте сами.

Большая модель. Огромный контекст. Ноль рублей за инференс.

https://yenisei.ru
erid: 2W5zFJSPcGH





В SQLite есть кусок кода, который выглядит «грязно», но оставлен таким специально ради скорости.

Каждый SQL-запрос SQLite сначала компилируется в байткод, а затем выполняется собственной виртуальной машиной VDBE.

Внутри — большой цикл диспетчеризации с почти 200 opcode.

И вот интересный момент: SQLite использует обычные goto, чтобы быстро прыгать между общими ветками выполнения.

➡️ В исходниках прямо написано:

«Код использует неструктурированные goto и выглядит не очень чисто. Но это сделано не из-за плохого стиля, так быстрее».

По замерам разработчиков, такой подход ускоряет sqlite3_step() примерно на 1,5%.

То есть здесь читаемость сознательно пожертвовали ради производительности.

Хорошее напоминание: в системном коде «красивее» не всегда значит «быстрее».


🦾 Современные задачи прогнозирования всё чаще выходят за рамки возможностей классических моделей. Если вы уже работаете с временными рядами, пора разобраться, какие архитектуры действительно определяют развитие машинного обучения сегодня.

24 августа в 20:00 МСК приглашаем вас на открытый урок курса «Машинное обучение. Экспертный уровень».

На занятии сравним современные модели с ARIMA, Prophet, XGBoost и LSTM, разберём TimesNet, TimeGPT и другие актуальные подходы, а также на практике построим прогноз и оценим качество современных решений. Вы поймёте, где они дают преимущество и как применять их в реальных задачах.

➡️ Если вы хотите уверенно использовать современные методы прогнозирования, зарегистрируйтесь на открытый урок и получите практическое представление о технологиях, которые уже становятся новым стандартом отрасли: https://tglink.io/8ae474fca0b14a?erid=2W5zFJX5LQ1
#реклама
О рекламодателе


Проверьте по чек-листу, соответствует ли ваша организация приказу ФСТЭК РФ №117 ❗️

Читайте на канале КСБ-СОФТ еще больше актуальных и практичных материалов про защиту персональных данных и применение 149-ФЗ и 152-ФЗ.

Подписывайтесь, чтобы быть в курсе актуального законодательства о киберзащите: https://tglink.io/49687537d80950?erid=2W5zFGTCRXX
#реклама
О рекламодателе


Редкий и реально продвинутый SQL-совет: используй логарифмы для произведения вероятностей.

В SQL удобно считать SUM, AVG, COUNT, но почти никто не думает про PRODUCT. А в аналитике он часто нужен: вероятность цепочки событий, retention funnel, скоринговые модели, reliability, ML-фичи.

Проблема: если перемножать много маленьких чисел, например 0.97 * 0.91 * 0.88 * ..., быстро получишь underflow или потерю точности.

Математический трюк:


a * b * c = exp(ln(a) + ln(b) + ln(c))

То есть вместо прямого произведения считаем сумму логарифмов.


SELECT
user_id,
EXP(SUM(LN(probability))) AS total_probability
FROM events
WHERE probability > 0
GROUP BY user_id;

Где это полезно:


SELECT
user_id,
EXP(SUM(LN(conversion_rate))) AS funnel_survival_rate
FROM funnel_steps
GROUP BY user_id;


Это стандартный численный прием из математики, который делает расчет стабильнее.

Особенно полезно, когда у тебя много шагов в воронке, вероятностная модель, риск-скоринг или аналитика событий.

Главное правило: LN(x) работает только для x > 0, поэтому нули нужно обрабатывать отдельно. Например, если хотя бы одна вероятность равна нулю, итоговое произведение тоже будет ноль.


📌 Заметил, что среди начинающих аналитиков часто возникает пробел на стыке базовой теории и работы с реальными данными. Недавно наткнулся на один камерный авторский проект, где этот баланс соблюден очень грамотно.

🧠 Автор разбирает фундамент, необходимый каждому аналитику: от исторических предпосылок развития индустрии до конкретных инструментов. Что ценно — сложная высшая математика и алгоритмы на Python здесь объясняются без лишней академичности, на понятных прикладных задачах. Качественный разбор практики помогает быстрее разложить знания по полочкам и избежать типичных ошибок на старте.

🤝 Редко встречаю такой уровень проработки материала в небольших сообществах. Если вы сейчас развиваетесь в профессии и ищете надежный источник для прокачки базы, то заглядывайте https://max.ru/id701744347302_biz2


Используй EXISTS вместо IN на больших таблицах

-- медленнее
SELECT *
FROM orders o
WHERE o.user_id IN (SELECT id FROM users WHERE active = true);

-- быстрее
SELECT *
FROM orders o
WHERE EXISTS (
SELECT 1
FROM users u
WHERE u.id = o.user_id AND u.active = true
);

EXISTS останавливается на первом совпадении и не тянет весь подзапрос в память. На больших данных разница может быть кратной.


⚡️ Почему аналитики данных так востребованы и как стать аналитиком в 2026 году?

Большинство новичков совершают одну и ту же ошибку: учат всё подряд.
SQL, Python, Power BI, статистика… Но работодатели оценивают кандидатов не только по базовым навыкам, но и по другим критериям. Из-за этого многие месяцами рассылают резюме и получают только отказы или полное игнорирование.

Андрон Алексанян - аналитик с опытом 9 лет и СEO Симулейтив проведет бесплатный урок и покажет, как выглядит путь к первой работе аналитиком в 2026 году.

Вы узнаете:

🔶Какие навыки действительно проверяют на собеседованиях;
🔶Что должно быть в портфолио, чтобы его открывали работодатели;
🔶Почему многие резюме аналитиков сразу отправляются в отказ;
🔶Как искать работу без коммерческого опыта;
🔶Какие преимущества есть у кандидатов после 30, 40 и даже 50 лет;
🔶Какие ошибки чаще всего мешают получить первый оффер.


Дополнительно на эфире разберем реальные примеры резюме и портфолио кандидатов, которые смогли пройти отбор.

🎁 ПОЛУЧИТЕ 3 КУРСА (PYTHON, SQL, PANDAS) В ПОДАРОК ЗА РЕГИСТРАЦИЮ НА ЭФИР!

Эти курсы - база для того чтобы вкатиться в профессию!

Если вы хотите войти в аналитику и перестать тратить время на лишнее обучение — этот урок поможет понять, на чем действительно стоит сосредоточиться.

🛎️ Регистрируйтесь, эфир совсем скоро!


🔥NVIDIA официально опубликовала Skills, которые они используют для своих ИИ-агентов.

Прямо сейчас у них есть Skills для:

⏺️ автоматического анализа и суммирования видео
⏺️ создания голосовых агентов в реальном времени
⏺️ обучения и улучшения LLM
⏺️ ускорения моделей, чтобы они работали намного быстрее
⏺️ систем RAG, подключенных к документам и данным
⏺️ агентов, работающих в изолированных безопасных средах
⏺️ оптимизации логистики и маршрутизации с помощью GPU
⏺️ программирования и вычислений на CUDA

Некоторые из самых интересных:

⏺️ TensorRT-LLM → экстремальное ускорение LLM
⏺️ NeMo-RL → продвинутое обучение агентов
⏺️ Video Search → автоматический поиск и суммирование видео

Кроме того, они совместимы с:

⏺️ Claude Code
⏺️ OpenAI Codex
⏺️ Cursor

➡️ https://github.com/NVIDIA/skills


Видео недоступно для предпросмотра
Смотреть в Max
Claude идет в финансы с готовыми агентами

Это уже финансовые ИИ-агенты, которые забирают куски работы у аналитиков, аудиторов и операционных команд.

⏺️Один агент собирает питч-дек.
⏺️Второй готовит бриф к встрече.
⏺️Третий читает earnings report и ловит рискованные формулировки. Четвёртый строит valuation model прямо в таблице. Пятый сверяет книги с банковскими выписками.

И самое интересное - это уже не просто чат с моделью. Агент подключается к Excel, PowerPoint, Word, Outlook и данным компании. То есть он не “советует”, а реально двигает рабочий процесс.

Сначала это выглядит как автоматизация рутины. Потом оказывается, что рутина занимала половину финансового отдела.

➡️ https://www.youtube.com/shorts/dhcoR03jtI0


ТЕХНОМАРКЕТИНГ достал первым в МАКСе рассказывать всё самое прикольное про роботов…

Ну как так?!


Видео недоступно для предпросмотра
Смотреть в Max
➡️ SQL можно учить не по скучным таблицам, а через игру в стиле «Матрицы»

Разработчик сделал тренажёр, где вы проходите уровни, находите терминалы и «взламываете» их SQL-запросами.

Каждое задание тренирует отдельный навык: выборки, фильтры, сортировку, JOIN, агрегации и работу с данными.

Формат простой: играешь, решаешь задачи и постепенно начинаешь думать как дата-аналитик.

Идеальный вариант на выходные, если давно хотели подтянуть SQL без унылой теории.

http://sqlprotocol.com/


🔥 Линейный график как искусство

Этот график в любом современном BI-инструменте можно сделать за несколько кликов Да что BI — его можно нарисовать без особых проблем даже в обычном Экселе.

Но у автора он отнял 50 часов — больше стандартной рабочей недели. Он все нарисовал от руки, с помощью карандашей, туши, линеек и набора для леттеринга. В своем посте про этот опыт (https://www.dougmacdowell.com/50-hours-to-draw-some-lines.html) он поделился набором классических книг про визуализацию для вдохновения, списком инструментов и практическими советами: например, как нарисовать четкие, аккуратные линии.

Если интересно, то простого маркера для этого недостаточно: надо отметить точки на графике, вокруг них нарисовать круги и верхние точки кругов соединить линиями — и только внутри этих линий закрасить черным или другим цветом.

Он рассказывает, как лучше выстроить процесс, и как работать с разными инструментами. Единственный вопрос, на который он не дает ответ — зачем вообще этим заниматься? Зачем тратить 50 часов на то, что намного проще и быстрее сделать на компьютере?

Возможно, просто из любви к искусству. В конце концов, не все нужно автоматизировать и оптимизировать — иногда можно потратить 50 часов на линейный график и просто наслаждаться процессом.

Кстати, даже если не планируете рисовать графики карандашами и чернилами, в посте есть ссылки на онлайн-версии книг, которые все еще стоят внимания. несмотря на возраст.

Показано 20 последних публикаций.