Перейти к содержанию
Learning Platform
Каталог / Direction 01
01
Направление

Data Engineering

Хранилища, потоки, оркестрация, контракт-данных. Курсы расположены от базовых к продвинутым; их можно проходить независимо.

33
Курсов
1815
Часов
2673
Уроков
23
материалов
Уровни
Junior · Middle · Senior
01
Junior
База: язык, SQL, основные абстракции. Точка входа в направление.
13
курсов
638
часов
982
уроков
Открыть →
02
Middle
Рабочий стек инженера: оркестрация, стриминг, обработка, хранилища.
11
курсов
614
часов
1028
уроков
Открыть →
03
Senior
Внутренности систем, инфраструктура, governance, system design.
9
курсов
563
часов
663
уроков
Открыть →
Карьерный путь
1
Data Engineer
Карьерный роадмап дата-инженера, построенный на курсах платформы: 33 курса от старта с нуля и основ CS, языков и SQL через оркестрацию, стриминг и обработку больших данных до internals систем, governance и system design. Путь Junior → Middle → Senior.
10 разделов · 33 узлов
Открыть →
Статьи
22
01 Дата-инженер: от источников до витрин данных Что на самом деле делает data engineer: путь данных от источников до витрин, современный стек и с чего начать. Бесплатно и интерактивно, с песочницей. 02 Как dbt компилирует модели: Jinja, ref() и DAG Разбираем изнутри, как dbt превращает SELECT с Jinja в чистый SQL, строит DAG через ref() и генерирует DDL. Бесплатно и интерактивно. 03 Оконные функции в SQL: PARTITION BY, ORDER BY и фреймы Разбираем изнутри, чем оконные функции отличаются от GROUP BY, как работают PARTITION BY, ORDER BY и frame clause, и пишем ранжирование, running totals и LAG/LEAD. Бесплатно, с песочницей. 04 Роадмап дата-инженера: с чего начать и в каком порядке Честный роадмап дата-инженера: SQL, Python, Linux/git, хранилища (warehouse/lake/lakehouse), Spark, Airflow, Kafka/Flink, dbt и internals для senior. Что учить в каком порядке и что НЕ учить сразу. Бесплатно, с интерактивным sandbox. 05 Тестирование данных в dbt: generic/singular tests, freshness и contracts Разбираем изнутри, как dbt-тесты компилируются в SELECT нарушителей, как работают freshness и model contracts, и где это встаёт в CI. Бесплатно и интерактивно. 06 Airflow scheduler: main loop, critical section и HA Как изнутри работает планировщик Apache Airflow: main loop, парсинг DAG, critical section с SELECT FOR UPDATE SKIP LOCKED и High Availability. Бесплатно. 07 Apache Flink: exactly-once, чекпоинты и состояние изнутри Как Flink даёт exactly-once: чекпоинты, барьеры Chandy-Lamport, alignment, state backends и 2PC-синки. Бесплатно и интерактивно, на русском. 08 Apache Iceberg изнутри: ACID и time travel на S3 Как table format Iceberg даёт ACID, time travel и эволюцию партиций на object storage без листинга директорий. Разбор метаданных и коммита, бесплатно. 09 Catalyst и Tungsten: как Spark оптимизирует и исполняет запросы Как Spark превращает ваш DataFrame-код в исполняемый план: пять фаз Catalyst, rule-based и cost-based оптимизация, predicate pushdown, и движок Tungsten с whole-stage codegen. Бесплатно и с песочницей. 10 Change Data Capture с Debezium: как стримить изменения из БД Как Debezium читает изменения прямо из WAL/binlog базы данных и публикует их в Kafka: logical decoding в Postgres, структура change-event, фазы snapshot и streaming, гарантии at-least-once и идемпотентность downstream. 11 ClickHouse быстрее Postgres: columnar и MergeTree Почему ClickHouse обгоняет Postgres на аналитике: columnar storage, MergeTree, разреженный индекс и векторизация — бесплатный интерактивный разбор internals. 12 Consumer groups и rebalancing в Kafka: как партиции делятся между консьюмерами Глубокий разбор consumer groups в Apache Kafka: group coordinator, стратегии назначения партиций, почему ребаланс — stop-the-world, cooperative-sticky, offset commit и static membership. 13 EXPLAIN ANALYZE в PostgreSQL: от seq scan до hash join Как читать план запроса PostgreSQL: дерево, cost vs actual time, методы доступа и join, BUFFERS и красные флаги. Бесплатно и интерактивно, с песочницей. 14 Iceberg vs Delta Lake vs Hudi: какой open table format выбрать Глубокое сравнение трёх open table formats: модель метаданных и коммита, copy-on-write против merge-on-read, поддержка движков и engine-lock-in. Ментальная модель плюс таблица для выбора. 15 Kafka: append-only log, page cache и zero-copy Почему Apache Kafka такой быстрый: append-only лог на диске, последовательная запись, page cache ядра и zero-copy через sendfile — разбор internals. 16 Materialized Views в ClickHouse: инкрементальная агрегация на вставке Почему MV в ClickHouse — это INSERT-триггер, а не периодический refresh: блок вставки, AggregatingMergeTree, State/Merge-комбинаторы, populate, цепочки MV и типичные ошибки. Бесплатный разбор internals. 17 ODCS v3.1.0 в облачной архитектуре: GitHub CI/CD и GCP enforcement Полное руководство по внедрению Open Data Contract Standard v3.1.0 в облачной архитектуре с GitHub Actions CI/CD и Google Cloud Platform enforcement 18 Parquet изнутри: row groups, column chunks и predicate pushdown Побайтовый разбор Parquet — иерархия row group → column chunk → page, footer-метаданные с min/max статистиками, dictionary/RLE/bit-packing и как движок пропускает данные. Бесплатный тизер. 19 Spark job изнутри: от DAG до памяти executor'а Как Spark режет job на стадии, превращает партиции в задачи и управляет памятью executor'а. Разбираем shuffle и spill изнутри, бесплатно и интерактивно. 20 Star schema, Data Vault и One Big Table: как моделировать витрины Глубокий разбор моделирования витрин: dimensional modeling (grain, факты, измерения, SCD), star vs snowflake, Data Vault (hub/link/satellite) и One Big Table для колоночных движков. Бесплатно, с интерактивным sandbox. 21 Trino vs Spark SQL vs DuckDB: когда какой движок Архитектурное сравнение Trino, Spark SQL и DuckDB по осям масштаба, latency, памяти и use-case. Когда single-node обгоняет кластер. Бесплатно, с runnable-песочницей. 22 XCom в Airflow: как задачи обмениваются данными и где предел Как работает XCom в Apache Airflow: хранение в metadata DB, push/pull, TaskFlow API, custom XCom backend на S3/GCS и почему DataFrame через XCom — антипаттерн. Бесплатно.