Рубрика «data engineering»

В понедельник утром пайплайн упал. В чате уже есть три версии причины: «сеть», «база опять задумалась» и «давайте просто перезапустим». Ассистент мог бы за минуту собрать список упавших задач, показать зависимые пайплайны и выдать первую гипотезу. Но для этого ему часто отдают доступ к логам, метаданным и иногда — не будем показывать пальцем — к произвольному SQL.

Так делать не стоит. Достаточно, что модель прочитает токен в логе, получит инструкцию из текста ошибки или отправит в базу слишком дорогой запрос. У инженера тут должен сработать простой вопрос: «Можно. А зачем?»

Читать полностью »

Регулярно возникает ситуация, когда необходимо найти местоположение достоверного и актуального адреса или группы адресов, чтобы использовать их в GIS‑процессах. Такие адреса можно получить только из ГАР/ФИАС, но там только текстовые записи, при этом полный адрес разнесен в разные XML‑таблицы. Пространственное положение можно определить в НСПД, но часть данных при наличии пространственного объекта может иметь неактуальный, неполный текст адреса, или вообще не иметь его. Эти две сущности имеют общую связку — кадастровый номер.

Читать полностью »

Мотивация и цели

Всем привет! Я инженер данных в Альфа-банке и еще на моменте обучения профессии хотел сделать пет-проект с обработкой данных и интересной инфраструктурой. Пришел к выводу, что это должна быть компьютерная игра, и для меня лучше всего подошла Dota 2, но с получением сырых данных было много трудностей, в которые не было времени вникнуть, и я откладывал этот проект долгое время.

Читать полностью »

История о том, как мы боролись с «цифровой слепотой», разрозненными данными и недоверием к ML, чтобы построить систему предиктивной аналитики для реального нефтеперерабатывающего завода. Часть 1 из 2.

Читать полностью »

Метрики как код: бизнес‑логика в dbt вместо настроек BI

В начале немного контекста. Я — аналитик данных в команде BIGDATAHOUSE, и на всех проектах трансформацию данных реализую через dbt — де‑факто стандарт, в качестве BI в основном использую Superset. Бизнес‑логика в таком стеке оказывается разбита по двум местам: одна её часть оседает в dbt, другая описывается в BI. Со временем эти две части неизбежно расходятся, и отследить такие расхождения становится всё сложнее. Из профессионального интереса изучая альтернативные BI‑платформы, я наткнулся на Lightdash. Он обещает закрыть эту и ряд других проблем.

Читать полностью »

16 500 отзывов в одном рабочем контуре, 9 500 записей в собственном хранилище, четыре XML‑фида, 4 000 строк кода и 130+ страниц документации. Все это работает за 8 500 в месяц.


Вместо введения: что здесь вообще произошло

Задача была очень простая: сделать так, чтобы отзывы гостей ресторанной сети перестали жить в десятке вкладок, кабинетов, выгрузок и ручных таблиц. На первый взгляд — обычная автоматизация. Забрать данные, сложить в одно место, показать человеку. Но мы не ищем легких путей)

Читать полностью »

Привет, сообщество! Где-то два месяца назад мне пришла в голову идея, очень простая по своей сути, но ой как обширная, если начать в ней копаться более подробно.

В мире порядка 200 территорий выдаёт паспорта. И порядка 250 направлений, куда по одному из этих паспортов можно поехать. А что если, создать базу таких связей (паспорт-направление), но не просто, а ссылаясь на официальные источники.

Так родился проект EntryConditions.comЧитать полностью »

Звонил мне на днях один знакомый CIO. Питерский, ритейл, средний бизнес, ничего особенного. Слушай, говорит, надо нам с ИИ что‑то делать: все вокруг внедряют, конкуренты вон что‑то запустили, на отраслевом Data Summit уши прожужжали, а у меня даже плана нет. И денег, кстати, особо на это не выделили, но не суть.

Это был, кажется, пятый такой звонок за месяц.

Читать полностью »

Когда инженер слышит «нам нужно хранилище данных», задача редко звучит однозначно. Кто‑то задыхается на боевой OLTP‑базе под аналитической нагрузкой. Кто‑то впервые строит BI и не понимает, с какого края подходить. У кого‑то накопились данные из десятка систем‑источников, и существующих средств уже не хватает.

У всех «хранилище». А правильный технический ответ зависит от условий задачи.

Читать полностью »

Автор работал в различных дата-инженерных проектах и иногда проекты представляют собой набор модулей без логики и без общего подхода. Поэтому цель статьи - разработать этот общий подход и заодно поупражняться вместе с читателем в его создании.

Подводящие идеи

В Enterprise мы работаем с трансформациями данных, поэтому: 

  1. Краеугольный камень - это бизнес-процесс, некий Flow, который преобразует одну или несколько таблиц. 

  2. Таблица - это вспомогательная сущность, обслуживающая бизнес. Попытка сделать таблицы основными сущностями приведет к размыванию бизнес-логики.

  3. Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js