Рубрика «аналитика данных»

Это моя первая публикация на Хабре, который я читаю уже лет 10... Так что, если честно, даже немного трясусь от волнения. Всё равно что смотреть футбол и выйти на поле в составе моего любимого Кайрата. Но постараюсь без лирики и перейду к делу.

Итак, в 2026 году уже всем как будто понятно, что потенциальные клиенты всё чаще выбирают банк не в поиске, а в диалоге с нейросетью (хотя многие с этим до сих пор почему‑то спорят). На выходе клиент получает короткий список из трёх‑четырёх названий.

Читать полностью »

Некоторое время назад я решил оживить мой аккаунт на Хабре. В 2008 году, когда я ещё только его зарегистрировал, было принято фармить сначала комментариями карму и только потом писать статьи. Я так делал, насколько помню. Забегая вперёд скажу, что то ли я помню неправильно, то ли всё поменялось, то ли и то и то, но сейчас фармить комментариями не нужно, хочешь статью - просто пиши (хотя у меня немного кармы с тех времён оставалось, может, поэтому я могу писать статью без проблем).

Неважно.

Читать полностью »

6,9к за восемь лет и 121к за полгода: аномалия в данных одного телеграм-канала - 1

Я понимаю, что Хабр не политическая платформа, я хорошо знаком с правилами, понимаю, что получу массу минусов в карму, а может, и бан.

Но!

Читать полностью »

Метрики как код: бизнес‑логика в dbt вместо настроек BI

В начале немного контекста. Я — аналитик данных в команде BIGDATAHOUSE, и на всех проектах трансформацию данных реализую через dbt — де‑факто стандарт, в качестве BI в основном использую Superset. Бизнес‑логика в таком стеке оказывается разбита по двум местам: одна её часть оседает в dbt, другая описывается в BI. Со временем эти две части неизбежно расходятся, и отследить такие расхождения становится всё сложнее. Из профессионального интереса изучая альтернативные BI‑платформы, я наткнулся на Lightdash. Он обещает закрыть эту и ряд других проблем.

Читать полностью »

Я руковожу командой аналитиков. Мы работаем с данными брендов на маркетплейсах. Начну не с технологии, а с проблемы, из которой всё выросло.

Каждый день мы разбираем, где у селлера утекают деньги. С данными у нас все было в порядке. Витрины были нормальные, дашборды наглядные, цифры под рукой. Дело было не в данных, а в людях. Дашборд показывает, что произошло, а разобраться, что с этим делать, должен уже аналитик.

Читать полностью »

На код‑ревью регулярно всплывает одна и та же классическая проблема. Открываешь проект нового разработчика, а там финансовые поля вроде price или balance лежат во float или double. На вопрос о причинах такого выбора обычно следует стандартный ответ: «В ORM всё запускается, копейки сохраняются, на локальной машине работает». О том, что при росте базы двоичная логика округления стандарта IEEE 754 начнет искажать расчеты и терять деньги бизнеса, на ускоренных курсах не рассказывают.

Читать полностью »

В большинстве известных мне коробочных прогнозных систем есть этап, когда часть исторических данных о продажах отбрасывается.  К примеру, этот этап есть в SAP и в Forecast. Обычно отбрасывают 2% самых больших и 2% самых маленьких данных в распределении. Это непонятные аномальные данные. Их называют «выброс».

Логика «если мы что-то не понимаем, то мы на это не смотрим» немного странная. Казалось бы, это самые интересные данные. Почему на них не смотреть? И с другой стороны, если математическая модель хорошо сделана, то присутствие этих данных в расчете не должно мешать.

Читать полностью »

Всем привет!

Меня зовут Прокопович Наталья, я руковожу направлением зарплатной аналитики в Сбере и работаю на стыке HR, данных и бизнеса. Также являюсь амбассадором исследовательских подходов в people analytics. Еще преподаю в МГИМО и пишу о том, как превращать данные в практические решения для бизнеса. Сегодня поговорим о базе - о ловушках, которые как говорится "исторически сложились" в профессии.

Читать полностью »

В феврале 2025 Авито провели очередной буткемп для продактов. Дали реальный кейс: новая услуга в долгосрочной аренде, три месяца сбора статистики (октябрь‑декабрь 2024), цель — 500 млн. к 2027 году.

В этом кейсе 99% пользователей не доходят до сценария, где покупка становится возможной.

Получился небольшой социальный эксперимент, который, на мой взгляд, поднимает несколько вопросов к интерпретации метрик и постановке задачи.

Читать полностью »

Почти все компании начинают построение аналитики в Excel. Это удобно потому, что на старте данных немного и все можно собрать в одну таблицу, быстро посчитать и в целом понимать, что происходит.

Excel довольно универсальный инструмент. Хочешь — отчет собери, хочешь — модель посчитай, хочешь — гипотезу проверь. Но постепенно его начинает не хватать.

Сначала компании разрастаются данными. Потом они появляются в разных местах , таких как, CRM, рекламные кабинеты, бухгалтерия, сайт. Потом с ростом компании появляются дополнительные отчеты. И тебе уже приходится работать сразу в нескольких файлах и системах.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js