Рубрика «Большие данные»
Как мы анализировали поведение пользователей Яндекс Музыки на 50 млн событий
2026-05-26 в 8:30, admin, рубрики: аналитика, Большие данные, дата сайенс, яндекс.музыкаМузыкальные стриминговые сервисы давно перестали быть просто каталогами треков. Сегодня значительная часть пользовательского опыта формируется рекомендательными системами: персональными подборками, автоматическими плейлистами, «волнами» и похожими механизмами. Пользователь может сам искать музыку, добавлять треки в библиотеку и слушать знакомых артистов, а может переходить по рекомендациям алгоритма. Возникает естественный исследовательский вопрос: рекомендации действительно расширяют музыкальный кругозор или, наоборот, закрепляют уже существующие предпочтения пользователя?
Решение обратной задачи рекомендаций: опыт участия в VK RecSys Challenge
2026-01-19 в 5:15, admin, рубрики: BigData, huggingface, ml, recsys, recsys challenge 2025, vk-lsvd, Большие данные, коллаборативная фильтрация, рекомендации контентаВведение
В декабре 2025 года VK провёл RecSys Challenge LSVD — соревнование по машинному обучению с нестандартной постановкой задачи. Традиционные рекомендательные системы решают проблему "что показать пользователю", но здесь требовалось обратное: для каждого нового клипа определить, каким пользователям он может быть интересен. Такой подход помогает решать проблему холодного старта контента, когда новое видео только появляется в системе и не имеет истории взаимодействий.
Я принял участие в этом челлендже и хочу поделиться своим решением, архитектурой системы и практическими выводами.
Постановка задачи и данные
Масштабный анализ данных астрометрического обзора Gaia DR3
2025-12-23 в 11:16, admin, рубрики: gaia, Gaia DR3, астрометрия, Большие данные, фотометрияАнализ Gaia DR3 — комбинированная версия
Введение
Gaia — это космическая обсерватория Европейского космического агентства (ESA), запущенная в декабре 2013 года. Основная цель миссии — максимально точно измерить положения, расстояния и движения звёзд в нашей Галактике. Фактически Gaia создаёт трёхмерную карту Млечного Пути.
К январю 2025 года научная программа миссии была завершена. За это время Gaia выполнила несколько релизов данных, крупнейшим из которых на данный момент является Gaia Data Release 3 (DR3). Этот релиз содержит информацию примерно о 1,8 миллиарда астрономических объектовЧитать полностью »
Язык и большие данные
2025-12-03 в 13:13, admin, рубрики: Большие данные, лингвистика, нейросети, новые слова, языкЯзык всегда строился на интуиции носителей, а его изучение зависело от интроспекции лингвистов. Теперь же большие данные кардинально меняют эту систему.
Вам куда? История Uber
2025-10-19 в 5:58, admin, рубрики: BigData, uber, автономия, Алгоритмы, беспилотный автомобиль, Большие данные, доставка еды, такси, шеринг-экономика, экосистемаНажми кнопку — и поезжай. Эта идея стала началом того, что впоследствии изменило облик городского транспорта, бросило вызов регуляторам по всему миру и превратило Uber в глагол, узнаваемый по всему земному шару.
Сегодня экосистема Uber перевозит не только людей, но и еду, продукты и товары, объединяя миллионы партнёров-водителей и сотни миллионов клиентов — в десятках миллиардов поездок.
От дерзкого нарушителя правил до интегрированного партнёра — таков путь Uber.
Такси до Uber
PostgreSQL против 10 миллионов записей: оптимизация запросов, которая спасла наш проект
2025-10-03 в 14:16, admin, рубрики: BigData, explain analyze, postgresql, sql, базы данных, Большие данные, индексирование, индексы, оптимизация запросов, производительность
PostgreSQL против 10 миллионов записей: оптимизация запросов, которая спасла наш проект
Пролог: Когда база данных говорит «нет»
Это был обычный понедельник. Я пил кофе, проверял почту, и вдруг — волна уведомлений в Slack. «Сайт не грузится!», «Отчеты зависли!», «Что происходит?».
Apache Superset — почему все топы рынка выбрали именно его?
2025-08-22 в 13:59, admin, рубрики: Apache, BI, superset, Большие данные, визуализация1. Введение
Рынок BI-инструментов, как и любой другой сильно меняется в последние годы. Все чаще фокус компаний смещается в сторону open-source инструментов по понятным причинам. В этом мире высокая конкуренция - DataLens, Superset, Metabase и т.д. Есть хорошая статья с базовыми сравнениями BI-систем. Прекрасно, чтобы вкатится. Но невозможно в рамках одной статьи рассмотреть преимущества и недостатки каждой BI-системы. Поэтому мы пойдем немного другим путем - посмотрим на то, что выбирают топы рынка РФ, а затем кратко Читать полностью »
Ленивые вычисления в PHP: как генераторы и итераторы экономят память и ускоряют код
2025-08-22 в 12:15, admin, рубрики: iterator, php, yield, Большие данные, генераторы, итераторы, ленивые вычисления, оптимизация, память, производительностьВы когда-нибудь пытались загрузить в память CSV-файл на миллион строк и увидели что-то вроде:
PHP Fatal error: Allowed memory size of 134217728 bytes exhausted
Даже если увеличить memory_limit, ощущение всё равно неприятное: мы держим в памяти весь массив данных, хотя работаем с ним построчно.
Решение? Ленивые вычисления — подход, при котором данные генерируются и обрабатываются только тогда, когда они реально нужны.
В PHP это можно сделать двумя способами: с помощью генераторов (yield) и через Iterator API. Сегодня разберём оба.
Что такое ленивые вычисления
Смартфон не прослушивает вас в фоновом режиме. Истина куда страшнее
2025-04-25 в 18:33, admin, рубрики: Большие данные, большой брат, контекстная реклама, наблюдение, прослушивание, прослушивание телефонных разговоров, прослушка, прослушка телефонов, слежка, социальные сетиПочему соцсети показывают рекламу так, словно читают мысли? Как случайная фраза превращается в недели демонстрируемого контента? Действительно ли «Большой брат» следит за каждым? Забегая наперед: ваш смартфон вас не прослушивает. Ему это и не надо. Истина оказалась куда хуже, чем в сценарии романа-антиутопии.

