Рубрика «сырые данные»
Как взломать Генотек. Я навайбкодила свой ДНК-анализатор, и он работает
2026-08-13 в 18:31, admin, рубрики: raw data, вайбкодинг, геном, импутация, сырые данныеXGBoost альтернатива CatBoost для работы с категориальными данными???
2025-11-11 в 13:46, admin, рубрики: boosting, catboost, xgboost, категориальные данные, категориальные признаки, сырые данныеКратко:
22 сентября 2025г. вышла версия 3.10 XGBoost. Основной фишкой новой версии стал "категориальный ре-кодер(categorical re-coder)". Он сохраняет категории в модели и так же может перекодировать данные на этапе инференса. И целью этой статьи является сравнить возможности новой версии XGBoost c лидером обработки категориальных данных, CatBoost.
Основные вопросы:
-
Кто обучает на сырых данных?
-
Что такое этот категориальный ре-кодер?
-
Можно ли обучить модель полностью на сырых данных и получить приемлемый результат?Читать полностью »
Лекция о двух библиотеках Яндекса для работы с большими данными
2017-07-10 в 13:14, admin, рубрики: big data, cascading, etl, Hadoop, MapReduce, YT, библиотеки, Блог компании Яндекс, логи, Промышленное программирование, сырые данные, фильтрацияПару недель назад в Яндексе прошла встреча PyData, посвящённая анализу больших данных с использованием Python. В том числе на этой встрече выступил Василий Агапитов — руководитель группы разработки инструментов аналитики Яндекса. Он рассказал о двух наших библиотеках: для описания и запуска расчетов на MapReduce и для извлечения информации из логов.
Под катом — расшифровка и часть слайдов.

