
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Рубрика «data mining» - 78
Обзор наиболее интересных материалов по анализу данных и машинному обучению №31 (12 — 18 января 2015)
2015-01-18 в 15:02, admin, рубрики: big data, data mining, data science, data science digest, machine learningИскусство Feature Engineering в машинном обучении
2015-01-17 в 9:45, admin, рубрики: big data, data mining, kaggle, machine learning, python, математикаПривет!

В предыдущей статье (Введение в машинное обучение с помощью Python и Scikit-Learn) мы с вами познакомились с основными этапами решения задач машинного обучения. Сегодня подробнее поговорим о техниках, которые позволяют заметно увеличить качество разрабатываемых алгоритмов. Одна из таких техник — Feature Engineering. Сразу отметим, что это своего рода искусство, обучиться которому можно только прорешав огромное количество задач. Тем не менее, с опытом вырабатываются некие общие подходы, которыми хотелось бы поделиться в данной статье.
Читать полностью »
Chart Wars: Диаграммы наносят ответный удар
2015-01-16 в 1:02, admin, рубрики: data mining, how to lie with statistic, Tufte, визуализация данных, Учебный процесс в ITЧто может быть хуже круговой диаграммы?
Две круговые диаграммы! Эдвард Тафти
Все мы уже не раз видели, что может пойти не так с визуализацией данных. Сегодня обсудим несколько важных принципов, лежащих в основе качественной графики, и что гораздо интересней, узнаем, что произойдет, если эти правила НЕ соблюдать.

Структура статьи
- Восприятие измерений
- Соотношение чернила-данные
- Фактор обмана
- Парадокс Симпсона
- Джон Сноу всё-таки что-то знает — пример классики визуализации
- Что еще посмотреть-почитать
- Круговая диаграмма в реальной жизни
(*осторожно трафик*) Читать полностью »
Когда никто не читает Хабр
2015-01-13 в 8:01, admin, рубрики: data mining, визуализация данных, Исследования и прогнозы в IT, теги никто не читает, Хабрахабр APIДавным давно у меня родилась гипотеза: «Все айтишники, так же как и я, читают новости и статьи на работе за чашкой чая-кофе в самом начале дня и где-то после обеда».
Чтобы проверить эту гипотезу (ну и не только для этого, конечно) в прошлом году написал и опубликовал монитор Хабра под названием Пульс Хабра. Так как гипотезы необходимо проверять, я занялся сбором данных и анализом закономерностей поведения Хабра-жителей.

Сегодня решил поделиться основными наблюдениями.
Структура статьи:
Введение в машинное обучение с помощью Python и Scikit-Learn
2015-01-13 в 6:39, admin, рубрики: big data, data mining, pythonПривет!

Меня зовут Александр, я занимаюсь машинным обучением и анализом веб-графов (в основном — теоретическим), а также разработкой Big Data продуктов в одном из операторов Большой Тройки. Это мой первый пост — прошу, не судите строго!)
В последнее время ко мне все чаще стали обращаться люди, которые хотят научиться разрабатывать эффективные алгоритмы и участвовать в соревнованиях по машинному обучению с вопросом: «С чего начать?». Некоторое время назад я руководил разработкой инструментов Big Data для анализа медиа и социальных сетей в одном из учреждений Правительства РФ, и у меня остался некоторый материал, по которому обучалась моя команда и которым можно поделиться. Предполагается, что у читателя есть хорошее знание математики и машинного обучения (в команде были в основном выпускники МФТИ и студенты Школы Анализа Данных).
Читать полностью »
5 трендов в области анализа и обработки данных в 2015 году
2015-01-12 в 7:26, admin, рубрики: analytics, big data, data mining, trends 2015 
Начало года самое время для прогнозов и предсказаний. В этом посте я собрал обзор трендов в области аналитики и систем обработки данных на 2015 год.
Читать полностью »
Обзор наиболее интересных материалов по анализу данных и машинному обучению №30 (5 — 11 января 2015)
2015-01-11 в 16:54, admin, рубрики: big data, data mining, data science, data science digest, machine learning 
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Обзор наиболее интересных материалов по анализу данных и машинному обучению №29 (29 декабря 2014 — 4 января 2015)
2015-01-04 в 16:50, admin, рубрики: big data, data mining, data science, data science digest, machine learning 
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Анализ тональности текста в Excel с помощью Azure Machine Learning и Power Query
2015-01-04 в 9:55, admin, рубрики: azure, azure ml, data mining, Excel, Microsoft Azure, power query, sentiment analysisВозможно, вы видели пост Joseph Sirosh на прошлой неделе о возможности опубликовать модели Azure Machine Learning в Azure Marketplace, и что MS уже опубликовало некоторое количество API. Для Excel есть специальный аддон, который может используется для доступа к этим API, но я заметил, что как минимум одно API (Sentiment Analysis API) может использоваться напрямую через Power Query.
Для того, чтобы сделать это, сперва вам необходимо зайти в Azure Marketplace, войти под вашим Microsoft-аккаунтом и подписаться на Lexicon Based Sentiment Analysis API. В документации говориться, что у вас есть 25000 транзакций в месяц бесплатно. API как таковое очень простое: передайте предложение для оценки, и вам в ответ придет оценка от -1 до 1, где 1 означает положительную тональность, а -1 отрицательную. Для примера, выражение «I had a good day» возвращает значение 1:







