
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Рубрика «data mining» - 79
Обзор наиболее интересных материалов по анализу данных и машинному обучению №28 (22 — 28 декабря 2014)
2014-12-28 в 14:42, admin, рубрики: big data, data mining, data science, data science digest, machine learningПостроение словаря текста на примере NLP библиотеки AIF
2014-12-26 в 14:44, admin, рубрики: data mining, java, nlp Так уж повелось, что каждый релиз лингво-независимой библиотеки обработки естественных текстов AIF сопровождается заметкой о том, что было сделано и как все работает. Подобные тексты о предыдущих двух релизах Alpha1 и Alpha2 можно найти вот тут и тут. Не исключением из этого правила стал и текущей релиз Alpha3, в котором появилась возможность строить словарь токенов для входного текста. О том, как все работает под капотом и как это можно использовать в своём проекте и пойдёт сегодня речь.
Читать полностью »
InterSystems iKnow. Загружаем данные из Вконтакте
2014-12-25 в 7:06, admin, рубрики: cache, data mining, iKnow, intersystems cache, natural language processing, nlp, Блог компании InterSystems, Вконтакте API, разработка, социальные сети Эта статья продолжает цикл рассказов (раз, два) об основных способах/сценариях использования iKnow — инструмента Natural Language Processing'а из стека технологий InterSystems.
Предыдущие посты на эту тему были в основном посвящены работе с данными уже после того, как те были помещены в домен (место, в котором и проходит весь анализ текста). Эта же статья будет о том, как правильно и удобно загрузить информацию в iKnow. В качестве примера рассмотрим загрузку информации о пользователях Вконтакте: их личных данных, постах и т.д.
Статья подразумевает некий базовый бэкграунд в области технологий InterSystems (в частности, Caché ObjectScript).
Читать полностью »
Обзор наиболее интересных материалов по анализу данных и машинному обучению №27 (15 — 21 декабря 2014)
2014-12-21 в 17:03, admin, рубрики: big data, data mining, data science, data science digest, machine learning 
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Нефтяные ряды в R
2014-12-17 в 0:18, admin, рубрики: data mining, анализ данных, всемирный заговор, математика, Программирование, статистика, цены «Графики цен великолепны, чтобы предсказывать прошлое»
Питер Линч

С временными рядами мне как-то не доводилось иметь дело на практике. Я, конечно, читал о них и имел некоторое представление в рамках учебного курса о том, как в общих чертах проводится анализ, но хорошо известно, что то, о чем рассказывают в учебниках по статистике и машинному обучению, не всегда отражает реальное положение дел.
Читать полностью »
Обзор наиболее интересных материалов по анализу данных и машинному обучению №26 (8 — 14 декабря 2014)
2014-12-14 в 13:45, admin, рубрики: big data, data mining, data science, data science digest, machine learning 
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Yandex Data Factory
2014-12-09 в 13:23, admin, рубрики: big data, data mining, Блог компании Яндекс, Большие данные, Исследования и прогнозы в IT, матрикснет, машинное обучение, Облачные вычисления, яндексТолько что в Париже на конференции La Web Яндекс объявил об открытии нового важного направления своей деятельности — по коммерческой обработке больших данных — Yandex Data Factory.
Мы верим, что обработка больших данных — это часть нового витка технической революции, который сделает всё человечество ещё более эффективным и приведёт нас к будущему, которое мы сейчас ещё даже не можем до конца представить. И в нём работа с большими объёмами данных будет не менее важным и распространённым, чем выработка электричества или железные дороги сегодня.

Перед публичным запуском Yandex Data Factory мы провели несколько пилотных проектов с компаниями-партнёрами. Для компании, обслуживающей линии электропередач, в Yandex Data Factory создали систему, которая анализирует сделанные беспилотниками снимки и автоматически выявляет угрозы: например, деревья, растущие слишком близко к проводам. А для автодорожного агентства проанализировали данные о загруженности дорог, качестве покрытия, средней скорости движения транспорта и аварийности. Это позволило в режиме реального времени составлять прогноз заторов на дорогах на ближайший час и выявлять участки с высокой вероятностью ДТП.
Читать полностью »
Яндекс открывает новое направление своей деятельности — Yandex Data Factory
2014-12-09 в 13:23, admin, рубрики: big data, data mining, Блог компании Яндекс, Большие данные, Исследования и прогнозы в IT, матрикснет, машинное обучение, Облачные вычисления, яндексТолько что в Париже на конференции La Web Яндекс объявил об открытии нового важного направления своей деятельности — по коммерческой обработке больших данных — Yandex Data Factory.
Мы верим, что обработка больших данных — это часть нового витка технической революции, который сделает всё человечество ещё более эффективным и приведёт нас к будущему, которое мы сейчас ещё даже не можем до конца представить. И в нём работа с большими объёмами данных будет не менее важным и распространённым, чем выработка электричества или железные дороги сегодня.
Перед публичным запуском Yandex Data Factory мы провели несколько пилотных проектов с компаниями-партнёрами. Для компании, обслуживающей линии электропередач, в Yandex Data Factory создали систему, которая анализирует сделанные беспилотниками снимки и автоматически выявляет угрозы: например, деревья, растущие слишком близко к проводам. А для автодорожного агентства проанализировали данные о загруженности дорог, качестве покрытия, средней скорости движения транспорта и аварийности. Это позволило в режиме реального времени составлять прогноз заторов на дорогах на ближайший час и выявлять участки с высокой вероятностью ДТП.
Читать полностью »
Обзор наиболее интересных материалов по анализу данных и машинному обучению №25 (1 — 7 декабря 2014)
2014-12-07 в 13:38, admin, рубрики: big data, data mining, data science, data science digest, machine learning 
Представляю вашему вниманию очередной выпуск обзора наиболее интересных материалов, посвященных теме анализа данных и машинного обучения.
Читать полностью »
Немцы создали библиотеку пьяных аудиозаписей
2014-12-05 в 12:30, admin, рубрики: big data, data mining, автомобили, лингвистический анализ, машинное обучение, пьянству бой Эпиграф:
— Пил?
— Не пил!
— Скажи Гибралтар.
— Пил.
Тема немного курьезная, но мне кажется, что именно таких в последнее время не хватает на Хабре. Особенно в пятницу.

Итак, немецкие ученые из двух университетов Мюнхена создали базу аудизаписей, где записа речь 162-х людей в состояние алкогольного опьянения. Данные собирались с 2007 года по 2009 и теперь на основании базы данных создается языковой корпус (статья о корпусах на Вики) Alcohol Language Corpus (ALC).Читать полностью »

