В этой статье будет продемонстрирована техника обработки информации по биржевым котировкам с помощью пакета pandas (python), а также изучены некоторые «мифы и легенды» биржевой торговли посредством применения методов математической статистики. Попутно кратко рассмотрим особенности использования библиотеки plotly.
Одной из легенд трейдеров является понятие «локомотива». Описать ее можно следующим образом: есть бумаги «ведущие» и есть бумаги «ведомые». Если поверить в существование подобной закономерности, то можно «предсказывать» будущие движения финансового инструмента по движению «локомотивов» («ведущих» бумаг). Так ли это? Есть ли под этим основания?

Читать полностью »
Рубрика «data mining» - 46
Призрак локомотива или биржевой рынок через призму корреляций
2017-07-27 в 15:08, admin, рубрики: data mining, DataFrame, Normality Test, pandas, python, машинное обучениеДанные: красивые и ужасные
2017-07-27 в 11:26, admin, рубрики: big data, data mining, анализ данных, Блог компании Cloud4Y, визуализация данных, красота, открытые данныеДанные повсюду. И это прекрасно. Они меняют нашу жизнь, заново изобретают сторителлинг и оказывают влияние практически на все отрасли — бизнес, искусство, развлечения, музыку, технологии.
Вот некоторые яркие примеры…
Информационная журналистика
Совершенно ужасающая инфографика. Проект, который называется «С глаз долой, из сердца вон», — это хронология ударов беспилотных дронов в Пакистане с июля 2004 года по декабрь 2013 года.
С 2004 года США практиковали новый вид подпольной военной операции. Использование беспилотных летательных аппаратов для уничтожения вражеских целей казалось привлекательным, так как устраняло риск потери американских военных и политически было намного легче осуществимо. Показатель эффективности оказался крайне низок, а потери среди взрослого и детского гражданского населения очень высоки. Весь мир мог бы остаться в неведении о том, что на самом деле происходит, и, как говорится, с глаз долой, из сердца вон. Этот проект помогает осветить тему беспилотных летательных аппаратов, не говоря за или против. Изучив данные, вы можете самим решить, сможете ли вы поддерживать подобное использование беспилотных летательных аппаратов или нет.
Читать полностью »
Нестандартная кластеризация, часть 3: приёмы и метрики для кластеризации временных рядов
2017-07-27 в 6:55, admin, рубрики: cluster, clustering, data mining, graphs, metrics, review, time series, математика, машинное обучениеПока другие специалисты по машинному обучению и анализу данных выясняют, как прикрутить побольше слоёв к нейронной сети, чтобы она ещё лучше играла в Марио, давайте обратимся к чему-нибудь более приземлённому и применимому на практике.
Кластеризация временных рядов — неблагодарное дело. Даже при группировке статических данных часто получаются сомнительные результаты, что уж говорить про информацию, рассеянную во времени. Однако нельзя игнорировать задачу, только потому что она сложна. Попробуем разобраться, как выжать из рядов без меток немного смысла. В этой статье рассматриваются подтипы кластеризации временных рядов, общие приёмы и популярные меры расстояния между рядами. Статья рассчитана на читателя, уже имевшего дело с последовательностями в data science: о базовых вещах (тренд, ARMA/ARIMA, спектральный анализ) рассказываться не будет.

Поиск по документации InterSystems с помощью технологий iKnow и iFind
2017-07-24 в 9:59, admin, рубрики: data mining, ifind, iKnow, intersystems, intersystems cache, Блог компании InterSystems, Программирование, Разработка веб-сайтов
В СУБД InterSystems Caché есть встроенная технология работы с неструктурированных данными iKnow, а также технология полнотекстового поиска iFind. Решили разобраться с технологией и заодно сделать что-то полезное. В итоге получился DocSearch — Веб приложение для поиска по документации InterSystems, с использованием технологий iKnow и iFind.
Читать полностью »
Анализируем карьеру игроков NHL с помощью Survival Regression и Python
2017-07-18 в 13:48, admin, рубрики: big data, data mining, nhl, survival analysis, Блог компании New Professions Lab, кривые дожития, машинное обучение, метки: nhl, survival analysis, кривые дожитияПривет! Сегодня рассмотрим один из подходов к оценке временного риска, который основан на кривой выживаемости и одноименной регрессии, и применим его к анализу продолжительности карьеры игроков НХЛ.
Когда у данного пациента произойдет рецидив? Когда наш клиент уйдет? Ответы на подобные вопросы можно найти с помощью анализа выживания, который может быть использован во всех областях, где исследуется временной промежуток от «рождения» до «смерти» объекта, либо аналогичные события: период от поступления оборудования до его выхода из строя, от начала использования услуг компании и до отказа от них и т.д. Чаще всего данные модели используются в медицине, где необходимо оценить риск летального исхода у больного, чем и обусловлено название модели, однако они также применимы в сфере производства, банковском и страховом секторах.

Как тысячи игроков Eve Online помогают в расшифровке человеческого тела
2017-07-17 в 13:38, admin, рубрики: big data, data mining, EVE Online, Human Protein Atlas, MMO Science, Атлас Белков Человека, перевод, разработка игрОт переводчика
Представляю вашему вниманию перевод статьи Мэта Камена (Matt Kamen) от 28 апреля 2016 года.
В статье рассказывается о том, какие возможности могут предоставить и предоставляют многопользовательские игры в решении важных проблем для всего человечества, связанных с необходимостью привлечения большого количества человеческих ресурсов.

Credit CCP Games
Читать полностью »
Чудесный мир Word Embeddings: какие они бывают и зачем нужны?
2017-07-17 в 11:03, admin, рубрики: data mining, glove, nlp, opendatascience, python, SVD, word2vec, Блог компании Open Data Science, машинное обучение, поисковые технологииНачать стоит от печки, то есть с постановки задачи. Откуда берется сама задача word embedding?
Лирическое отступление: К сожалению, русскоязычное сообщество еще не выработало единого термина для этого понятия, поэтому мы будем использовать англоязычный.
Сам по себе embedding — это сопоставление произвольной сущности (например, узла в графе или кусочка картинки) некоторому вектору.

Можно ли уехать из Клинцов? (data mining of blablacar.ru)
2017-07-17 в 6:43, admin, рубрики: BlaBlacar, data mining, data science, R, визуализация данных, метки: Визуализация данныхПарсинг сайта blablacar.ru и анализ пассажиропотока из г. Клинцы Брянской области с помощью языка программирования R.

Программный сбор данных о котировках
2017-07-09 в 13:36, admin, рубрики: data mining, java, phython, python, анализ, данные, котировки, машинное обучение, парсинг, Программирование, трейдер, ФинамЗаголовок обязывает перейти непосредственно к программному коду… Но, думаю, все же необходима вводная часть. А зачем, собственно, это нужно?
Эффективные действия на бирже связаны с тщательным анализом происходящего на рынке. Что кроется за динамикой цифр, котировок?
Читать полностью »
Чем занимались пиарщики РПЦ в день встречи Путина и Трампа на G20?
2017-07-08 в 6:41, admin, рубрики: data mining, g20, statoperator, визуализация данных, данные, иформационное поле, путин, рпц, трамп
В рамках данной стати мы будем проводить замеры динамики пульсации сущностей в информационном пространстве.
Читать полностью »


