В пятницу BitTorrent анонсировал старт публичной беты SoShare, сервиса, который переплюнет сервисы, подобные YouSendIt, DropBox и другим, разрешая передавать до 1TB. Компания позиционирует сервис для использования людьми креативных профессий — дизайнерам, фотографами, музыкантами и так далее — теми, кто работает с большими объёмами данных, но испытывает сложности с пересылкой их друг другу из-за ограничений почтовых служб и сервисов синхронизации и пересылки.
Рубрика «big data» - 144
SoShare — 1 терабайт бесплатно от BitTorrent
2013-02-16 в 23:44, admin, рубрики: big data, bittorrent, cloud storage, Peer-to-Peer, Облачные вычисления, метки: bittorrent, cloud storageСоциальные сети как инструмент прогнозирования и оперативной социологии
2013-02-05 в 8:36, admin, рубрики: big data, аналитика, будущее здесь, веб-аналитика, голос, Пентагон, социальные медиа, социальные сети, Твиттер, метки: аналитика, будущее здесь, голос, Пентагон, социальные медиа, социальные сети, ТвиттерВсегда отрадно видеть, как западные тренды приходят на родные просторы, а технологии даже идут с опережением. Весь цивилизованный мир давно уже бурлит на тему использования Online Big Data и пользовательского контента социальных сетей, как поля для анализа, выявления трендов и общественных настроений и прогнозирования будущего. Пентагон объявляет тендеры на разработку прогнозной системы, больницы анализируют твиттер для предсказания эпидемий, а некоторые даже предсказывают стихийные бедствия и их последствия, анализируя контент социальных медиа.
Заметив серьёзный интерес Хабра к теме открывающихся на волне роста публичного контента и развития технологий Online Big Data, безграничных возможностей оперативной социологии и прогностики, я решил раскрыть тему подробнее и поделиться с вами практическим примером предсказания результатов финала телепроекта Голос.
Мы проверили, сможет ли Brand Analytics предсказать результаты финала. И можем сказать, что нам это удалось. За несколько часов до финала мы уже не сомневались, как проголосуют телезрители:

Читать полностью »
Data Mining: Первичная обработка данных при помощи СУБД. Часть 3 (Сводные таблицы)
2013-01-21 в 19:01, admin, рубрики: big data, data mining, kaggle, pivot tables, postgresql, sql, titanik, метки: big data, data mining, kaggle, pivot tables, postgresql, titanik Данная серия посвящена анализу данных для поиска закономерностей. В качестве примера используется одна из обучающих задач сообщества спортивного анализа данных Kaggle. Хотя размеры данных для задачи не большие, методы обработки, которые будут рассматриваться вполне применимы для больших объемов данных.
После выполнения Часть 1 и Части 2 сформировались две таблицы, содержащие преобразованные данные.
titanik_test_3 и titanik_train_3.
Читать полностью »
Data Mining: Первичная обработка данных при помощи СУБД. Часть 1
2013-01-09 в 13:02, admin, рубрики: big data, data mining, kaggle, sql, titanik, анализ данных, метки: data mining, kaggle, sql, titanik, анализ данныхО чем статья
В задачах исследования больших объемов данных есть множество тонкостей и подводных камней. Особенно для тех, кто только начинает исследовать скрытые зависимости и внутренние связи внутри массивов информации. Если человек делает это самостоятельно, то дополнительной трудностью становится выбор примеров, на которых можно учиться и поиск сообщества для обмена мнениями и оценки своих успехов. Пример не должен быть слишком сложным, но в тоже время должен покрывать основные проблемы. озникающие при решении задач приближенных к реальности, так чтобы задача не воспринималась примерно вот так:

С этой точки зрения, очень интересным будет ресурс Kaggle[1], который превращает исследование данных в спорт. Там проводят соревнования по анализу данных. Некоторые соревнования — с обучающими материалами и предназначены для начинающих. Вот именно обучению анализу данных, на примере решения одной из обучающих задач, и будет посвящён цикл статей. Первая статья будет о подготовке данных и использованию СУБД для этой цели. Собственно, о том, как и с чего начать. Предполагается что читатель понимает SQL.
Читать полностью »
Введение в HDInsight
2013-01-09 в 4:42, admin, рубрики: big data, Блог компании Microsoft, метки: big data HDInsight Services for Windows Azure — это сервис, позволяющий работать с кластером Apache Hadoop в Облаке, предоставляющий программную среду для операций управления, анализа и отчетности по Большим Данным.
Читать полностью »
12 инструментов, о которых необходимо знать каждому программисту, работающему с Big Data
2012-12-29 в 9:09, admin, рубрики: big data, Блог компании CloudsNN, Большие данные, большие объемы данных, Облачные вычисления, средства аналитики
Проектируете ли вы систему для анализа Big Data или просто пытаетесь собирать и обрабатывать данные своих мобильных приложений, вам никак не обойтись без качественных инструментов для аналитики. Хорошей новостью является то, что в данный момент множество компаний выпускают на рынок инструменты, учитывающие потребности разработчиков и соответствующие их навыкам.
Читать полностью »
MilkyWeb — Graph of Everything
2012-12-23 в 10:57, admin, рубрики: big data, semantic web, графы, онтологии, Семантическая Сеть, социальные сети, Социальные сети и сообщества, я пиарюсь, метки: big data, semantic web, графы, онтологии, социальные сети 
В данной статье я хочу поделиться своими мыслями по поводу способов решения фундаментальных проблем современного Интернета. Хочу описать модель, которая, по моему мнению, может помочь ещё лучше упорядочить знания в интернете, и продемонстрировать свою попытку реализации такой модели.
Читать полностью »
Инвесторы возлагают большие надежды на Big Data
2012-12-07 в 9:59, admin, рубрики: big data, Блог компании CloudsNN, большие объемы данных, Облачные вычисления
Необходимость в анализе больших объемов информации быстро выходит за рамки исключительно коммерческого использования.
Big Data оказывает серьезное влияние на решения, принимаемые людьми, начиная с выборов президента и заканчивая покупкой чашечки кофе. Сфера анализа больших объемов информации стала настолько прибыльной, что инвесторы из штата Массачусетс торопятся найти очередную будущую многомиллиардную компанию, чтобы успеть инвестировать в нее сейчас.
На сегодняшний день коммерческое использование Big Data в основном существует в виде контекстной рекламы – стоит только вспомнить пророческий в этом плане сервис Google ads.
Читать полностью »
Big Data – почему это так модно?
2012-12-06 в 7:40, admin, рубрики: big data, Hadoop, MapReduce, Большие данные, большие объемы данных, Песочница, СУБД, хранилища данных, метки: big data, Hadoop, MapReduce, Большие данные, большие объемы данных, СУБД, хранилища данныхТехнологии Big Data сегодня очень популярны, о чем говорит хотя бы то, что на текущий момент это наиболее часто встречающийся термин в IT-публикациях. Достаточно посмотреть на статистику таких известных поисковых систем, как Google или Yandex по словосочетанию «Big Data», и становится понятным, что так называемые «Большие Данные» действительно сейчас можно назвать одним из самых востребованных и интересных направлений развития информационных технологий.
Так в чем же секрет популярности этих технологий и что означает термин «Big Data»? Читать полностью »
MapReduce 2.0. Какой он современный цифровой слон?
2012-12-05 в 9:14, admin, рубрики: big data, BigData, MapReduce, YARN, параллельное программирование, метки: BigData, MapReduce, YARN 
Если ты ИТшник, то нельзя просто так взять и выйти на работу 2-го января: пересмотреть 3-ий сезон битвы экстрасенсов или запись программы «Гордон» на НТВ (дело умственных способностей вкуса).
Нельзя потому, что у других сотрудников обязательно будут для тебя подарки: у секретарши закончился кофе, у МП — закончились дедлайны, а у администратора баз данных — амнезия память.
Оказалось, что инженеры из команды Hadoop тоже любят побаловать друг друга новогодними сюрпризами.
2008
2 января. Упуская подробное описание эмоционально-психологического состояния лиц, участвующих в описанных ниже событиях, сразу перейду к факту: поставлен таск MAPREDUCE-279 «Map-Reduce 2.0». Оставив шутки про число, обращу внимание, что до 1-ой стабильной версии Hadoop остается чуть менее 4 лет.
За это время проект Hadoop пройдет эволюцию из маленького инновационного снежка, запущенного в 2005, в большой снежный com ком, надвигающийся на ИТ, в 2012.
Ниже мы предпримем попытку разобраться, какое же значение январский таск MAPREDUCE-279 играл (и, уверен, еще сыграет в 2013) в эволюции платформы Hadoop. Читать полностью »

