Главная

Метка «grablab»

Что такое Grab:Spider?

2012-04-18 в 3:30, admin, рубрики: grab, grablab, python, spider, парсинг сайтов, метки: grab, grablab, spider, парсинг сайтов

Никак не могу дописать документацию по Grab:Spider — это часть библиотеки Grab — для написания асинхронных пауков. Подумал выкладывать куски документации на хабрахабр. Думаю, с некоторым фидбэком дело быстрей пойдёт. На данный момент в документации есть лишь введение, описывающие в общих чертах, что за это за зверь такой Grab:Spider. Его и выкладываю.Читать полностью »

Использование Grab:Spider для парсинга сайтов

2012-04-17 в 6:07, admin, рубрики: grab, grablab, python, парсинг сайтов, метки: grab, grablab, парсинг сайтов

Всем привет!

Я активный пользователь open-source фрэймворка Grab (itforge уже писал о нем здесь и здесь) и 1/2 проекта GrabLab (который занимается собственно коммерческой эксплуатацией фрэймворка). Т.к. парсим сайты мы часто, помногу и задания как правило совершенно не похожи друг на друга, хотелось бы поделится своим опытом в вопросе построения типичного парсинг проекта.

Немного про инструментарий который помогает мне в работе

В качестве рабочего браузера я использую FireFox с плагинами HttpFox (анализировать входящий/исходящий http трафик), XPather (позволяет проверять xpath выражения), SQLite Manager (просмотр sqlite таблиц), код набираю в emacs, где активно использую сниппеты (YASnippets) для часто встречающихся конструкций.

Из-за специфики фрэймворка, как правило, на первом этапе сайт полностью (или если данных много — то частично, для удобства последующей разработки) сохраняется в локальный кэш на базе mongodb, что очень экономит время, т.к. считывание страниц идет из кэша.

Читать полностью »

Python / Документация по Grab — библиотеке для парсинга сайтов

2012-03-05 в 10:27, admin, рубрики: data mining, grab, grablab, lxml, pycurl, python, spider, парсинг, метки: data mining, grab, grablab, lxml, pycurl, python, spider, парсинг

Я ранее уже рассказывал на хабре о Grab — библиотеке для парсинга сайтов и о Spider — асинхронном модуле для парсинга. Рад сообщить, что я наконец-то дописал документацию по Grab. Я решил писать всё на русском языке т.к. на английском языке мне труднее выражать мысли. На деле писанины получилось гораздо больше, чем представлялось в начале, но я таки описал практически все функции библиотеки. Я решил просто вставить сюда, оглавление, кликайте на интересный раздел и читайте о возможностях Grab:

<a rel="nofollow"Читать полностью »

Публикации RSS | Комментарии RSS

https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js

Информация

Статьи из архивов

Обсуждаемое

Рекомендуем

Метка «grablab»

Что такое Grab:Spider?

Использование Grab:Spider для парсинга сайтов

Немного про инструментарий который помогает мне в работе

Python / Документация по Grab — библиотеке для парсинга сайтов

Архив

Информация

Статьи из архивов

Обсуждаемое

Рекомендуем

Метка «grablab»

Что такое Grab:Spider?

Использование Grab:Spider для парсинга сайтов

Немного про инструментарий который помогает мне в работе

Python / Документация по Grab — библиотеке для парсинга сайтов

Новости

Актуальные темы

Архив