Рубрика «парсинг»
Как мы измеряли рекламные обещания регулярками и почему первая выгрузка соврала вдвое
2026-09-16 в 15:09, admin, рубрики: python, выборка, качество данных, контент-анализ, ошибки разметки, парсинг, разметка данных, Регулярные выражения
HTTP 200 на несуществующий адрес: пять способов, которыми Telegram обманул мои проверки
2026-09-03 в 11:57, admin, рубрики: http, telegram, отладка, парсинг, тестированиеПостановка
Есть список публичных адресов Telegram. По каждому надо ответить на два вопроса: существует ли он и что это за сущность. Дальше у каналов прочитать публичное превью и классифицировать содержимое.
Никакого API: MTProto для такой задачи избыточен, а веб-превью Telegram отдаёт всё нужное обычным GET. Казалось бы, сорок строк на fetch и разбор.
Ловушка 1. Несуществующий адрес отвечает 200
Первое предположение: раз имя свободно, будет 404. Не будет.
GET https://t.me/zzqqxx_not_a_real_channel_9182
HTTP/2 200
<meta property="og:title" content="Telegram: Contact @zzqqxx_not_a_real_channel_9182">
<meta property="og:image" content="https://telegram.org/img/t_logo_2x.png">
<meta property="og:description" content="">
Более 100 000 вакансий: полный анализ IT‑рынка России в 2026 году. И почему hh.ru нас обманывает?
2026-08-17 в 5:17, admin, рубрики: 1c, python, анализ данных, аналитика, графики, найм, парсинг, российский рынок, рынок трудаПривет! (И тебе, IT‑шник, который хочет разобраться, что в 2026 вообще здесь происходит? Сейчас разберёмся, но легче тебе от этого не станет).
У меня была статья, где я спарсил 62 000 Python вакансий с hh и внезапно выкопал довольно дикие вещи? (Если не видели, то советую сначала перечитать её, но это не обязательно). Мои исследования тогда закончились тем, что hh в апреле 2026 просто прикрыл API и на этом вся аналитика оборвалась. Хотя я вообще‑то планировал собирать данные целый год, а не какие‑то несчастные 9 месяцев.
Тихо неправильные данные хуже упавшего скрипта
2026-08-07 в 11:51, admin, рубрики: cli, crates.io, fasta, fastq, open source, Rust, биоинформатика, парсингСкрипт, который упал, вы почините за пять минут. Скрипт, который отработал молча и выдал неправильный ответ, вы не почините никогда, потому что не узнаете, что он сломан.
В работе с FASTA и FASTQ таких мест неприлично много. Почти все они когда‑то были задуманы как удобство.
Вот три, с которыми я сталкивался чаще всего.
Первое. Инструмент пишет FASTQ, а качества у записи нет. Вместо ошибки он подставляет строку из I. Файл получается валидный, парсер доволен, а фильтр по качеству дальше по пайплайну видит идеальные риды и пропускает всё подряд.
Второе.Читать полностью »
6,9к за восемь лет и 121к за полгода: аномалия в данных одного телеграм-канала
2026-08-07 в 10:43, admin, рубрики: telegram, аналитика данных, визуализация данных, выборы 2026, Инфографика, парсинг, подписчики, политические партии, статистика, яблоко
Я понимаю, что Хабр не политическая платформа, я хорошо знаком с правилами, понимаю, что получу массу минусов в карму, а может, и бан.
Но!
Как я перенёс проверку цен с VPS на компьютеры пользователей — и зачем всё-таки оставил сервер
2026-08-06 в 13:47, admin, рубрики: desktop-приложение, fastapi, playwright, python, windows, архитектура по, локальная обработка, маркетплейсы, парсинг, распределённая системаКогда я начал делать сервис для наблюдения за ценами на маркетплейсах, первая архитектура казалась очевидной: пользователь передаёт ссылку, сервер открывает страницу, извлекает цену и по расписанию повторяет проверку.
На схеме всё выглядело просто. На практике сервер быстро превратился в самое ненадёжное место системы.
Страницы, которые нормально открывались в обычном браузере, с VPS возвращали 403Читать полностью »
Я собрал конвейер аналитики банков на LLM-агентах. Показываю, где он остановил 7 из 31
2026-08-05 в 7:33, admin, рубрики: llm, postgresql, банки, ии-агенты, качество данных, парсингУ проекта есть работающий сайт: ortant.net. На нём 24 принятых исследования, десять досье банков, карта покрытия данных и раздел с методикой. Исследование можно не только прочитать, но и заказать: конструктор собирает вопрос из готовых блоков (банк, окно, фокус), система бесплатно показывает паспорт данных с ценой, и после подтверждения идёт прогон. Медиана прогона $0,132 и 12,8 минуты; результат открывается своей страницей.
IP, браузер, TLS: три слоя, на которых палится парсер
2026-07-01 в 7:52, admin, рубрики: clienthello, Go, headless-браузер, JA3, JA4, TLS-фингерпринтинг, антибот, криптография, парсинг, проксиДисклеймер. Речь не о взломе и не о нагрузке на чужие серверы. Я работал с публичными страницами товаров — теми, что видит любой человек без логина, — и ходил туда раз в несколько часов. Это история о том, как я разбирался, почему меня блокируют. Рабочие параметры и точные обходы намеренно опущены: тут про механизмы, а не про готовый инструмент для взлома интернета.
С чего все началось
Хотел простую вещь: отслеживать цену на пару товаров, которые ждал со скидкой. Чтобы не заходить руками каждый день, а получить уведомление, когда подешевело.
Думал, это вечер работы. Читать полностью »
Как я за неделю перевела десктоп-парсер на SaaS, потому что Яндекс ввёл платный API
2026-06-30 в 9:36, admin, рубрики: API Яндекса, fastapi, pyside6, python, SaaS, wordstat, архитектура, монетизация, парсинг, пет-проектТехнический пост-мортем: что было, что сломалось, и что в итоге собралось.
Контекст: умер xml-river, keykollector появился API Wordstat
Я работаю в контекстной рекламе и аналитике 6 лет. Самым массовым инструментом для сбора семантики в моём окружении был KeyCollector. Сам KeyCollector давно не парсил Wordstat напрямую — он работал через стороннее расширение xml-river, которое проксировало запросы к Wordstat в обход капчи. Когда xml-river в какой-то момент перестал работать, эта связка обвалилась, и у тысяч специалистов одновременно возникла одна и та же проблема: как теперь снимать частотность?
И снова самый быстрый парсер JSON. Очередной
2026-06-29 в 15:05, admin, рубрики: AVX2, Go, golang, highload, json, simd, unsafe, zero-allocation, zero-copy, парсингЗа свои 17+ лет в активной разработке я встречал много проблем, но одна преследовала меня постоянно: JSON. Нет, с самим форматом все ок, но вот с его чтением — не все норм.
Когда я только начинал работать с PHP, я списывал это на скриптовость языка. Отчасти из‑за этого я даже поменял стек. Но когда приходили по‑настоящему большие файлы, это всегда было больно. Иногда — очень. Был проект, где мы ждали не обработку информации бизнес‑логикой, а банального парсинга. Файлы доходили до десятков гигабайт и не всегда влезали в оперативку. Тогда я и заработал себе персональный todo — разобраться с этим раз и навсегда.
