У проекта есть работающий сайт: ortant.net. На нём 24 принятых исследования, десять досье банков, карта покрытия данных и раздел с методикой. Исследование можно не только прочитать, но и заказать: конструктор собирает вопрос из готовых блоков (банк, окно, фокус), система бесплатно показывает паспорт данных с ценой, и после подтверждения идёт прогон. Медиана прогона $0,132 и 12,8 минуты; результат открывается своей страницей.
Рубрика «качество данных»
Я собрал конвейер аналитики банков на LLM-агентах. Показываю, где он остановил 7 из 31
2026-08-05 в 7:33, admin, рубрики: llm, postgresql, банки, ии-агенты, качество данных, парсингЗрелость управления данными: предлагаю простую методику оценки
2026-07-27 в 7:12, admin, рубрики: dama-dmbok, data governance, data management, зрелость управления данными, качество данных, культура данных, оценка зрелости, скрининг, управление даннымиTL;DR
Зрелость управления данными определяется не количеством отчётов, размером команды или наличием хранилища. Она показывает, насколько осмысленно и устойчиво компания получает данные, отвечает за них и превращает их в решения.
В статье разберём, как данные появляются в обычном бизнесе, зачем оценивать зрелость управления данными и какие модели оценки зрелости управления бывают. А в конце предложу простую авторскую методику скрининга. Надеюсь, она поможет увидеть слабые места в процессах и возможно получить пользу от работы с данными в вашей компании.
Введение
LLM-судье нельзя верить на слово: как построить надёжный гейт и проверить сами тесты
2026-07-24 в 9:57, admin, рубрики: llm, LLM-as-a-judge, LLMOps, python, архитектура систем, валидация моделей, каппа Коэна, качество данных, тестированиеВ одном из проектов я строил систему оценки ответов с двумя контурами. Первый был скучным и предсказуемым: нормализовать результат и сравнить его с эталоном. Второй использовал LLM как судью и оценивал смысл ответа целиком.
Каппа КоэнаЧитать полностью »
Как JSON‑LD начинает врать — даже когда валидатор зелёный
2026-06-19 в 9:05, admin, рубрики: JSON-LD, schema.org, Веб-разработка, качество данных, микроразметка, структурированные данные, техническое SEOНа странице услуги пользователь видел цену «от 25 000 ₽», а meta description и JSON‑LD продолжали отдавать 50000. Валидатор был зелёным.
И это был собственный сайт веб‑студии!
Разберёмся, как валидная микроразметка начинает публиковать неверные данные, почему замена одного числа не решает проблему и что на самом деле нужно проверять после изменений сайта.
Во время аудита одного из сайтов я заметил странное расхождение. На странице услуги в видимой карточке было написано: от 25 000 ₽ В теге description и JSON‑LD при этом оставалось старое значение: от 50 000 ₽ Одна страница, одна услуга, две цены.
Почему ваши dbt-тесты врут, или Зачем дата-инженеру статистика
2026-02-13 в 8:21, admin, рубрики: data quality, etl, etl-пайплайн, ETL-процессы, качество данных, статистикаПривет! Меня зовут Черняховский Денис, и я Data Engineer. Я достаточно продолжительное время работаю с данными и увлекаюсь математической статистикой. Совсем недавно решил поискать в интернете, как другие опытные дата-инженеры исследуют качество данных при помощи статистики, и обнаружил, что никак… пум-пум-пум. А далее обнаружил, что проблема уходит корнями гораздо глубже, чем может показаться.
В этой статье я постараюсь рассказать:
-
почему дата-инженерам необходимо использовать статистику и почему её не используют
-
проведём тесты на реальных примерах данных
Взгляд разметчика данных
2026-01-09 в 17:36, admin, рубрики: data science, аннотация данных, бинарная классификация, дата сайенс, качество данных, опыт работы, разметка данных, разметка изображенийДисклеймер: ниже будет описан личный опыт и точка зрения человека-исполнителя. Устройство всей процедуры разметки в статье не раскрывается. Все совпадения сущностей случайны. Названия компаний не упоминаются в целях соблюдения NDA. В статье не будут подниматься вопросы оплаты труда и разбираются только основные рабочие моменты.
Всем добрый день!
Как меняется рынок и зачем нужны конференции по Ai
2025-07-28 в 9:00, admin, рубрики: AI, data quality, data quality management, llm-модели, геоданные, ИИ, ии-ассистенты, качество данных, конференцияПривет! Меня зовут Роман Поборчий, я член программного комитета AiConf Х, которая пройдет 26 сентября 2025 в Москве. Много лет занимался сбором и организацией разметки данных для машинного обучения — и с каждым годом убеждаюсь, что реальность всегда сложнее любых представлений о ней. Поэтому и конференции, на которых можно обсудить практические кейсы, современные подходы и новые вызовы особенно ценны для индустрии.
Как посчитать «похожесть» номеров в паспортах. И найти одинаковые даже с опечатками
2020-01-15 в 10:52, admin, рубрики: cdi, data mining, data quality, Алгоритмы, Анализ и проектирование систем, Блог компании HFLabs, дедупликация, документы, информационная безопасность, качество данных, номера паспортов, паспорта
Продукты HFLabs ищут дублированных клиентов в базах федеральных компаний. Очевиднейший способ найти одинаковые клиентские карточки — сравнить паспорта или другие документы, удостоверяющие личность.
Раньше мы сравнивали номера документов строго: одинаковые — отлично, нет — извините. На ручной разбор из-за опечатки в номере уходили даже те карточки, у которых совпадали ФИО и адреса́ проживания. Такой подход излишне нагружал персонал заказчиков.
Поэтому мы с головой залезли в данные, изучили статистику и вывели критерии — когда разные номера действительно разные, а когда дело в опечатках. Рассказываю, как работает алгоритм.
Читать полностью »


