Рубрика «rag»

Цель статьи — показать не абcтрактный пример как можно извлечь пользу из собственного RAG локально (если вдруг кто‑то ещё этого не сделал), и заодно посмотреть, какие основные параметры тут вообще доступны. Часто сидя на звонках я слышал от коллег: «вот хорошо бы сделать собственный RAG для Confluence», «вот бы развернуть у себя». И как будто бы навайбкодить такое решение — дело пары вечеров, но часто дальше разговоров дело не двигается.

Читать полностью »

У нашего AI‑агента поддержки было десять метрик и ноль ответов на главный вопрос: какую долю обращений он решает?

Судья, который читал только текст диалога, ставил 18/20, а проверка по реальным вызовам инструментов давала 8/20. Текстовые проверки считали правдоподобный ответ верным и не могли отличить его от подтвержденного. Самодельный «процент фантомных эскалаций» оказался измерением того, насколько слова бота согласованы с его же внутренними флагами. Каждая метрика что‑то измеряла, и ничего продуктового

Читать полностью »

У меня восемь агентов с постоянной памятью, и на всех вместе больше 360 файлов, около 1,4 МБ текста. Векторной базы нет ни одной: эмбеддинги я не считаю вообще.

И это не “руки не дошли”. Схема работает с мая 2026 года: сначала на одном агенте, с июня централизованно на всех восьми. За это время вопрос про вектор-БД я поднимал трижды, каждый раз с конкретным кандидатом на внедрение, и каждый раз закрывал его отказом. Ниже разберу, как это устроено, какими числами живет и в какой момент перестанет работать.

Рефлекс, от которого я отказался

Читать полностью »

У меня есть RAG‑сервис: проверяет фактологические утверждения в бизнес‑отчётах против реальных источников — SEC EDGAR, World Bank, FRED, Wikipedia. Это капстоун LLM Zoomcamp (DataTalksClub). Курс закончился, оценку поставили (peer review, 42/42), а я решил дотянуть проект до состояния «не стыдно показать на собеседовании как рабочий код», а не просто «закрыл критерии оценки курса».

Критерии оценки курса не требуют production‑паттернов — они про RAG‑пайплайн: retrieval, evaluation, orchestration. На собеседовании про RAG спрашивают другое — то, что курс не проверяет:

  • что будет, если сервису подсунут неправильные переменные окружения при деплое;

  • Читать полностью »

Работаю в компании «Сибинтек-Софт», занимаюсь поддержкой корпоративных информационных систем. Имею сертификат DevOps-инженера, в рамках задач отдела внедряю ИИ в рабочие процессы.

Как-то мой валидатор забраковал ответ, сославшись на статью, которой не существует.Читать полностью »

Всем привет! Меня зовут Николай.

Сначала отвечу на вопрос из заголовка. Нафаня - это агентный RAG-помощник по нормативно-технической документации, связанной со строительством и ценообразованием (методики Минстроя, ГОСТы, СНиПы, СП и профильные законы).

Эта статья о том, как устроен Нафаня, как прошла его проверка на сложном бенчмарке и как архитектура менялась шаг за шагом, чтобы преодолеть потолок метрик.

Железо, ограничения и почему архитектура именно такая

В моём распоряжении домашняя рабочая станция с двумя RTX 4070 по 16 ГБ и одной RTX 5060 на 16 ГБЧитать полностью »

Результаты годового чекапа пришли в пятницу вечером. Семь документов в личном кабинете лаборатории, в половине строк звёздочки «выше нормы» и «ниже нормы», запись к эндокринологу через две недели. Кто сдавал, тот знает этот вечер: гуглишь каждый показатель по отдельности, находишь ужасы, и нигде не написано, что все эти цифры значат вместе.

Работаю бэкендером, делаю базу знаний в Искре. Поэтому вместо поисковика открыл свой же продукт: загрузил туда все семь файлов и начал спрашивать.

Читать полностью »

В чем проблема?

При обработке больших потоков неструктурированного текста разработчики обычно выбирают один из двух путей:

  • Первый — использовать детерминированные методы. Регулярки, сигнатуры, и подобные инструменты работают быстро. Вот только никак не поймают новые, ранее не описанные паттерны.

  • Путь второй — скармливать сырые данные в ЛЛМ напрямую. В реальности этот подход быстро умирает. Отправлять огромные объемы нефильтрованного текста в языковые модели слишком дорого и медленно.

Наши аналитики почти перестали писать SQL руками и ходить к разработчикам с вопросом «а как работает эта фича». Сделал это инструмент, который мы строили для другого: он должен был сам закрывать задачи разработки. С исходной целью он провалился, и провалился интересно. Расскажу, где именно.

Почему вообще взялись

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js