Первый вариант системы выглядел вполне стандартно: документы разбиваются на фрагменты, для них считаются embeddings, пользователь задаёт вопрос, несколько наиболее подходящих фрагментов отправляются в LLM вместе с запросом. Модель формулирует ответ — на первых тестах этого было достаточно.
Проблемы начались на вопросах, которые на первый взгляд мало чем отличаются друг от друга:
-
Какая пеня установлена в договоре № 14/24.7645?
-
Кто из арендаторов не заплатил за май?
-
А у него предусмотрена индексация?
-
Контрагент предлагает добавить пеню в 0,01%. Насколько это существенно?
