В чем проблема?
При обработке больших потоков неструктурированного текста разработчики обычно выбирают один из двух путей:
-
Первый — использовать детерминированные методы. Регулярки, сигнатуры, и подобные инструменты работают быстро. Вот только никак не поймают новые, ранее не описанные паттерны.
-
Путь второй — скармливать сырые данные в ЛЛМ напрямую. В реальности этот подход быстро умирает. Отправлять огромные объемы нефильтрованного текста в языковые модели слишком дорого и медленно.




