Рубрика «LLM-as-a-judge»

Иногда самое опасное в исследовании — получить слишком красивый результат.

Мы собрали training-free детектор галлюцинаций для RAG, получили хорошие метрики и наткнулись на группу примеров, где все шесть LLM единогласно спорили с эталонной разметкой. Сначала мы решили, что нашли общую слепую зону LLM-as-a-Judge — переносимый, заголовочный результат. Потом открыли первоисточник. И оказалось, что ошибались вовсе не модели.

Дальше — история о том, почему несущим здесь оказалась не находка и не детектор, а процедура проверки, которая поймала нас самих.

Что работает — и это мы не отзываем

Читать полностью »

Русский и английский оригиналы статьи в моём блоге.

Код и материалы.

Это подробный разбор одного эксперимента. Я взял god node из реального LangGraph агента и попросил 5 американских и 6 китайских моделей сначала предложить, как её распутать, а потом оценить предложения друг друга. Дальше тремя разными способами пытался понять, кому из них в этом деле верить.

Оглавление


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js