Рубрика «SWE-bench»

Скиллы для Claude Code и Codex сейчас ставят пачками. У самых популярных сотни тысяч звёзд на GitHub, а в README встречаются конкретные цифры: «на 65% меньше токенов», «примерно на 20% дешевле». Мне захотелось проверить их так, как проверяют лекарства: против плацебо. Ниже рассказываю, как я это устроил и что получилось, включая ошибку, которую нашёл у себя в день публикации.

Почему «со скиллом и без» мало что доказывает

Читать полностью »

Сравнение бенчмарков LLM для разработки программного обеспечения - 1

В этой статье мы сравним различные бенчмарки, которые помогают ранжировать крупные языковые модели для задач разработки программного обеспечения.

Серия публикаций о бенчмаркинге LLM

Прочтите все остальные статьи из серии Symflower об оценке LLM и ознакомьтесь с нашим последним подробным обзором Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js