Скиллы для Claude Code и Codex сейчас ставят пачками. У самых популярных сотни тысяч звёзд на GitHub, а в README встречаются конкретные цифры: «на 65% меньше токенов», «примерно на 20% дешевле». Мне захотелось проверить их так, как проверяют лекарства: против плацебо. Ниже рассказываю, как я это устроил и что получилось, включая ошибку, которую нашёл у себя в день публикации.
Рубрика «SWE-bench»
Дал девяти популярным скиллам для Claude Code плацебо: два лучше пустышки, один хуже
2026-10-08 в 10:07, admin, рубрики: claude code, llm, open source, Opus, SWE-bench, ии-агенты, плацебо, скиллы, статистикаСравнение бенчмарков LLM для разработки программного обеспечения
2024-11-14 в 13:33, admin, рубрики: Aider, BigCodeBench, ClassEval, CodeXGLUE, DevQualityEval, HumanEval, llm, SWE-bench, бенчмарки, бенчмаркинг
В этой статье мы сравним различные бенчмарки, которые помогают ранжировать крупные языковые модели для задач разработки программного обеспечения.
Серия публикаций о бенчмаркинге LLM
Прочтите все остальные статьи из серии Symflower об оценке LLM и ознакомьтесь с нашим последним подробным обзором Читать полностью »
