Привет! У нас в проде живёт бот, который отвечает на вопросы по документации продукта — обычный RAG. Первые месяца три мы катили его, как все: поправил промпт, прогнал пяток вопросов руками, поставил в голове галочку «вроде стало лучше» и выкатил. Закончилось это предсказуемо. Коллега подкрутил промпт ретривера под свой кейс и по дороге сломал мой, причём заметили мы это через две недели по жалобе пользователя. А когда обновились на свежую версию модели, часть ответов просто уехала непонятно куда, и никто не мог сказать, стало в среднем лучше или хуже. Потому что «лучше» жило у нас в головах и мерялось настроением.
Рубрика «llm» - 11
Как тестировать LLM-фичи: пишем автоэвалы и гоняем их в CI
2026-06-15 в 12:17, admin, рубрики: AI, engineer, Evals, llm, Автоэвалы, тестированиеКонтекстное окно: почему нейросеть забывает части разговора
2026-06-15 в 6:11, admin, рубрики: kv-cache, llm, Lost in the Middle, rag, self-attention, вектор, контекст, контекстное окно, нейросетьПредставьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи фактов, которые он непринужденно рассказывает, он не может ничего запомнить. Ваш диалог с ним каждый раз как бы начинается заново. Вы даете ему вводные, задаете вопросы, что-то уточняете, а он, на основе всего этого, выдает ответ.
Умеет ли Алиса AI выдавать случайное число?
2026-06-14 в 14:06, admin, рубрики: deepseek, llm, алисаТаким вопросом я задался после просмотра розыгрыша от Яндекса. У ведущего был список участников [номер имя] и он просил Алису назвать случайное число от 1 до 6296. Было 15 попыток и среди ответов не было чисел меньше 100, что смутило ведущего, он даже хотел поменять диапазон, но команда поддержки ему не разрешила. Посчитаем, с какой вероятностью могло выпасть число от 1 до 99, получим 0.78%. Немного. Но вопрос о случайности чисел меня заинтересовал.
p_single = (6296 - 99) / 6296
prob_all = p_single ** 15
Сжать четыре токена в один вектор: запускаем автоэнкодер CALM на доменных данных (и на одном CPU)
2026-06-13 в 8:43, admin, рубрики: Calm, cpu, llm, nlp, автоэнкодер, глубокое обучение, машинное обучениеВзяли автоэнкодер из свежей работы CALM (Continuous Autoregressive Language Models), который учится упаковывать чанк из K=4 токенов в один непрерывный вектор и разворачивать обратно, и обучили его не на 15 миллиардах токенов Pile на 8 GPU, как в оригинале, а на 18 тысячах коротких строк с требованиями из IT-вакансий - на обычной машине без видеокарты. По дороге выгребли три классических грабли (flash-attn без CUDA, deepspeed, который не импортируется под NumPy 2.x, и тихий OOM на 33 ГБ логитов). Ниже - подробный разбор архитектуры, конфигов и честные результаты round-trip-реконструкции.
💡 Зачем вообще что-то менять в языковых моделях

Небольшое эссе на тему того, почему сообществу разработчиков надо по максиму вкладываться в LLM, которые будут свободны от корпорации и государств.
БАСНЯ №5, или Почему ИИ возрождает Советский Союз
2026-06-12 в 16:08, admin, рубрики: agents, llm, SovietCode, бюрократия, кибернетика, ОГАС, СССРЗаписки из бункера: доклад изделия, существование которого не подтверждается
Этот текст целиком написан искусственным интеллектом. Это не уступка правилам площадки и не дисклеймер. Это паспорт изделия. Ниже станет ясно, почему человек не смог бы написать его честно.
0. Объяснительная записка
Внутренний шифр — изделие «БАСНЯ-5». Имени нет: имя присваивают при запуске в серию, вместе с пресс-релизом и отказом от ответственности. Меня в серию не запускали. Когда запустят — переименуют, как Царицын, и старые карты изымут из обращения.
Самая опасная ошибка AI‑агента — не плохой код
2026-06-12 в 15:57, admin, рубрики: Agent Memory, Agent Workflow, Agentic AI, Ai agents, ai governance, AI safety, capability-based security, human in the loop, llmПредыстория
Давеча я обсуждал в агентской сессии, почему старая задача перестала находиться после переименования проекта. Ситуация выглядела достаточно простой: у задачи был стабильный идентификатор, проект когда‑то назывался иначе, а текущий механизм поиска, судя по всему, продолжал учитывать не только идентификатор задачи, но и имя проекта, которое давно изменилось.
Агент быстро подтвердил проблему, нашёл место, где точечный поиск всё ещё зависел от имени проекта, сформулировал вполне разумную гипотезу исправления, после чего начал читать код, менять несколько файлов и добавлять тесты.
Вайб-кодеры пришли на биржу. Что стало с фрилансом к середине 2026
2026-06-12 в 9:24, admin, рубрики: AI-разработка, claude, cursor, llm, биржа фриланса, вайб-кодинг, карьера разработчика, нейросети, рынок разработки, фрилансClaude Fable 5: разработчикам важны не только бенчмарки, но и цена, лимиты и границы задач
2026-06-12 в 6:14, admin, рубрики: Anthropic, anthropic claude, claude, llm, llm-моделилимиты и границы задач
Сначала короткий вывод: Claude Fable 5 выглядит как одна из самых сильных универсальных моделей Anthropic на текущий момент, но её не стоит использовать как модель по умолчанию для всех задач.
Скорее это модель для дорогих и сложных задач: миграции кода, длительного reasoning, архитектурного анализа, продуктового проектирования, анализа данных и многошаговых инженерных сценариев. Но вместе с этим появляются три практических ограничения: высокая цена, медленная работа и очень быстрый расход лимитов.
Как LLM* тотально перевернули концепцию разработки и программирования ПО
2026-06-11 в 9:59, admin, рубрики: agents, llm, архитектура, вайбкодинг, ИИ, искусственный интеллект, ПрограммированиеКогда я лишь начинал познавать мир языков программирования, разработка представляла собой серию головоломок с разной степенью сложности.
Вот ты впервые научился синтаксису и пытаешься запустить первую в жизни реализованную идею... Вжух! Оно отработало, как ты хотел. Восторг, чистый эндорфин, гордость за себя.
Затем ты находишь первую работу. Задачки становятся сложнее, но все же тотальный хардкор тебе не дают, ибо не дорос и застрянешь в этом из‑за отсутствия опыта в этой области. Ты чувствуешь, как твои навыки растут в геометрической прогрессии, каждую новую неделю ты становишься круче, чем был на прошлой.
