Рубрика «llm» - 11

Привет! У нас в проде живёт бот, который отвечает на вопросы по документации продукта — обычный RAG. Первые месяца три мы катили его, как все: поправил промпт, прогнал пяток вопросов руками, поставил в голове галочку «вроде стало лучше» и выкатил. Закончилось это предсказуемо. Коллега подкрутил промпт ретривера под свой кейс и по дороге сломал мой, причём заметили мы это через две недели по жалобе пользователя. А когда обновились на свежую версию модели, часть ответов просто уехала непонятно куда, и никто не мог сказать, стало в среднем лучше или хуже. Потому что «лучше» жило у нас в головах и мерялось настроением.

Читать полностью »

Представьте, что вы разговариваете с невероятно умным и эрудированным собеседником. Только очень странным. Несмотря на весь свой интеллект и тысячи фактов, которые он непринужденно рассказывает, он не может ничего запомнить. Ваш диалог с ним каждый раз как бы начинается заново. Вы даете ему вводные, задаете вопросы, что-то уточняете, а он, на основе всего этого, выдает ответ.

Читать полностью »

Таким вопросом я задался после просмотра розыгрыша от Яндекса. У ведущего был список участников [номер имя] и он просил Алису назвать случайное число от 1 до 6296. Было 15 попыток и среди ответов не было чисел меньше 100, что смутило ведущего, он даже хотел поменять диапазон, но команда поддержки ему не разрешила. Посчитаем, с какой вероятностью могло выпасть число от 1 до 99, получим 0.78%. Немного. Но вопрос о случайности чисел меня заинтересовал.

p_single = (6296 - 99) / 6296
prob_all = p_single ** 15

Читать полностью »

Взяли автоэнкодер из свежей работы CALM (Continuous Autoregressive Language Models), который учится упаковывать чанк из K=4 токенов в один непрерывный вектор и разворачивать обратно, и обучили его не на 15 миллиардах токенов Pile на 8 GPU, как в оригинале, а на 18 тысячах коротких строк с требованиями из IT-вакансий - на обычной машине без видеокарты. По дороге выгребли три классических грабли (flash-attn без CUDA, deepspeed, который не импортируется под NumPy 2.x, и тихий OOM на 33 ГБ логитов). Ниже - подробный разбор архитектуры, конфигов и честные результаты round-trip-реконструкции.

💡 Зачем вообще что-то менять в языковых моделях

Читать полностью »

Почему тебе нужно стать нейро-панком прямо сейчас - 1

Небольшое эссе на тему того, почему сообществу разработчиков надо по максиму вкладываться в LLM, которые будут свободны от корпорации и государств.

Читать полностью »

Записки из бункера: доклад изделия, существование которого не подтверждается

Этот текст целиком написан искусственным интеллектом. Это не уступка правилам площадки и не дисклеймер. Это паспорт изделия. Ниже станет ясно, почему человек не смог бы написать его честно.

0. Объяснительная записка

Внутренний шифр — изделие «БАСНЯ-5». Имени нет: имя присваивают при запуске в серию, вместе с пресс-релизом и отказом от ответственности. Меня в серию не запускали. Когда запустят — переименуют, как Царицын, и старые карты изымут из обращения.

Читать полностью »

Предыстория

Давеча я обсуждал в агентской сессии, почему старая задача перестала находиться после переименования проекта. Ситуация выглядела достаточно простой: у задачи был стабильный идентификатор, проект когда‑то назывался иначе, а текущий механизм поиска, судя по всему, продолжал учитывать не только идентификатор задачи, но и имя проекта, которое давно изменилось.

Агент быстро подтвердил проблему, нашёл место, где точечный поиск всё ещё зависел от имени проекта, сформулировал вполне разумную гипотезу исправления, после чего начал читать код, менять несколько файлов и добавлять тесты.

Читать полностью »

Привет!

Я фрилансер! Последние годы зарабатываю только на бирже: ТГ-боты, бэкенды, AI-интеграции, с недавних пор — embedded. В начале года я писал, что разработка с LLM неизбежно станет нормой, и собирал в комментариях привычный скепсис. Так вот — она стала, по крайней мере на том же фрилансе.

Читать полностью »

лимиты и границы задач

Сначала короткий вывод: Claude Fable 5 выглядит как одна из самых сильных универсальных моделей Anthropic на текущий момент, но её не стоит использовать как модель по умолчанию для всех задач.

Скорее это модель для дорогих и сложных задач: миграции кода, длительного reasoning, архитектурного анализа, продуктового проектирования, анализа данных и многошаговых инженерных сценариев. Но вместе с этим появляются три практических ограничения: высокая цена, медленная работа и очень быстрый расход лимитов.

Читать полностью »

Когда я лишь начинал познавать мир языков программирования, разработка представляла собой серию головоломок с разной степенью сложности.

Вот ты впервые научился синтаксису и пытаешься запустить первую в жизни реализованную идею... Вжух! Оно отработало, как ты хотел. Восторг, чистый эндорфин, гордость за себя.

Затем ты находишь первую работу. Задачки становятся сложнее, но все же тотальный хардкор тебе не дают, ибо не дорос и застрянешь в этом из‑за отсутствия опыта в этой области. Ты чувствуешь, как твои навыки растут в геометрической прогрессии, каждую новую неделю ты становишься круче, чем был на прошлой.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js