Рубрика «llm-модели»

Это третья статья в рамках проекта "Ситуационная осведомленность 24/7". С нее мы начинаем подготовку к развертыванию своей локальной системы круглосуточной ситуационной осведомленности. В данном материале пойдет доклад о том, как поднять свою локальную большую лингвистическую модель (далее - БЛМ).

Приступим.

Зачем вообще запускать БЛМ локально

Читать полностью »

Это вторая попытка опубликовать статью-туториал, целью которой является знакомство простых пользователей рунета с соверменными возможностями автоматизации своих рутинных задач. Одним из способов решения данной задачи является создание Telegram-ботов. Об этом далее, собственно, и пойдет речь. Хочу отметить, что это только общая вводная часть, здесь не будет представлен код, а только будет рассказ о программном обеспечении, которые мы используем в своей работе. Кроме того, хочу отметить, что статья предназначена для людей, не погруженных в тему и не знакомых с терминологией.

Читать полностью »

Не могу сказать, что обилие материалов на тему «глупый и бесполезный ИИ» в моем инфо-пузыре меня достало окончательно, но читать их надоело. И, конечно же, я не настроил хитрый фильтр-отсеиватель или прорвал свой инфо-пузырь, нет: я добавил в раздражающее меня море свою чашку или каплю воды, этот опус. Тем более, что в памяти относительно свежа недавно прочитанная книга, которую рекомендую для тщательного прочтения или, если навык чтения длинных текстов утерян, хотя бы для беглого просмотра – “The Second Machine Age”, авторов Erik Brynjolfsson и Andrew McAfee.

Читать полностью »

В последнее время большинство обсуждений агентской разработки крутится вокруг Claude Code, Codex, Gemini CLI и других облачных инструментов. Но, с одной стороны, киты индустрии блокируют нам доступы снаружи, с другой — чиновничьи умы блокируют нам доступ изнутри, потому необходимо иметь под рукой локальный инструмент для агентской разработки.

9 июня 2026 вышла модель NorthMiniCodeЧитать полностью »

Мы делаем чат-агрегатор, где в одном окне доступны GPT, Claude, Kimi и DeepSeek. Фронтенду нужно отдавать ответ в реальном времени — токен за токеном, как в ChatGPT. Бэкенд при этом ходит к четырём разным API, и стриминг у них устроен по-разному. Расскажу, как мы свели это к единому SSE-потоку наружу, и про две грабли, на которые наступили: рваные UTF-8 символы и парсинг чужих SSE.

Статья будет полезна всем, кто проксирует LLM через свой сервер.

Зачем вообще свой прокси

Читать полностью »

лимиты и границы задач

Сначала короткий вывод: Claude Fable 5 выглядит как одна из самых сильных универсальных моделей Anthropic на текущий момент, но её не стоит использовать как модель по умолчанию для всех задач.

Скорее это модель для дорогих и сложных задач: миграции кода, длительного reasoning, архитектурного анализа, продуктового проектирования, анализа данных и многошаговых инженерных сценариев. Но вместе с этим появляются три практических ограничения: высокая цена, медленная работа и очень быстрый расход лимитов.

Читать полностью »

Поднимаем Llama 3 в облаке: Ollama и Open WebUI - 1

Локально запустить LLM сегодня можно за десять минут — например, с помощью LM Studio. Но как только модели нужно дать доступ команде, подключить RAG или встроить ее в сервис — такого подхода зачастую недостаточно.

Читать полностью »

Gemma 4 обыграла Qwen Coder в задачах программирования, а режим мышления заставил модели хуже следовать инструкциям. Рассказываю почему.

Зачем я это затеял

Привет, меня зовут Вячеслав. Я интересуюсь локальными LLM и тем, как они ведут себя в реальных задачах — не на синтетических бенчмарках, а когда нужно написать работающий код, отрефакторить файл с багами или вытащить данные из HTML.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js