Рубрика «qwen»

Все цифры сняты с работающего стенда: потребление токенов — за календарную неделю по данным шлюза, метрики движка — кумулятивно за период аптайма (11 426 обработанных запросов). Продолжение — про выбор модели по замерам, а не по бенчмаркам — будет отдельной статьёй.

Для кого эта статья

Для тех, кто держит или собирается держать LLM внутри контура: тимлидов, DevOps, архитекторов. Здесь конфиги, цифры и грабли, а не введение в трансформеры.

Читать полностью »

Все сервисы и лимиты проверялись 16 августа 2026 года. Условия бесплатных тарифов могут меняться.

Получить API-доступ к современным языковым моделям можно не только напрямую у крупных провайдеров. Существуют сторонние роутеры, которые дают бесплатные модели, ежедневные лимиты или стартовые кредиты.

Я собрал 6 таких сервисов и посмотрел, что именно получает новый пользователь после регистрации: какой баланс начисляют, какие модели доступны, какие ограничения действуют и можно ли действительно отправлять запросы через API.

В подборку вошли OrcaRouter, TeamoRouter, AgentRouter, Token Harbor, NaraRouter и FreeRouter.


OrcaRouter

Читать полностью »

Все началось вообще не с идеи написать очередной бенчмарк. Мне нужно было собрать локальный пайплайн для длинных подкастов: получить транскрипт, найти в нем интересные куски, выбрать несколько сильных фрагментов и уже из них делать короткие вертикальные ролики.

Облачные модели с этой задачей справляются, но постоянно гонять туда длинные расшифровки не очень хотелось. Плюс было интересно понять, насколько далеко сейчас можно уехать на железе.

Под рукой была GTX 1080 Ti на 11 ГБ. Карта 2017 года, архитектура Pascal, никаких Tensor Cores.

Читать полностью »

Я хотел получить на Mac простую вещь: нажать глобальную горячую клавишу, надиктовать сообщение и сразу увидеть текст в активном окне. Без отправки аудио в облако, без ежемесячной подписки и с возможностью самому сравнить несколько моделей на собственной речи.

Так появился VoiceSwitch — открытое menu bar-приложение для Apple Silicon. Сейчас оно умеет переключаться между четырьмя движками распознавания, показывать состояние записи и расшифровки, автоматически вставлять результат и локально превращать устную речь в аккуратное или краткое сообщение.

Читать полностью »

Сначала контекст. Я делаю внутреннего read-only агента для инфраструктурных расследований: он может читать данные, но не изменять production. Инженер пишет ему в Mattermost или резервном web-чате обычный вопрос: «почему сервис отдаёт 502?», «кто выкатил эту версию?» или «что изменилось перед инцидентом?». Агент сам собирает данные из Kubernetes, VictoriaMetrics, Elasticsearch, GitLab, Grafana, GSLB и других эксплуатационных источников, а затем возвращает ответ с доказательствами и явно перечисленными пробелами.

Читать полностью »

Под капотом AI Free: три разных способа работы с веб-провайдерами, единый агентный рантайм, память, skills и много кода восстановления после сбоев.


У веб-версий больших языковых моделей есть странное свойство: для человека они доступны в один клик, а для программы между «отправить вопрос» и «получить ответ» внезапно вырастает целая инфраструктура.

Читать полностью »

Спойлер: коды готовы — вставьте и пользуйтесь.

Логотипы ChatGPT, DeepSeek, Qwen и кнопка

Пример кнопки. Логотипы являются товарными знаками компаний.

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js