Расскажу историю длиною в полгода на которой прекрасно прочувствовал все прелести современных инструментов и способов эксплуатации llm.
Рубрика «llm» - 20
Наглядный пример, зачем нужны агенты
2026-04-26 в 4:34, admin, рубрики: AI, llm, OpenClaw, rag, Агент, память, поискAuto AI Router: высокопроизводительный прокси-роутер для LLM API на Go
2026-04-25 в 14:49, admin, рубрики: docker, docker-compose, gemini, github, Go, LiteLLM, llm, OpenAI, vertexЕсли вы работаете с LLM-провайдерами, то наверняка сталкивались с одной и той же проблемой: у OpenAI лимит 100 RPM на ключ, у Vertex AI — свои квоты на проект, у Anthropic — отдельные ограничения. В итоге приходится держать несколько ключей, балансировать нагрузку вручную, следить, чтобы один заблокированный доступ не уронил всё приложение, и при этом хочется сохранить единый OpenAI-совсместимый эндпоинт для клиентского кода.
Именно для этого и создан Auto AI RouterЧитать полностью »
AI в iOS-разработке: что у меня реально закрепилось в 2026, а что я выкинул
2026-04-24 в 8:15, admin, рубрики: ai-агенты, claude code, cursor, iOS, llm, MCP, swift, swiftUI, workflow, xcodeЗа последние полгода я перетряс свой рабочий стек полностью: Cursor, Claude Code, Codex, локальные Qwen-модели для ревью, несколько итераций своего AGENTS.md, Xcode MCP, mobile-mcp, Conductor для параллельных сессий. Что-то прижилось, что-то я удалил через неделю, а какие-то практики, которые ещё весной казались обязательными, сейчас выглядят странно.
Ниже — мои личные заметки по итогам этих полугода, а не обзор индустрии. Многое я подсмотрел у коллег и в чатах, не всё придумал сам.
1. Минимализм в AGENTS.md
Если у вас CLAUDE.md (или AGENTS.mdЧитать полностью »
Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token
2026-04-24 в 4:19, admin, рубрики: llm, python, инфраструктура, оптимизация, Прокси-серверыВведение: Почему обычный Rate Limiting не работает для LLM?
Деплой больших языковых моделей (LLM) — это всегда боль, когда дело доходит до пиковых нагрузок. В классических web-сервисах при высоких RPS мы просто включаем балансировщик, а если всё горит — жестко режем запросы HTTP 429 Too Many Requests.
Но в мире генеративного AI отбрасывать запросы клиентов очень дорого: пользователь уже подождал, пока загрузится чат, написал длинный промпт, нажал Enter и… получил ошибку. А масштабирование GPU-кластера занимает минуты, которых у нас нет.
В этой статье мы покажем, как подход “Динамической лени”Читать полностью »
Практическое руководство по Qwen: установка, настройка vLLM и работа через API
2026-04-22 в 12:00, admin, рубрики: AI, inference, llm, ml, OpenAI, openai api, qwen, selectel, self-hosted, vllmЗапускаем Qwen3.6 35B-A3B + opencode локально на RTX 4070 12GB — AI-ассистент для разработки без облака
2026-04-22 в 9:30, admin, рубрики: ai-ассистент, llama.cpp, llm, LM Studio, opencode, qwen, rtx 4070, искусственный интеллект, локальные моделиЯ давно слежу за развитием локальных LLM, но всегда упирался в одно и то же — либо модель маленькая и качество не устраивает, либо большая и не влезает в видеопамять. Всё изменилось когда я наткнулся на статью про MoE-модели и параметр -cmoe в llama.cpp.
Расскажу как я запустил Qwen3.6 35B-A3B на RTX 4070 12GB с 32GB RAM, настроил его как AI-ассистент для реального проекта в opencode, и почему теперь эта модель у меня работает постоянно.
Железо и ожидания
Моя конфигурация:
-
GPU: RTX 4070 12GB VRAM
-
RAM: 32GB DDR4
-
CPU: 12 физических ядер
-
OS: Windows 11 + WSL2 (Ubuntu)
Клинический профиль Gemini: синдром дефицита внимания, пикацизм и психопатия по Ганнушкину
2026-04-21 в 8:52, admin, рубрики: gemini, llm, галлюцинации ИИ, нейросети, промпт-инжиниринг, психология, СДВГ, управлениеGemini (Google)
Читать полностью »
Интеграция Google Gemini API в асинхронный Telegram-бот на aiogram 3.x и Python
2026-04-19 в 15:15, admin, рубрики: aiogram, gemini api, llm, python, rate limiting, асинхронное программированиеВ прошлую пятницу, ровно в 18:47, когда я уже мысленно открывал великолепный, наполненный витаминами, напиток, мне прилетело сообщение от тимлида: «Бот лежит, пользователи жалуются, Gemini API возвращает 429». Наш корпоративный Telegram-бот, который должен был помогать саппорту отвечать на тикеты, просто встал колом. Причина оказалась до банальности простой: мы не учли rate limiting и думали, что 50 RPM (запросов в минуту) на бесплатном тарифе — это «бесконечно много». С тех пор мы переписали архитектуру, добавили очереди, кэширование и middleware для retry. В этой статье разберу, как с нуля подружить Gemini API с Telegram-ботом на aiogram 3.x, не наступая на те же грабли.Читать полностью »


