При выборе движка для локальной языковой модели хочется получить простой ответ: сколько токенов в секунду она выдаст на моём компьютере? Но за одной цифрой скрываются разные задачи: обработать новый запрос, продолжить длинный диалог, обслужить несколько обращений одновременно. Ускорение в одном сценарии не обязательно означает такой же выигрыш в остальных.
Рубрика «спекулятивное декодирование»
Как Splash ускоряет локальные LLM на Mac
2026-10-01 в 8:39, admin, рубрики: Apple Silicon, DFlash 2, gguf, Inco AI, MacOS, qwen, Splash, квантование, локальные llm, спекулятивное декодированиеВыбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)
2026-09-24 в 15:06, admin, рубрики: claude code, DGX Spark, gb10, NVFP4, prefix caching, vllm, локальные llm, спекулятивное декодирование, тензорный параллелизмВ сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут. Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.
Спекулятивное декодирование: от чего на самом деле зависит ускорение
2026-09-15 в 10:32, admin, рубрики: EAGLE-3, llm, qwen3, длина принятия, инференс, спекулятивное декодирование, ускорение инференсаЯзыковая модель пишет ответ по одному токену за шаг, и на каждом шаге прочитывает все свои веса от начала до конца. Спекулятивное декодирование пытается это обойти: маленькая черновая модель набрасывает несколько токенов вперёд, причём сразу деревом вариантов, а большая проверяет всё это дерево за один свой проход и принимает ту ветку, которая совпала с её собственным выбором. Текст на выходе получается тот же самый, быстрее становится только его получение. Так устроен метод из статьи EAGLE-3 с NeurIPS 2025, и авторы приводят для него ускорение до 6.5 раза.
