В сентябре 2026 года на Hugging Face есть 3 модели, которые хочется поставить на пару DGX Spark под Claude Code: DeepSeek‑V4.1-Flash на 552B, GLM-5.3-Flash на 320B и Qwen3.8-Flash‑Next на 125B. Первая лучше всех в бенчмарках, но не помещается в 243 ГиБ даже в 4 битах. Вторая занимает 198 ГБ и грузится 15 минут. Третья влезает в один спарк — если не считать 2 ГБ, которых ей не хватает. Ниже — почему на этом кластере выбор делает арифметика памяти, а не таблица бенчмарков, почему 6 миллиардов активных параметров не дают 90 ток/с, и почему для Claude Code решающим оказывается не tok/s, а один флаг vLLM, который в самом быстром конфиге выключен.
Рубрика «gb10»
Выбор агентской модели для кластеров из 2× DGX Spark (сентябрь 2026)
2026-09-24 в 15:06, admin, рубрики: claude code, DGX Spark, gb10, NVFP4, prefix caching, vllm, локальные llm, спекулятивное декодирование, тензорный параллелизмКак я собрал на DGX Spark приватный AI-сервер, и теперь рассказываю, что туда вошло
2026-05-03 в 9:15, admin, рубрики: arm64, DGX Spark, Dify, gb10, llm, rag, ragflow, vllmУ меня на столе стоит небольшая золотистая коробочка размером чуть больше Mac mini. Внутри — приватный AI-сервер: чат с локальной 26B-моделью, поисковая индексация моих документов с GPU-парсингом, конструктор агентов в Dify, RAGFlow для тяжёлого парсинга PDF, мониторинг, бэкапы, опциональный кластер из двух машин по QSFP 200G. Тридцать контейнеров, пять минут на установку через sudo bash install.sh, ноль обращений к внешним API.
