Уже прошло два года с тех пор, как мы предложили схему 4.6-битного квантования и рассказали про нее, в том числе и на Хабре: раз и два. Вспомним, что при 4.6-битном квантовании веса и входы слоя принимают такие целые значения, что их попарные произведения помещаются в знаковый 8-битный тип данных. Такая схема позволила нам вычислять нейронные сети на процессорах мобильных устройств быстрее, чем в 8-битном формате, и точнее, чем в 4-битном, потому что уровней квантования больше.
Рубрика «квантование»
4.6-битные сети: от теории к практике. Причём здесь HardTanh?
2026-06-26 в 10:07, admin, рубрики: 4.6-битное квантование, edge ai, HardTanh, resnet, инференс, квантование, мобильный ии, нейронные сети, низкоразрядные вычисленияКак возникает реальность? Новая математическая модель. Сравнение с другими теориями
2026-04-26 в 15:57, admin, рубрики: измерение, интерференция, квантование, квантовая физика, объективность, реальность, суперпозиция, феномены, физика, философия
В Квантовой механике есть странный факт, к которому все привыкли, но который редко проговаривается до конца.
Как я уместил «Войну и мир» в 10 ГБ видеопамяти, или почему нейросеть убивает героев и выдумывает Пьера Бездаровского
2026-04-01 в 15:28, admin, рубрики: llama 3, llm, nlp, python, война и мир, генерация текста, квантование, машинное обучение, нейросети, промпт-инжинирингКак квантовать LLM. Практическое руководство для начинающих
2025-12-10 в 18:37, admin, рубрики: llm, искусственный интеллект, квантование, оптимизация нейросетейВсем привет! Меня зовут Максим, я NLP‑инженер в red_mad_robot и автор Telegram‑канала Максим Максимов // IT, AI. Рост числа параметров в LLM и других нейронных сетях создает проблему того, что запускать их может все меньшее количество людей. Это связано с тем, что запуск больших моделей требует наличие мощного оборудования, недоступное всем.
Для решения этой проблемы разрабатываются различные виды оптимизации, позволяющие запускать крупные нейронные сети (в частности LLM) на менее мощном оборудовании. Одним из наиболее популярных подходов оптимизации LLM является квантизация.
67 iPhone против одной H100: почему гибкость не побеждает чистую мощность
2025-09-27 в 14:41, admin, рубрики: apple, BitNet, H100, iPhone 6S, Nvidia, дистилляция, квантование, прореживание, терафлопсы
В мире ИИ часто ищут нестандартные пути, пытаясь оптимизировать стоимость вычислений.
Разбираемся с суффиксами квантования LLM: что на самом деле значат Q4_K_M, Q6_K и Q8_0
2025-06-16 в 17:15, admin, рубрики: AI, llm, llm-архитектура, llm-модели, llm-приложения, ml, ИИ, ИИ и машинное обучение, искусственный интеллект, квантование
Привет!
Читать полностью »

Многие онлайн-сервисы предлагают доступ к проприетарным LLM. Однако по различным причинам может возникнуть необходимость использовать эти модели на своем оборудовании. Аренда серверов, особенно с GPU, может быть дорогой и зависит от требований к RAM/VRAM. Квантование моделей помогает снизить эти требования.
Итак, в этой статье мы:
-
Расскажем о квантовании и как оно помогает в выборе оборудованияЧитать полностью »
Краткий гайд по квантованию нейросетей
2024-10-04 в 15:57, admin, рубрики: TensorFlow, как уменьшить память нейросети, квантование, машинное обучение, нейросеть, оптимизация нейросетей, ускорить модель ИИ
Мы достаточно написали статей про оптимизацию ваших нейросетей, сегодня пора перейти к дроблению, уменьшению и прямому урезанию, иначе квантованию данных. Сам по себе процесс этот несложный с точки зрения всего, но подводные камни у операции есть.
Как настроить LLM на локальном сервере? Краткое руководство для ML-специалистов
2024-09-27 в 13:10, admin, рубрики: compresia, compressa ai, llm, lora-адаптеры, selectel, большие языковые модели, квантование, машинное обучение
Привет! Все чаще коллеги из ML замечают, что компаниям нравятся возможности ChatGPT, но далеко не каждая готова передавать данные во внешние АРІ и жертвовать своей безопасностью. В результате команды начинают внедрять open source-LLM, развернутые локально. Чтобы осуществить этот процесс, инженерам нужно выполнить две задачи.
- Сделать удобную «песочницу» для экспериментов, чтобы быстро проверять гипотезы для бизнеса.
- Эффективно масштабировать найденные кейсы внутри компании, по возможности снижая затраты на ресурсы.
В статье рассказываем, какие есть проблемы у open source-LLM и как оптимизировать инференс модели с помощью квантизации и LoRA-адаптеров. Подробности под катом!
Автор: Алексей Гончаров, основатель платформы Compressa.ai для разработки GenAI-решений на своих серверах.
Читать полностью »


