Рубрика «gpu»

В последние месяцы снова активизировались призывы притормозить развитие наиболее мощных AI-систем. Причём теперь они исходят уже не только от политиков и сторонних экспертов. Руководители крупнейших AI-компаний сами обсуждают необходимость замедлить гонку, ввести независимый контроль и договориться о правилах, которые позволили бы остановиться, если дальнейшее развитие станет слишком опасным.

Читать полностью »

main

Перед вами фотография островного курорта.

  1. Как называется курорт?

  2. Какие координаты у острова?

  3. В какую сторону света была направлена камера в момент съёмки?

На мой взгляд, пытаться ответить на эти вопросы через google lensЧитать полностью »

Начну с пары чисел, которая меня остановила.

RTX 5090, одна и та же сборка llama.cpp (b10326, коммит 3653e6d6d), один драйвер, квант Q4_0, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%.

Сразу оговорюсь, чтобы не унесли неверный вывод: MoE при этом быстрее в абсолюте, 317 токенов в секунду против 240. Она просто оставляет на столе примерно полтора раза от собственного потолка, и оставляет по причине, которую можно назвать и померить.

Маршрутизация экспертов тут почти ни при чём. Я её измерил отдельно.

Читать полностью »

Разворачиваем MiniMax-M2.7 на GPU-инфраструктуре с поддержкой S3 - 1

Использовать нейросети для работы с внутренними данными компании — идея классная, но скармливать их внешним API банально опасно. Никому не хочется, чтобы коммерческая тайна или уязвимости инфраструктуры утекли в сеть.

Читать полностью »

История создания самодельной видеокарты на 8 192 ядра RISC-V из тысяч дешевых микроконтроллеров - 1

Немецкий разработчик с ником bitluni потратил около полугода на создание одной из самых необычных DIY-систем. Вместо того чтобы использовать готовый Читать полностью »

Конвертируем цвета в JS со скоростью 6 миллиардов операций в секунду

В начале этого года я создал @colordx/core, самую быструю JS‑библиотеку для работы с цветом: парсинг различных форматов, конвертация в OKLAB/OKLCH, проверка попадания в P3-гамут и многое другое. Библиотека весит всего 7 КБ и не имеет внешних зависимостей. Высокую скорость обеспечили оптимизации под V8: мономорфизм, скрытые классы, ноль лишних аллокаций.

Читать полностью »

Это первая (после нулевой) статья из серии Нейро сети для самых маленьких, в которой мы разбираем инфраструктуру для запуска нейронных сетей.

Для обучения и инференса нейросетей и для любых видов High Performance Computing используются специализированные технологии: GPU/TPU, RDMA, Kernel bypass, NVLink, InfiniBand, RoCE и другие. Про некоторые из них большинство только что-то слышали, но сталкиваться с ними не приходилось.

Нельзя просто взять ванильный стек Linux, воткнуть в него 400 Gb Ethernet+IP и получить рабочее решение. Почему?

Читать полностью »


https://ajax.googleapis.com/ajax/libs/jquery/3.4.1/jquery.min.js