
Свой пост я написал после участия в соревнованиях gralhix 004, организованных Софией Сантос | Gralhix.
Задача
Это фотография островного курорта.
Вопросы:
а) Как называется курорт?
Читать полностью »

Свой пост я написал после участия в соревнованиях gralhix 004, организованных Софией Сантос | Gralhix.
Это фотография островного курорта.
Вопросы:
а) Как называется курорт?
Читать полностью »

Перед вами фотография островного курорта.
Как называется курорт?
Какие координаты у острова?
В какую сторону света была направлена камера в момент съёмки?
На мой взгляд, пытаться ответить на эти вопросы через google lensЧитать полностью »
Начну с пары чисел, которая меня остановила.
RTX 5090, одна и та же сборка llama.cpp (b10326, коммит 3653e6d6d), один драйвер, квант Q4_0, батч 1. Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты. MoE Qwen3.5-35B-A3B на той же карте выбирает 41%.
Сразу оговорюсь, чтобы не унесли неверный вывод: MoE при этом быстрее в абсолюте, 317 токенов в секунду против 240. Она просто оставляет на столе примерно полтора раза от собственного потолка, и оставляет по причине, которую можно назвать и померить.
Маршрутизация экспертов тут почти ни при чём. Я её измерил отдельно.
Вокруг квантовых вычислений много маркетингового шума. Если вы попытаетесь смоделировать честное 48-кубитное квантовое состояние в комплексном базисе complex128, то неизбежно упретесь в «стену памяти» в 4.5 Петабайта. Если же вы решите применить блочную декомпозицию пространства состояний для ее поочередного обсчета, то упретесь в «стену времени» длиною в несколько лет непрерывных вычислений на GPU.
В этой статье мы разберем проект гибридного симулятора, который обходит обе стены, удерживая потребление видеопамяти в пределах 268 МБ, а время симуляции сокращает в 400 раз.
Малоизвестный среди обычных людей факт: у нейросетей нет никаких "разговоров". Ты смотришь в веб-интерфейсе на "диалог" - но это обман, красивый фокус.
Каждый раз, когда ты пишешь новое сообщение, все старые сообщения обрабатываются заново. У нейросетей по-настоящему многоразовых задач не существует. Если результат немного поменялся — тебе просто не покажут в веб-интерфейсе изменившиеся сообщения.
Я это сделал. За один день.
Почему видеокарта, имеющая неплохие вычислительные возможности, в Stable Diffusion работает в 20 раз медленнее, чем RTX 3060? Почему в LM Studio она становится фаворитом, а в ComfyUI карета превращается в тыкву? Почему FurMark на CMP 90HX тормозит, а на CMP 50HX «бублик» крутится почти нормально? Разгадки в разных программных ограничениях, которые можно найти с помощью экспериментов. Я купил три майнинговые карты Nvidia, чтобы понять, можно ли заставить их эффективно работать.
В этот раз мы рассмотрим:
статистику производительности в LM Studio
как всё печально в ComfyUI и Stable Diffusion
анатомию программного кода GPU
Получилось так что я купил книжку на английском, в Австралии (автор оттуда и там она дешевле в 3 раза чем у Гугла), но прочитать не смог, очень богатый мир , много странных слов, начал терять контекст истории, читал по 2 страницы в день. Затем на ТГ канале Акимова попалась ссылка на прототип агента по переводу текста , со сслыками в итоге на научные работы и т.д., обрадовавшись полез на гитхаб искать форки и конечно готовую софтину , но почему то она не случилась. спустя два года появились платные сервисы, но не опенсорсная поделка, и я решил собрать хотя бы MVP чтобы проверить идею самостоятельно, потом написатьЧитать полностью »