- PVSM.RU - https://www.pvsm.ru -
В пятницу вышла Qwen3.8-27B. Скажу честно, с середины мая я отказался от подписок и сидел исключительно на локальной Qwen3.6 (для всех своих домашних проектов), у меня даже статья была на эту тему [1]. Поэтому мне было очень интересно увидеть на что способна новая Qwen3.8-27B. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают (у меня), надеюсь они будут кому-нибудь полезны. Qwen3.8-27B превзошла мои самые смелые ожидания, и уж что-что а задумчивой она не кажется.
Так получилось, что я не использую GGUF файлы от Unsloth. Как-то давно я попробовал их GGUF и качество мне очень не понравилось, не знаю уж как они его готовят, но почему-то качество работы той старой модели было не очень (много галлюцинаций и повторов), поэтому я обычно конвертирую gguf самостоятельно (прошу не ругаться и тапками не кидаться).
Сообщение о том что модель доступна для скачивания пришло минут на 40 раньше чем я ожидал, ну окей, создал новую папку и загрузил веса.
hf download Qwen/Qwen3.8-27B --repo-type model --local-dir ./Qwen3.8-27B_official_sources_from_Qwen
Далее создал gguf файл:
pipenv run python convert_hf_to_gguf.py ~/models1/Qwen3.8-27B/Qwen3.8-27B_official_sources_from_Qwen/ --outfile ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-F16.gguf --outtype f16
Насколько я понимаю данная операция просто переупаковывает тензоры в один файл формата GGUF с точностью F16, GPU на этом этапе не используется и скорость зависит только от CPU и диска. В моем случае это заняло примерно 14 минут.
Я запускаю модель на старенькой 4090, поэтому следующим шагом идет квантование. Использую Q4_K_M, поэтому следующей командой, которую я запустил была:
llama-quantize Qwen3.8-27B-F16.gguf Qwen3.8-27B-Q4_K_M.gguf Q4_K_M
тут пришлось еще минут 5 подождать.
И вот модель готова к запуску! Я дрожащими руками настраиваю llama.cpp… Шучу конечно! Но мне действительно не терпелось запустить модель, поэтому я тупо скопировал файл настроек для 3.6 поменял обозначение модели на 3.8 и запустил как есть. Собственно вот настройки:
llama-server -m ~/models1/Qwen3.8-27B/my_conversions/Qwen3.8-27B-Q4_K_M.gguf
-ngl 99
--port 8882
--temp 0.6
--top-p 0.95
--top-k 20
--min-p 0.00
-t 6
-c 180000
--cache-type-k q8_0
--cache-type-v q8_0
--parallel 1
--flash-attn on
--presence-penalty 0.52
--repeat-penalty 1.0
--repeat-last-n 206
--reasoning-budget 4096
--reasoning-budget-message "Let's move on to the final answer."
--cache-ram 32768
Ну и оно заработало! Без Overthinking, без галлюцинаций, практически идеально! За прошедшие 3 дня я прогнал модель почти по всем сценариям в которых я ее использую и со всеми скиллами, которые я написал за последние месяцы. Во всех случаях модель существенно превосходила 3.6.
Больше всего меня впечатлила работа модели в агентном режиме. У меня есть довольно длинный сценарий из 27 шагов, в ходе которого модель должна скачивать данные из интернета, заполнять таблицу в csv файле, использовать Python и статистические методы для анализа данных и по результатам формировать отчет. Qwen3.6 не справлялась с полным сценарием и обычно останавливалась после 8-12 шагов, пришлось разбить сценарий на фазы и запускать их по-очереди. Qwen3.8 справилась с полным сценарием и за 22 минуты корректно выполнила все 27 шагов с логгированием промежуточных результатов в markdown файл и построением финального отчета.
Отдельно нужно сказать про такой параметр как reasoning-budget. В Qwen3.6-27B я добавил этот параметр потому, что модель довольно долго думала. Значение параметра для 3.6 было 2048 с ним модель думала примерно 20-30 секунд до начала ответа, и мысли модели мне не очень нравились, она периодически зацикливалась и ее приходилось останавливать, пришлось даже добавить: --presence-penalty 0.52, --repeat-penalty 1.0, --repeat-last-n 206 (вы можете видеть эти параметры в моих настройках). Однако новая Qwen3.8-27B меня очень приятно удивила. Она начала отвечать сразу! Т.е. 3.6 даже на простой вопрос - сначала думала (да не так долго, но думала), а 3.8 ответила сразу, размышление 1 секунда. Поэтому в данный момент я увеличил лимит рассуждения до 4090 токенов (можно видеть в настройках llama.cpp) и честно сказать подумываю о том, чтобы увеличить его еще в 2 раза, или вообще убрать.
Я не претендую на то, что параметры запуска, которые я привел, единственно правильные, более того, они не совпадают с официально рекомендованными, и получились случайно (как я сказал - я скопировал настройки, которые использовал для 3.6) но для меня они работают очень хорошо. Тут на Хабре было несколько статей о том, что 3.8 слишком долго думает и что у 3.8 слишком много галлюцинаций (что, как мне кажется, не совсем корректно), поэтому я решил поделиться настройками, которые работают, надеюсь они будут кому-нибудь полезны.
Автор: rtrgdfb
Источник [2]
Сайт-источник PVSM.RU: https://www.pvsm.ru
Путь до страницы источника: https://www.pvsm.ru/llama-cpp/456927
Ссылки в тексте:
[1] статья была на эту тему: https://habr.com/ru/articles/1037378/
[2] Источник: https://habr.com/ru/articles/1071872/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1071872
Нажмите здесь для печати.