Qwen3.8-Flash-Next: предварительная версия Qwen4 с открытыми весами
🚀 Qwen3.8-Flash-Next: предварительная версия Qwen4 с открытыми весами
Qwen представила мультимодальную MoE-модель с открытыми весами Qwen3.8-Flash-Next, которую позиционирует как раннюю версию архитектуры Qwen4. По данным Simon Willison, модель содержит 125 млрд параметров, из которых активны только 6 млрд — это заметно ускоряет обработку запросов. Он тестирует её на NVIDIA DGX Spark с квантизированными версиями от Unsloth: 72.5GB UD-IQ1_S и 78.9GB UD-Q2_K_XL.
Willison отмечает, что лучший результат получил с версией UD-Q2_K_XL и режимом xhigh с максимальной интенсивностью рассуждений. В прошлой заметке от 16 августа он уже хвалил Qwen 3.8 27B за качество, но указывал на склонность модели к избыточному обдумыванию простых запросов. Похоже, эта черта может перейти и в новую архитектуру, хотя прямых тестов он пока не привёл.
Официальных сравнительных тестов для Qwen3.8-Flash-Next нет — только личные впечатления и примеры генерации. Модель открыта, но у неё доступны только веса, а не исходный код: веса можно скачать, но условия использования и обучающие данные не раскрыты. Для русскоязычных специалистов по машинному обучению это ещё один вариант для запуска на локальном оборудовании, но требования к памяти — от 70 ГБ для квантизации — отсекают большинство домашних сборок.
Агрессивная MoE-схема с 6B активных параметров на 125B общих — это ставка на то, что распределение запросов между экспертами компенсирует малое число активных параметров. Но если предыдущая 27B-версия уже страдала от переобдумывания, то сокращение числа активных параметров может усугубить проблему: модель начнёт чаще ходить по кругу, не имея достаточной глубины для рассуждений. Проверить это можно только на независимых задачах, которых пока нет.
#Qwen #MoE #openweights #Unsloth #SimonWillison
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.