Qwen 3.8 27B: стандартный xhigh — 21 минута на простой SVG
🧠 Qwen 3.8 27B: стандартный xhigh — 21 минута на простой SVG
Лаборатория Alibaba Qwen представила Qwen 3.8 27B под лицензией Apache 2.0 — модель с поддержкой изображений и контекстным окном 262K, которая помещается в файл объёмом 17 ГБ. По данным Simon Willison, на M5 Max и DGX Spark она сразу упирается в стандартную настройку reasoning_effort: xhigh. Модель обдумывает простые задачи как диссертацию: SVG пеликана занял 21 минуту и 22 276 токенов рассуждений. Тот же запрос с отключённым reasoning выполнился за 137 секунд. Модель отлично определяет ограничивающие рамки и может вести агента для программирования через Pi, но скорость 15–30 токенов/с оставляет её в нише экспериментов.
→ Точные цифры чрезмерного обдумывания: 22 276 токенов рассуждений → 3 223 выходных токена за 21 минуту; без reasoning — 3 715 токенов за 137 секунд.
→ Ускорение MTP через llama.cpp --spec-type draft-mtp дало прирост около 72% по сравнению с LM Studio.
→ Контекст: максимум 262 144 токена; LM Studio по умолчанию устанавливала 8 192, из-за чего модель упиралась в лимит на ерунде.
Стандартный xhigh — это не инженерная ошибка, а осознанный выбор для сравнительных тестов: модель выглядит умнее на сложных задачах, но на практике вы платите минутами ожидания за токены, которые не влияют на результат. Локальные модели уже почти догнали закрытые по качеству, но конкуренция смещается к разумным стандартным настройкам и скорости генерации — а это исправляется настройкой, а не новым железом.
Simon Willison: Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
#Qwen38 #localLLM #opensource #reasoning #MTP
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.