🛠 Локальные LLM на DGX Spark: 256K контекста ценой параллелизма Два дня на развёртывание двух Qwen-моделей через vLLM на NVIDIA DGX Spark показали, где заканчивается «модель запустилась» и начинается «сервис работает». Основная Qwen3.8-27B-FP8 и быстрая Qwen3.6-35B-A3B-NVFP4 запускались как OpenAI-совместимые API для агентной платформы «Искра», ASR — Qwen3-ASR-1.7B на Radeon 8060S в WSL2. По данным Habr, матрица совместимости важнее числа параметров: ARM64-стек Spark и ROCm/WSL2-стек AMD — две разные среды выполнения, и «запустить на GPU» ничего не значит, пока не собраны контейнеры, авторизация, проверки состояния и политика перезапуска. Функциональная проверка на 262144 токена прошла: обе LLM приняли по 259616 токенов и нашли 4 из 4 контрольных значений без нехватки памяти. Цена — одна одновременно исполняемая последовательность на модель, остальные запросы в очереди. Прогон 256K занял 510,32 секунды на основной модели и 243,62 секунды на быстрой, у основной — 7 вытеснений KV-кэша, у быстрой — ноль. Контекстное окно здесь не изолированный параметр качества, а часть бюджета памяти вместе с параллелизмом, TTFT и пропускной способностью. Оптимизации измерялись отдельно. Графы CUDA дали основной модели 7,48 → 7,95 токен/с, быстрой — 26,63 → 77,14 токен/с, но у быстрой одновременно увеличили бюджет памяти, поэтому это не чистое сравнение. Multi-Token Prediction MTP3 ускорил основную модель с 7,84 до 15,00 токен/с. Пакет предварительной обработки из 8192 токенов на быстрой модели снизил TTFT на 128K токенов с 41,85 до 34,17 секунды — по-прежнему долго, и скорость декодирования этот провал не компенсирует. Интеграционные тесты вернули маршрутизацию простых задач на основную модель: быстрая трижды нарушила короткую инструкцию. Агент сделал непрошенный вызов календаря, а модель записала число 10555 словами с ошибкой и противоречила собственному ответу. ASR распознавала 20,9 секунды аудио за 1,9 секунды, но полный агентный сценарий с 21-секундным аудиозапросом занял 106,41 секунды: после распознавания речи модель обрабатывала 46697 входных токенов на каждый запрос. Быстрый компонент не делает быстрым сценарий. Индустрия любит тесты скорости генерации, но в агентном контуре дефект на уровне вызова инструментов или инструкций обнуляет любой выигрыш в токенах в секунду. Я бы смотрел не на окно в 256K, а на бюджет контекста: 46,7K токенов на короткую реплику — это архитектурный долг, который дороже любой настройки предварительной обработки. #vLLM #Qwen #DGXSpark #локальныйинференс #контекст