🚀 NVIDIA Magpie TTS: открытые веса, 12 языков и 32 мс до первого звука NVIDIA выпустила Magpie Multilingual TTS — модель синтеза речи на 364 млн параметров с открытыми весами и поддержкой 12 языков, включая только что добавленные арабский, корейский и бразильский португальский. Главная ставка здесь не на число языков, а на архитектурное решение для снижения задержки: объединение кадров предсказывает два аудиокадра за шаг декодера вместо одного, а локальный трансформер восстанавливает качество, которое такой приём неизбежно снижает. Результат — 32 миллисекунды до первого звука на B200 в однопоточном режиме и 239 мс при 64 одновременных потоках со скоростью обработки в 320 раз выше реального времени. Разработчики получают не просто готовый TTS, а компонент каскадной архитектуры, который можно развернуть на собственных GPU через NVIDIA NIM — оптимизированный контейнер для выполнения модели. В отличие от интегрированных API преобразования речи в речь, такой подход оставляет контроль над каждым звеном цепочки: можно заменить ASR, поменять LLM, отладить временные параметры без чёрных ящиков. Контрольная точка на Hugging Face даёт ту же модель для исследований и дообучения, NIM — обвязку для промышленной эксплуатации с низкой задержкой. Объективные показатели улучшились: для французского CER снизилась с 2.70% до 1.54%, для испанского — с 1.14% до 0.60%, сходство голосов на обоих языках выросло на четыре-семь сотых. Новые языки начинают с характерных для первых версий значений: 2.69% CER для корейского, 2.91% для бразильского португальского — ожидаемо, но неплохо для начальной версии модели. → Параметры: 364M, веса открыты под NVIDIA Open Model License → TTFA на B200: 32 мс (1 поток), 239 мс (64 потока) → Доступ: Hugging Face для экспериментов, NVIDIA NIM для промышленной эксплуатации → Стек: совместим с Nemotron Speech (ASR) и Nemotron LLM через эталонную архитектуру NVIDIA 32 миллисекунды на B200 — это лабораторный замер на новом оборудовании. На A100 та же метрика достигает 79 мс, а на DGX Spark — 53 мс. Разработчику, который арендует A100 в облаке, важнее не пиковая цифра, а то, что модель вообще даёт измеримый TTFA на его инфраструктуре и позволяет настраивать его под нагрузку, а не гадать, где возникает задержка у поставщика. Вопрос в том, сколько реальных команд промышленной разработки готовы разворачивать собственный TTS-стек ради этих миллисекунд, а не выбрать готовый API синтеза речи и списать задержку на сеть. Hugging Face #NVIDIA #TTS #VoiceAI #opensource #инференс