🛠 Whisper локально: распознавание речи без облака за полчаса настройки Whisper от OpenAI — нейросеть, которую можно развернуть на своём компьютере и получить текст из аудио без единого API-запроса вовне. Пошаговая инструкция на Habr описывает реальный путь для Windows: Python 3.11, ручное добавление FFmpeg в PATH, pip install openai-whisper и запуск из командной строки с указанием языка. Для русского авторы рекомендуют модель large (~1.5 ГБ) — она требует GPU, но даёт наивысшую точность. tiny (39 МБ) работает в разы быстрее и без видеокарты, жертвуя качеством. На выходе — готовые субтитры SRT и plain text. Разрыв между порогами входа огромен: для tiny хватит офисного ноутбука, large — удел машин с дискретной графикой. Скорость распознавания на CPU измеряется десятками минут для часового файла, на GPU — минутами. При этом ни одна из моделей не привязана к облаку, данные не утекают наружу, и счёт за обработку равен нулю. Это ключевое преимущество для протоколов встреч, врачебных записей или расшифровки лекций — сценарии, ради которых и пишутся подобные гайды. Whisper — стандарт локального распознавания, но путь от «инструкции для чайников» до реального использования всё ещё лежит через командную строку и ручную правку переменных среды. Пока сообщество не предложило универсального интерфейса, технология остаётся инструментом тех, кто не боится консоли, — хотя конфиденциальность и отсутствие счёта перевешивают этот барьер для десятков тысяч пользователей. Кто пробовал faster-whisper на C++ на тех же данных: насколько реальный выигрыш по скорости на CPU? #Whisper #OpenAI #speechrecognition #локальный_инференс