Бенчмарк 8 LLM на реальных приказах: дешёвый DeepSeek стабильнее Gemini Pro
🧠 Бенчмарк 8 LLM на реальных приказах: дешёвый DeepSeek стабильнее Gemini Pro
Разработчик текстовой браузерной игры протестировал восемь моделей на одной и той же задаче — разборе свободных команд игроков в типизированную цель. Выборка маленькая, всего 21 реальный приказ из прода, но зато с фокусом на то, что действительно важно в проде: не качество прозы, а способность без ошибок вернуть JSON и цена за этот прогон. Gemini 3.1 Pro оказалась худшим кандидатом: четыре обрыва на 21 запросе и счёт $0.226. Для сравнения, DeepSeek V4 Flash и Qwen 3.6 Flash не сломались ни разу, обойдясь в $0.003 и $0.008 за весь тест.
С переходом на flash-модели суточная стоимость генерации снизилась с $2 до $0.40 — и это без учёта скрытых ретраев, которые у думающих моделей умножают расходы за счёт тысяч невидимых thinking-токенов. Автор пришёл к этому через боль: модель в ленте рассказывала о деньгах, которых у героя уже не было, а каждый четвёртый текст за неделю врал про «в кармане», потому что промпт включал устаревший пересказ событий. Проблему решили не запретами, а заменой пересказа на факт-досье из рассчитанных параметров — и пересборкой пайплайна под более дешёвые, но стабильные модели.
→ 21 реальный приказ, 8 моделей
→ Gemini 3.1 Pro: 4 обрыва JSON, $0.226
→ DeepSeek V4 Flash: 0 обрывов, $0.003
→ Итог: суточная стоимость с $2 до $0.40
Бенчмарки на сайтах моделей меряют «ум», а не стабильность и цену — а в реальном продукте один оборванный JSON стоит больше, чем разница в качестве прозы. Когда счёт идёт на сотни или тысячи запросов в сутки, модель без ретраев за $0.003 бьёт любую Pro‑версию с самым элегантным стилем.
Habr
#LLM #production #DeepSeek #Gemini #бенчмарк
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.