🚀 Gemini теперь сам решает, какие фрагменты видео смотреть Google DeepMind запустила агентное понимание видео в трёх Flash-моделях — 3.7, 3.6 и 3.5-Lite. Вместо статической обработки с фиксированным 1 FPS (настраивается через API) модель в агентном цикле вызывает внутренние инструменты и динамически выбирает, что загружать: кадры, аудио или расшифровку нужного сегмента. По данным Google DeepMind, в стандартных тестах видеоанализа это снижает потребление токенов до 88%, а затраты на анализ — до 66%, при росте точности до 7%. Экономия особенно заметна на длинных роликах: от десятиминутных руководств до полуторачасовых лекций, где раньше приходилось выбирать между ценой и потерей деталей. Разработчику достаточно задать параметр processing="agentic" в API — без дополнительной платы за функцию, по стандартной цене токенов. Ранние партнёры уже используют это для поиска моментов с точностью до доли секунды, аномалий с повторной выборкой FPS на подозрительных участках и точного подсчёта повторяющихся действий. Пока доступ ограничен загрузками видео и роликами YouTube через Gemini API в AI Studio и Enterprise Agent Platform; в приложение Gemini для конечных пользователей функция придёт позже, как и в функцию YouTube «Ask YouTube». Механика сильная: мы отдаём модели управление ходом обработки видео, и это дешевле не из-за сжатия, а из-за того, что модель физически не читает 90% содержимого. Но цифры «до 88%» — из тестов, где целевой сегмент обычно локализован. На произвольном видео с равномерно распределённым шумом выигрыш может оказаться заметно скромнее, и тогда агентный цикл добавит задержку вместо экономии. #Gemini #GoogleDeepMind #videoUnderstanding #agenticAI