Google запустила двойное слепое тестирование ИИ-тестов
🧠 Google запустила двойное слепое тестирование ИИ-тестов
27 августа Google DeepMind объявила о пробном запуске первого в мире двойного слепого оценивания закрытой передовой модели — Gemini Flash Lite. По данным Google DeepMind, внешние тесты прошли в конфиденциальной среде с партнёрами Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. Цель — исключить загрязнение тестов, когда модель заранее «подглядывает» в вопросы.
Механика опирается на Confidential Space из портфеля Google Cloud Confidential Computing. Криптографические доказательства фиксируют: оценщик не видит параметры Gemini, а Google не видит тестовые запросы. Раньше внешний аудит требовал компромисса — либо раскрыть запросы, либо передать параметры. Теперь обе стороны сохраняют конфиденциальность, а техническая проверка заменяет договорные гарантии.
Для чувствительных сценариев — кибербезопасность, государственные оценки — это открывает независимым организациям возможность тестировать модели без потери суверенитета данных. Но в анонсе нет ни результатов тестов, ни объёма тестового набора, ни стоимости запуска. Пилот выполнен на лёгкой модели Flash Lite, масштабирование на крупные передовые модели пока не показано.
Смысл не в том, что Gemini Flash Lite стала безопаснее, а в том, что Google первой запустила инфраструктуру, где доверие к тестам опирается на код, а не на договорённости. Теперь главный вопрос — кто будет проверять сам Confidential Space и не превратится ли это в новый вид зависимости от поставщика для регуляторов.
#Gemini #DeepMind #benchmark #confidential_computing
Такие разборы выходят в канале каждый день — коротко и со ссылкой на первоисточник.