2 сентября 2026 года Google представила Gemini 3.8 Flash как модель для задач рассуждения, кода и агентных сценариев, а Gemini 3.8 Flash Cyber — узкоспециализированный вариант для киберзащиты с ограниченным доступом. Это анонс производителя: опубликованные результаты и примеры полезны для выбора пилота, но не гарантируют одинаковый эффект в любой кодовой базе.

Чем отличаются две версии

Gemini 3.8 Flash доступна разработчикам через Gemini API и связанные продукты. Вводная цена — $0,75 за миллион входных и $3,75 за миллион выходных токенов; в примечании к анонсу Google прямо указывает, что эта цена действует до 31 декабря 2026 года, а с 1 января 2027-го вырастет до $1,50 / $7,50. По собственным данным Google, на бенчмарке DeepSWE v1.1 модель набрала 73,7% против 65,3% у предыдущей версии 3.7 Flash — рост на 8,4 процентных пункта в задачах на долгую самостоятельную работу с кодом. В обзорах, ссылающихся на данные Google, это сопоставляют с результатом Claude Opus 5 (около 74%) и приводят 89,4% на Terminal-Bench 2.1 против 89,1% у Opus 5 — но сама Google на официальной странице модели точных цифр в сравнительной таблице не публикует, ограничиваясь качественным графиком. Итоговая стоимость задачи тоже не выводится напрямую из цены за токен: Google отдельно предупреждает, что на сложных задачах модель делает больше шагов рассуждения и может расходовать больше токенов при повышенном уровне effort. Такие межвендорные сравнения не заменяют тест на собственных задачах.

Flash Cyber предназначена для проверенных защитников: государственных структур, операторов критической инфраструктуры и сопровождающих ПО. Доступ идёт через программу Fairwind, куда организации подают заявки, а не через открытый API; полный набор критериев отбора Google публично не раскрывает.

Что означает «агентная» модель на практике

Модель может выполнять последовательность действий, пользоваться инструментами и тратить больше вычислений на сложный запрос. Но качество результата зависит от разрешений, окружения, тестов и контроля человека. Агент не должен самостоятельно получать доступ к production-системам, публиковать патчи или принимать решения об инциденте без политики подтверждений.

Киберзащита: что заявляет Google и где нужна осторожность

Стоит различать внешние и внутренние замеры. Есть один независимый внешний бенчмарк — CWE-Bench (ведёт компания Collinear): на нём Flash Cyber получила 47,2% pass@1 против 47,8% у Claude Fable 5, то есть сопоставимый результат при заметно меньшей стоимости запуска. На отраслевом, но не полностью независимом CyberGym (поиск уязвимостей) заявлен результат 86,2% — Google описывает его как показатель топового уровня, превышающий и предыдущую версию 3.5 Flash Cyber, и более крупные модели-конкуренты. Остальные цифры — уже собственные данные Google и её команды безопасности, а не внешний аудит: на внутреннем бенчмарке компании, охватывающем 20 языков программирования, заявлена доля успешного обнаружения уязвимостей выше 70%; отдельно команда безопасности Chrome сообщила, что в её тестах Flash Cyber предложила в 2,6 раза больше корректных патчей к уязвимостям Chrome, чем сопоставимые более крупные коммерческие модели. По данным VentureBeat со ссылкой на Google, среди прочего модель нашла едва заметную ошибку, которая пролежала в коде Chromium около 13 лет незамеченной множеством инженеров — этого эпизода нет в официальном посте Google, только в пересказе издания.

Ни один из этих результатов не означает, что модель способна «полностью автоматизировать» исправление любого кода или гарантированно находить все ошибки. Ложные срабатывания, неверные патчи и риски цепочки поставки остаются.

Безопасный пилот начинается с изолированного репозитория и набора известных задач. Для каждого предложения нужны: воспроизводимый тест, проверка человеком, анализ зависимостей и журнал принятых решений. Права доступа к секретам и production следует выдавать отдельно и по минимуму.

Как оценить пригодность

  1. Проверить доступность модели и условия программы Fairwind для своей организации.
  2. Сравнить качество на закрытом наборе задач с текущими инструментами, а не полагаться на чужие бенчмарки.
  3. Измерить стоимость, задержку и число ручных исправлений после предложений модели.
  4. Настроить изоляцию, review и обязательные тесты до любого применения патчей.

Релиз расширяет набор инструментов защитника, но не отменяет инженерную проверку и ответственность команды.

Источники