Google выкатила Gemini 4 Argon — модель, которая за один длинный проход может сгенерировать до 1 млн токенов. Такой объём нужен для многошаговых задач: анализировать код, документы, финансы или уязвимости и не терять нить по дороге.
В открытом доступе Argon пока нет. Первую волну получили доверенные специалисты по кибербезопасности через программу Fairwind. Google собирает их обратную связь и допиливает защиту перед релизом для разработчиков, компаний и обычных пользователей.
Что изменилось в Gemini 4 Argon
Главное изменение — лимит вывода вырос с 64 тысяч до 1 млн токенов. Модель может рассуждать сотни тысяч токенов в одной траектории и не бросать сложную задачу после пары шагов. Для API Google добавляет Long Decode Continuation: длинный ответ можно поставить на паузу, а потом продолжить новым запросом. Это помогает не упереться в таймаут.
Стартовая цена выглядит агрессивно: $2 за миллион входных токенов и $10 за миллион выходных. Кэшированные входные токены дешевле на 95% — примерно $0,10 за миллион. Позже тарифы должны вырасти до $4 и $20 соответственно.
Для креаторов цифры интересны, когда агенту приходится держать в голове большой проект. Например, сценарий с правками, техническое задание, исходники, документацию и промежуточные решения. Правда, платить придётся за токены вывода: длинное рассуждение легко превращается в заметный счёт.
Где Gemini 4 Argon уже используют
Google заявляет, что тысячи сотрудников уже гоняют Argon в ежедневной работе. Внутри компании модель помогает отлаживать код, проводить исследования, писать тексты и переносить большие кодовые базы.
Самый наглядный пример — библиотека libgav1, декодер видео с открытым исходным кодом. Агенты заменили 32 тысячи строк SIMD-кода на безопасный Rust. Новая версия сохранила идентичный вывод и работала в 2,7 раза быстрее прежнего Rust-порта.
Есть задачи покрупнее. Argon помогает переносить C и C++-код на Rust — от десятков тысяч строк до ядра Fuchsia OS Zircon объёмом более 800 тысяч строк. Критичные изменения проходят автоматический и ручной аудит, эмуляционные тесты и проверку перед продакшеном. И правильно: автономно переписать полсистемы звучит красиво, пока система не перестаёт запускаться.
Google также приводит такие результаты: оптимизация квантового алгоритма оказалась на 40% лучше опубликованного базового решения. Анализ телеметрии дата-центров освободил свыше 300 TiB памяти. Потенциальную суммарную экономию компания оценивает в 500 TiB–1 PiB.
