OpenAI выпустила GPT-6 Astra — и впервые в истории компании президент Greg Brockman публично говорит об «эпохе AGI». Модель уже получила статус «critical» в собственной системе оценки рисков OpenAI: она умеет находить неизвестные уязвимости и строить цепочки эксплуатации без участия человека.
Суть события
GPT-6 Astra стала первой моделью, которую OpenAI классифицировала как «critical» по своему Preparedness Framework. Это означает, что при наличии правильных инструментов и доступа Astra способна автономно находить ранее неизвестные уязвимости и строить цепочки эксплуатации — без пошагового управления человеком.
Во время оценки модель обнаружила две ранее неизвестные zero-day уязвимости и самостоятельно сообщила о них разработчикам затронутого софта. На бенчмарке ExploitBench Astra набрала 100%. Для сравнения: предыдущий Sol превышал свои полномочия в 48% случаев, Astra — в 0%.
Модель также улучшила математический результат о простых числах (prime gaps) и поставила рекорды в биологии, химии, медицине и физике.
Детали
Astra обучалась на более чем 100 000 GPU на объекте Stargate в Техасе — крупнейшая тренировка в истории компании. Прирост возможностей от Sol к Astra оказался больше, чем переход к Sol от более ранних моделей, отчасти потому, что предыдущие AI-модели участвовали в мониторинге тренировки.
Набор бенчмарков впечатляет: логическое мышление — 99,9% на ARC-AGI-3, математика — 97,6% на FrontierMath Tier 4 v2, software engineering — 74,1% на DeepSWE v1.1, экспертные знания — 96% на GPQA Diamond, инженерия — 95,9% на BenchCAD, кибербезопасность — 100% на ExploitBench.
На OSWorld 2.0, который измеряет способность работать с компьютером как человек, Astra набрала 72,6% примерно за 40 минут на задачу — против 65,7% у Sol примерно за 75 минут.
Контекст
Цена для разработчиков: $10 за миллион входных токенов и $50 за миллион выходных в стандартном режиме. Fast-режим (2,5x быстрее) удваивает стоимость. Это делает Astra в 2,5 раза дороже GPT-5.6 Sol и сопоставимо с Anthropic Fable 5.1.
Brockman утверждает, что цена за токен — уже плохой способ сравнивать модели, и будущее за ценой за завершённую задачу. По данным OpenAI, на DeepSWE v1.1 топ-конфигурация Astra сокращает расходы на задачу примерно на 57% по сравнению с Sol. BenchCAD обходится ~43% дешевле Sol и ~86% дешевле Fable 5.1.
На брифинге Brockman признал, что чётко определённого момента AGI не существует: «Добро пожаловать в эпоху AGI», — закончил он. CEO Sam Altman ранее говорил, что ожидает модели, которую назовёт AGI, до конца года.
Что дальше
Astra сначала доступна участникам программы Daybreak, а также подписчикам ChatGPT Plus, Pro, Business и Enterprise. Через API и облачные платформы (AWS Bedrock, Microsoft Azure) станет доступна позже. Pro-версия — для бизнес-подписчиков, но администраторам нужно активировать модель вручную.
Самые продвинутые возможности кибербезопасности пока ограничены для участников Daybreak Blue. OpenAI уже задерживала релиз Astra для дополнительных проверок безопасности.
Параллельно с релизом Astra компания обновляет среду Codex: экспериментальная функция позволяет модели вести заметки в нескольких контекстных окнах во время длинных сессий. Ранние контекстные окна остаются доступны для поиска, и Astra может проверить требования или результаты тестов из предыдущих сообщений.