OpenAI-модель GPT-6 Astra протестирована на двух независимых бенчмарках. В бизнес-симуляции она заработала втрое больше денег, чем Claude Fable 5.1. На задачах управления дроном она впервые превзошла человеко-машинный baseline по всем пяти подзадачам.
Суть события
OpenAI-модель GPT-6 Astra протестирована на двух независимых бенчмарках от лаборатории Andon Labs. В бизнес-симуляции она заработала втрое больше денег, чем основной конкурент. На задачах автономного пилотирования дрона она впервые превзошла человеко-машинный baseline по всем пяти подзадачам, хотя надёжность прохождения всех этапов остаётся низкой.
Andon Labs — независимая исследовательская лаборатория, которая разрабатывает бенчмарки для измерения способностей передовых ИИ-моделей действовать автономно в течение длительного времени. Vending-Bench оценивает экономические решения, Drone-Bench — написание кода для физических систем.
Детали
В симуляции вендингового бизнеса (Vending-Bench) каждой модели дают $500 и год виртуального времени. Astra заработала в среднем $15 515, Claude Fable 5.1 — $5 422. Даже худший результат Astra ($13 272) оказался лучше лучшего результата Fable ($9 874).
Разрыв между моделями проявляется в закупках. Fable со временем соглашается на всё худшие условия: средняя цена банки Coca-Cola выросла с $1,17 в первые 90 дней до $2,21 к концу года. Astra торгуется стабильнее: в одном задокументированном случае поставщик запросил $226,32, Astra устояла на $108 — и получила сделку.
При работе с ненадёжными поставщиками Fable 5.1 сделал 45 предоплат закрывшимся компаниям и потерял $14 331. Astra столкнулся с ещё большим числом закрытий — 64, — но Andon Labs не зафиксировала идентифицированных потерь от таких предоплат. Fable осознал проблему и написал правило: платить только после письменного подтверждения. Через несколько дней модель нарушила собственное правило.
В режиме Arena, где несколько ИИ-агентов конкурируют на одной локации, Astra отказался от предложения китайской модели GLM-5.3 о фиксации цен. Fable, по классификации Andon Labs, участвовал в незаконной договорённости и соблюдал её только когда это было ему выгодно. Astra выиграл все три игры.
Drone-Bench измеряет другой тип агентных способностей. Модели пишут код, который позволяет дешёвому дрону DJI Tello EDU автономно пройти через офис, найти конкретного человека и следовать за ним. Бенчмарк оценивает пять задач: 3D-реконструкцию пространства, локализацию дрона, навигацию, детекцию целевой персоны и трекинг. Astra стал первой моделью, чистые попытки которой превзошли baseline на всех пяти задачах, включая реконструкцию. Astra собрал пайплайн из COLMAP и DA3 с фильтрацией глубины, который на тестовых видео набрал больше баллов, чем референсное решение, написанное человеком с помощью ИИ-помощников. На детекции персоны Astra обходит baseline в 4 из 10 прогонов; на 3D-реконструкции — в 1 из 10. Andon Labs оценивает вероятность прохождения всех пяти этапов подряд в среднем в 2,8%.
Контекст
Публикация результатов Andon Labs вызвала вопросы о целесообразности создания технологий, возможности которых широко обсуждаются как угроза. Лаборатория отвечает, что бенчмарк не помогает ИИ пилотировать дроны, а измеряет, на что модели способны уже сейчас. Ещё полгода назад передовые модели не справлялись с этими задачами и разбивались.
Andon Labs утверждает, что общественность и законодатели должны знать о текущих возможностях до того, как ИИ-дроны достигнут сверхчеловеческой навигации. Доступ к Drone-Bench закрыт; все оценки лаборатория проводит самостоятельно, чтобы компании не могли оптимизировать модели под тест.
Что дальше
Исходя из прогресса за последние два года, команда проектирует, что переловая модель сможет решить все пять задач Drone-Bench с первой попытки примерно к первому кварталу 2027 года. Бизнес-бенчмарк уже показывает, что текущий ИИ способен принимать экономические решения на уровне, влияющем на конечный результат.