Новая нейросеть GPT-6 Astra способна решать комплексные задачи, работая с кодом, документами и компьютерными приложениями. На первых демонстрациях система управляла пиксельным дисплеем колонки, настраивала системы управления клиентами и создавала трёхмерные объекты. Результаты независимых проверок показывают многоуровневую картину: модель показывает отличные результаты в математике и работе с инструментами, но отстаёт в некоторых тестах качества текста.

От диалога к многоприложному взаимодействию

Astra разработана для выполнения многоэтапных задач, требующих удержания цели, анализа материалов, использования инструментов и исправления ошибок на промежуточных этапах. Производительность зависит от конкретного приложения. Система определяет последующие действия, а браузер, командная строка, документы и подключённые сервисы предоставляют среду для выполнения. Поэтому результативность одной и той же модели может существенно отличаться в разных системах.

В API система принимает текст и изображения, возвращая текстовый результат. Размер контекста достигает 1 050 000 токенов, максимальный выход составляет 128 000 токенов. Встроенная обработка аудио и видео не заявлена. Создание графики, видеоматериалов и трёхмерных объектов реализуется через инструменты и программный код приложения.

Система может комбинировать поиск информации, написание кода и управление физическими устройствами. Например, для умной колонки с точечной матрицей удалось создать веб-интерфейс для рисования и консольный инструмент. Затем агент нашёл информацию о новом выпуске подкаста и вывел бегущую строку с анимацией.

Оценки производительности разошлись

Первый рейтинг от Artificial Analysis от 3 сентября ставил Astra и предыдущую версию Sol на одинаковый уровень (61 балл). Claude Fable 5.1 получила 66 баллов. Однако уже 4 сентября была выпущена новая версия методики оценивания. Из набора исключили сложный тест GPQA Diamond, добавили профессиональные задачи и анализ PDF-файлов. В обновлённом рейтинге Astra заняла вторую позицию, опередив Sol на четыре пункта, но уступив Fable 5.1.

По другой шкале Epoch AI модель показывает следующие результаты в Epoch Capabilities Index:

Модель ECI баллы 90% доверительный интервал
GPT-6 Astra 169 165–174
Claude Fable 5.1 163 160–166
Claude Opus 5 162 160–166
GPT-5.6 Sol 162 160–165

Программирование: лидерство зависит от среды

В тестах кодирования результаты Astra составили 67 баллов в одной системе против 65 у Sol. Claude Fable 5.1 получила 70 баллов. При использовании расширенного режима рассуждений Astra потребовала примерно в три раза меньше токенов, чем Sol.

На платформе Kilo результаты выглядят следующим образом в тестировании 89 задач Terminal-Bench 2.0:

Модель Решено Средняя стоимость
GPT-6 Astra 79,3% $107,29
GPT-5.6 Sol 76,2% $87,41
Claude Fable 5.1 76,2% $91,41

Написание текстов: слабое место модели

По оценкам ToneBench от Towards AI Astra показывает одну из наиболее значительных слабостей. В рейтинге качества текста система уступает Sol, Fable и Opus. В таблице представлены избранные конфигурации из 146 проверенных вариантов:

Модель Место Рейтинг Elo
Claude Fable 5.1, режим max 2 2306
Claude Opus 5, режим max 4 2240
GPT-5.6 Sol, режим ultra 16 2156
GPT-6 Astra, режим max 30 1995
GPT-6 Astra, стандартный режим 41 1848

Работа с документами и фактами

При анализе сложных документов система показала хорошие результаты. В тесте GDP.pdf, измеряющем работу со сложными документами, таблицами и примечаниями:

Модель Полностью выполненные задания
GPT-6 Astra 33,2%
GPT-5.6 Sol 28,2%
Claude Fable 5.1 26,2%

Математика: небольшой прогресс, но значимый результат

При тестировании на сложных математических задачах FrontierMath система получила одну попытку на задачу с бюджетом до 300 долларов и 72 часов вычислений. Предварительная версия Astra решила две задачи из 68, что составило примерно 3%. Другие модели не решили ни одной.

Один успешный результат потребовал около 15 часов и 218 долларов, другой примерно 16 часов и 247 долларов. Несмотря на низкий процент, решение ранее открытой математической проблемы представляет значимый научный результат.

ARC-AGI-3: близкий к идеальному результат

В тесте ARC-AGI-3, где агент должен разобраться в правилах незнакомых интерактивных сред, результаты показали:

Среда Режим рассуждения Результат
Стандартная max 62,7%
С адаптером OpenAI max 98,6%
С адаптером OpenAI high 99,9%

Специальный адаптер сохраняет промежуточное состояние рассуждений между запросами. Результат близкий к 100% характеризует систему с дополнительными компонентами, а не только саму модель.

Стоимость использования

Базовые тарифы Astra в API в 2,5 раза выше ставок Sol. Цены Standard для коротких текстов на момент запуска:

Модель Ввод $/млн токенов Выход $/млн токенов
GPT-6 Astra 10 50
GPT-5.6 Sol 4 20
GPT-5.6 Terra 2 12
GPT-5.6 Luna 0,20 1,20

Общая оценка

По совокупности данных Astra показывает особую силу в длительной работе с инструментами, сложной математике и анализе документов. Однако преимущество варьируется в зависимости от программной среды: одна платформа ставит её первой в тестах кода, другая показывает лучшие результаты у Fable 5.1. В тестах качества текста обе конфигурации Astra уступают Sol.

Главное преимущество заключается в способности доводить до результата многоэтапные проекты: соединять устройства и программы, создавать редактируемые трёхмерные сцены и находить математические доказательства. Тем не менее, успех в одном наборе тестов не означает общее превосходство по стилю, скорости, цене и надёжности. Независимые проверки показывают конкретные сильные стороны новой модели и одновременно демонстрируют конкурентоспособность предыдущих и более экономичных решений.