Новая нейросеть GPT-6 Astra способна решать комплексные задачи, работая с кодом, документами и компьютерными приложениями. На первых демонстрациях система управляла пиксельным дисплеем колонки, настраивала системы управления клиентами и создавала трёхмерные объекты. Результаты независимых проверок показывают многоуровневую картину: модель показывает отличные результаты в математике и работе с инструментами, но отстаёт в некоторых тестах качества текста.
От диалога к многоприложному взаимодействию
Astra разработана для выполнения многоэтапных задач, требующих удержания цели, анализа материалов, использования инструментов и исправления ошибок на промежуточных этапах. Производительность зависит от конкретного приложения. Система определяет последующие действия, а браузер, командная строка, документы и подключённые сервисы предоставляют среду для выполнения. Поэтому результативность одной и той же модели может существенно отличаться в разных системах.
В API система принимает текст и изображения, возвращая текстовый результат. Размер контекста достигает 1 050 000 токенов, максимальный выход составляет 128 000 токенов. Встроенная обработка аудио и видео не заявлена. Создание графики, видеоматериалов и трёхмерных объектов реализуется через инструменты и программный код приложения.
Система может комбинировать поиск информации, написание кода и управление физическими устройствами. Например, для умной колонки с точечной матрицей удалось создать веб-интерфейс для рисования и консольный инструмент. Затем агент нашёл информацию о новом выпуске подкаста и вывел бегущую строку с анимацией.
Оценки производительности разошлись
Первый рейтинг от Artificial Analysis от 3 сентября ставил Astra и предыдущую версию Sol на одинаковый уровень (61 балл). Claude Fable 5.1 получила 66 баллов. Однако уже 4 сентября была выпущена новая версия методики оценивания. Из набора исключили сложный тест GPQA Diamond, добавили профессиональные задачи и анализ PDF-файлов. В обновлённом рейтинге Astra заняла вторую позицию, опередив Sol на четыре пункта, но уступив Fable 5.1.
По другой шкале Epoch AI модель показывает следующие результаты в Epoch Capabilities Index:
| Модель | ECI баллы | 90% доверительный интервал |
|---|---|---|
| GPT-6 Astra | 169 | 165–174 |
| Claude Fable 5.1 | 163 | 160–166 |
| Claude Opus 5 | 162 | 160–166 |
| GPT-5.6 Sol | 162 | 160–165 |
Программирование: лидерство зависит от среды
В тестах кодирования результаты Astra составили 67 баллов в одной системе против 65 у Sol. Claude Fable 5.1 получила 70 баллов. При использовании расширенного режима рассуждений Astra потребовала примерно в три раза меньше токенов, чем Sol.
На платформе Kilo результаты выглядят следующим образом в тестировании 89 задач Terminal-Bench 2.0:
| Модель | Решено | Средняя стоимость |
|---|---|---|
| GPT-6 Astra | 79,3% | $107,29 |
| GPT-5.6 Sol | 76,2% | $87,41 |
| Claude Fable 5.1 | 76,2% | $91,41 |
Написание текстов: слабое место модели
По оценкам ToneBench от Towards AI Astra показывает одну из наиболее значительных слабостей. В рейтинге качества текста система уступает Sol, Fable и Opus. В таблице представлены избранные конфигурации из 146 проверенных вариантов:
| Модель | Место | Рейтинг Elo |
|---|---|---|
| Claude Fable 5.1, режим max | 2 | 2306 |
| Claude Opus 5, режим max | 4 | 2240 |
| GPT-5.6 Sol, режим ultra | 16 | 2156 |
| GPT-6 Astra, режим max | 30 | 1995 |
| GPT-6 Astra, стандартный режим | 41 | 1848 |
Работа с документами и фактами
При анализе сложных документов система показала хорошие результаты. В тесте GDP.pdf, измеряющем работу со сложными документами, таблицами и примечаниями:
| Модель | Полностью выполненные задания |
|---|---|
| GPT-6 Astra | 33,2% |
| GPT-5.6 Sol | 28,2% |
| Claude Fable 5.1 | 26,2% |
Математика: небольшой прогресс, но значимый результат
При тестировании на сложных математических задачах FrontierMath система получила одну попытку на задачу с бюджетом до 300 долларов и 72 часов вычислений. Предварительная версия Astra решила две задачи из 68, что составило примерно 3%. Другие модели не решили ни одной.
Один успешный результат потребовал около 15 часов и 218 долларов, другой примерно 16 часов и 247 долларов. Несмотря на низкий процент, решение ранее открытой математической проблемы представляет значимый научный результат.
ARC-AGI-3: близкий к идеальному результат
В тесте ARC-AGI-3, где агент должен разобраться в правилах незнакомых интерактивных сред, результаты показали:
| Среда | Режим рассуждения | Результат |
|---|---|---|
| Стандартная | max | 62,7% |
| С адаптером OpenAI | max | 98,6% |
| С адаптером OpenAI | high | 99,9% |
Специальный адаптер сохраняет промежуточное состояние рассуждений между запросами. Результат близкий к 100% характеризует систему с дополнительными компонентами, а не только саму модель.
Стоимость использования
Базовые тарифы Astra в API в 2,5 раза выше ставок Sol. Цены Standard для коротких текстов на момент запуска:
| Модель | Ввод $/млн токенов | Выход $/млн токенов |
|---|---|---|
| GPT-6 Astra | 10 | 50 |
| GPT-5.6 Sol | 4 | 20 |
| GPT-5.6 Terra | 2 | 12 |
| GPT-5.6 Luna | 0,20 | 1,20 |
Общая оценка
По совокупности данных Astra показывает особую силу в длительной работе с инструментами, сложной математике и анализе документов. Однако преимущество варьируется в зависимости от программной среды: одна платформа ставит её первой в тестах кода, другая показывает лучшие результаты у Fable 5.1. В тестах качества текста обе конфигурации Astra уступают Sol.
Главное преимущество заключается в способности доводить до результата многоэтапные проекты: соединять устройства и программы, создавать редактируемые трёхмерные сцены и находить математические доказательства. Тем не менее, успех в одном наборе тестов не означает общее превосходство по стилю, скорости, цене и надёжности. Независимые проверки показывают конкретные сильные стороны новой модели и одновременно демонстрируют конкурентоспособность предыдущих и более экономичных решений.
