Питер Гостев из Arena запустил эксперимент с двумя топовыми ИИ-моделями. Сначала GPT-6 Astra и Fable 5.1 управляли парком развлечений в RollerCoaster Tycoon 2, потом участвовали в боевых партиях Worms Armageddon.
RollerCoaster Tycoon 2 требует от агента удерживать состояние сложной системы часами: планировать инфраструктуру, следить за экономикой, замечать ошибки и исправлять их последствия. Цель первого теста — привести в парк тысячу посетителей с максимальной прибылью.
Astra достигла целевой численности за три часа. Стоимость парка составила около $65 тысяч. На задачу потрачено примерно 50 млн токенов, что по API-тарифам обошлось в $68. Модель строила крупные аттракционы, анализировала выручку, менялась цены, гасила долги и потратила $50 тысяч на рекламу.
Fable за три с половиной часа цели не достигла. Её парк стоил около $18 тысяч, токенов потреблено 250 млн ($297 по стоимости). Модель выбрала другую стратегию: заполнила парк повторяющимися аттракционами — четыре одинаковых Twist, четыре слайда, три колеса обозрения. Поток посетителей почти не вырос.
Astra действовала с ошибками, но реагировала на них. Заметила, что закусочная ничего не продаёт, и перенесла магазин в более доступное место. Fable столкнулась с проблемами доступа механиков и поломками аттракционов, но продолжала расширяться, даже работая в убыток.
Способность агента обнаружить последствие собственного решения и перестроить план часто ценнее безошибочного первого хода.
Во второй части эксперимента модели играли в Worms Armageddon. Здесь нужно оценивать рельеф, угол и силу выстрела, учитывать физику и ветер, выбирать оружие, сравнивать риск и строить план на несколько ходов.
На среднем уровне рассуждений Astra проиграла 0:3. Гостев оценил игру обеих моделей как слабую, но Astra особенно часто принимала решения, которые вредили её собственной команде — смесь осмысленного поведения и того, что Гостев назвал «полным идиотизмом».
На максимальном уровне рассуждений матчи стали плотнее. Перед последней партией счёт дошёл до 2:2, но Fable выиграла со счётом 3:2. Повышение вычислительных затрат не избавило модели от множества очевидных ошибок.
Игровые тесты постепенно становятся удобным инструментом для проверки ИИ-агентов. Astra уже прошла Portal и добыла алмаз в Minecraft. В отличие от коротких академических тестов, игра заставляет модель управлять последствиями своих решений десятки минут или часы.
Эксперимент не претендует на полноценный бенчмарк. Число игр ограничено, прогонов мало, результат зависит от агентской оболочки и настроек. Но он хорошо показывает разницу между способностью рассуждать в отдельном ответе и умением часами управлять меняющимся миром, где вчерашняя ошибка продолжает мешать через сотню действий.
На фоне опасений, что сверхмощный ИИ может угрожать человечеству, результаты выглядят довольно успокаивающе. Передовые модели справляются с управлением парком и боевыми играми заметно хуже, чем можно было бы ожидать от будущих властелинов машин.
