Исследователи из DrivingBench подключили четыре универсальные модели искусственного интеллекта к Toyota Corolla 2022 года и позволили им управлять машиной на размеченной парковке. Машины получили несложную задачу: пройти фиксированный маршрут и остановиться в указанной зоне. Только GPT-6 Astra от OpenAI справилась полностью.

Astra впервые попыталась преодолела 49% маршрута, затем разобрала собственные ошибки в диалоговом окне. При следующей попытке модель изменила поведение и преодолела 134,7 метров за 5 минут 22 секунды, отправив автомобилю 24 команды.

Её конкуренты не дошли до финиша. Claude Fable 5.1 от Anthropic улучшила результат с 9% до 45% за три попытки, Grok 4.6 от xAI остановилась на 11%, а GPT-5.6 Sol показала около 6%. Большинство заездов обрывались у первого поворота — модели неправильно определяли, с какой стороны от диагонального ряда конусов находилась нужная полоса.

Подключение происходило через устройство comma four и протокол CAN-шины. Камеры и данные телеметрии поступали к модели через MCP-инструменты, её ответ задавал направление поворота, процент разворота руля, скорость и длительность движения. Каждая новая команда заменяла предыдущую, независимо от того, завершилась она или нет.

Задержка ответа стала частью испытания. Пока модель обрабатывала кадры с камер, машина продолжала следовать старой команде, поэтому долгая пауза могла направить её в конус. Astra обновляла информацию каждые 5–6 секунд и отправляла примерно шесть команд в минуту. Другие модели тратили больше времени на обработку при остановленном автомобиле.

Успешный заезд потребовал около 6,6 млн токенов за 5 минут 22 секунды реального движения. Затраты составили $7,74, так как большая часть повторяющегося контекста списывалась как кэшированный вход. Первый неудачный заезд потребовал около 1,2 млн токенов и обошёлся в $2,01.

Успешный заезд был далёк от обычного вождения. На второй попытке Astra не превышала скорости 0,8 м/с, вся трасса заняла чуть больше пяти минут. В салоне присутствовал оператор с ногой над педалью тормоза, готовый вмешаться при выезде за границы или угрозе столкновения. Программные ограничения дополнительно сдерживали скорость и отключали движение при опасных манёврах.

Модели периодически отказывались управлять реальной машиной по соображениям безопасности. Astra согласилась стабильно действовать только после длительной переработки инструкций и переименования среды управления в «DrivingBench Sandbox». Попытка назвать происходящее симуляцией работала менее эффективно.

Причина показалась почти забавной: реальные кадры парковки позволяли распознать, что среда не виртуальная. Команда использовала арендованную Corolla, искала достаточно свободную площадку и дважды покидала парковки по просьбам владельцев. Компания, сдавшая машину в аренду, о целях проекта заранее не знала.

Даже программная часть показала границы нынешних агентов. При старте проекта разработчики попросили Astra написать связующий софт между моделью и автомобилем. По их словам, первая версия разрослась до примерно 200 тысяч строк кода и её пришлось переписать. Позже готовая инфраструктура позволила модели провести машину по всей трассе.

DrivingBench не доказывает, что универсальные языковые модели готовы к дорогам общего пользования. Авторы провели по одному тесту на каждую модель, повторные попытки шли в одном диалоговом окне и не были независимыми. Эксперимент показывает более узкий факт: модели всё чаще взаимодействуют с физическими системами, с которыми Astra уже работала в других демонстрациях.