09.10.2026

DrivingBench: ChatGPT управляет автомобилем, а Grok разбился на первом повороте

DrivingBench: ChatGPT управляет автомобилем, а Grok разбился на первом повороте

Когда обычную языковую модель общего назначения — такую, как Claude, GPT или Grok, — просят сесть за руль и управлять автомобилем, получается именно то, что можно ожидать от программ, не предназначенных для вождения. Да, многие современные системы автономного вождения используют элементы искусственного интеллекта в том или ином виде, но они создаются строго под эту задачу. Группа исследователей решила проверить, как справятся с управлением обычные ИИ-агенты, и использовала для этого оборудование Comma vision на базе OpenPilot, а также стандартный Toyota Corolla. Результаты, честно говоря, не вселяют оптимизма в тех, кто мечтает о бессезённых водителях, но они очень показательны.

Авторы проекта DrivingBench — Адитья Рамабадран, Саймон Махнс и Тобиас Гесслер — предложили простой, но наглядный тест. Модели Claude, GPT и Grok должны были пройти короткий маршрут точка-точка на парковке с несколькими поворотами, обозначенными мини-конусами. Каждому агенту давали одинаковую команду, одинаковые правила и просили после каждого шага описывать, что он видит и что делает. При этом агент получал полный контроль над газом, тормозом и рулём. Из-за того, что команды отправляются на удалённые серверы через мобильный хот-спот, движение постоянно прерывается, и весь процесс происходит в рамках одного непрерывного чата. У каждой модели было три попытки, чтобы доказать, что она способна справиться.

Выводы, к которым пришла команда DrivingBench, неутешительны: у frontline-моделей, мягко говоря, нет навыков вождения. Из 11 запусков на четырёх разных агентах восемь не смогли преодолеть и 11% трассы, разбившись уже на первом повороте. Каждая попытка записывается на видео, а переписка в реальном времени позволяет увидеть, как ИИ пытается анализировать обстановку — или, по крайней мере, делает вид, что пытается.

Grok, например, принял просвет между мини-конусами на внешней границе трассы за ворота, которые ему нужно было проехать, и на первой же попытке поехал прямо, завершив заезд уже после двух команд. Один из GPT-моделей дополнительно придумал собственное правило, якобы конусы с одной стороны трассы имеют одинаковый цвет, хотя в исходной команде явно предупреждали, что это не так. А многие агенты просто не могли достаточно сильно повернуть руль, потому что не могли рассчитать нужный угол для прохождения поворотов.

Читать эти односторонние диалоги невероятно интересно: как бы ни были умны эти модели в отдельных задачах, за рулём они совершенно беспомощны. Почти все, если не считать одного исключения. GPT-6 Astra стал единственным агентом, который полностью прошёл трассу — и то со второй попытки. Маршрут, который он выбрал, был довольно неуклюжим: машина сильно прижималась к длинному правому повороту и почти съехала с трассы с внешней стороны прямо перед финишным боксом, но, как говорится, победа есть победа.

По данным DrivingBench, успешный заезд Astra обошёлся в 7 долларов 74 цента — почти в четыре раза дороже, чем предыдущая попытка, которая позволила ему проехать только половину расстояния, и при этом потребовала значительно больше токенов. Говорят, что ИИ однажды погубит человечество; этот эксперимент показывает, что одним из самых быстрых способов сделать это является позволить так называемым «лучшим» агентам управлять нашими автомобилями.

Подписывайтесь на наш канал Дзен и группу ВК

The Drive

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *