¿Qué pasa cuando tomas un modelo de inteligencia artificial “frontera” (de uso general) como Claude o GPT y le pides que se ponga al volante y maneje un auto? Claro, algunos sistemas de conducción autónoma utilizan IA en un sentido u otro, pero están diseñados específicamente para esa tarea. Investigadores quisieron ver qué tan bien puede una IA típica cumplir la tarea de conducir, usando el hardware Comma Vision y OpenPilot. Los resultados, seguramente, no harán que nadie se apresure a reemplazarse en el asiento del conductor en un futuro cercano, pero sí son reveladores.
Aditya Ramabadran, Simon Mahns y Tobias Gessler crearon DrivingBench: una prueba simple para Claude, GPT y Grok, que permite navegar un corto circuito punto a punto alrededor de un estacionamiento con algunas curvas, delimitado por conos pequeños. A cada agente se le dio el mismo comando, con las mismas pautas y direcciones para compartir lo que ven y hacen tras cada paso, además de tener control total de un Toyota Corolla. Se detienen con regularidad en el camino, porque los comandos se envían a granjas de datos a través de un punto de acceso inalámbrico, y todo esto ocurre dentro de un solo chat continuo. Tienen tres intentos para lograrlo.
Lo que descubrió el equipo de DrivingBench es que los modelos de frontera, francamente, no son buenos para esto. De las 11 ejecuciones realizadas entre cuatro agentes diferentes, ocho no lograron completar más del 11% del recorrido, chocando en la primera curva. Cada sesión tiene un video adjunto, con los recibos del chat desplazándose en tiempo real para que puedas ver a la IA trabajando en ello—o, al menos, intentando hacerlo.
Grok, inicialmente, pensó que un hueco entre los mini conos que forman el límite exterior era una puerta por la que debía pasar; avanzó directo en su primer intento, y terminó tras solo dos comandos. Un modelo de GPT falló en parte porque inventó una regla de que los conos de un lado del recorrido eran de color idéntico, lo cual el comando inicial, escrito por humanos, advirtió explícitamente que no era así. Y muchos de los agentes simplemente no giraron lo suficiente, porque no lograban determinar cuánta inclinación de giro era necesaria para tomar las curvas.
Leer estas conversaciones unilaterales es fascinante, porque por más inteligentes que sean estos agentes para ciertas tareas, están completamente fuera de su profundidad cuando se trata de conducir. Todos, excepto uno, porque GPT-6 Astra fue el único agente que completó el recorrido por completo, en su segundo intento. La ruta que tomó fue un poco extraña, como se puede ver abajo, abrazando fuertemente la curva larga hacia la derecha antes de casi salirse del camino hacia el exterior justo antes de la casilla de meta, pero una victoria es una victoria.

Según DrivingBench, la corrida exitosa de Astra costó $7.74—casi cuatro veces más que el cargo (y muchísimos más tokens) que obtuvo su intento anterior, que avanzó la mitad del recorrido. Algunas personas dicen que la IA acabará con todos nosotros; este experimento demuestra que una forma muy rápida de hacer que eso pase es dejar que los agentes “más capaces” del mundo manejen nuestros coches.
¿Tienes una pista? Contáctanos a tips@thedrive.com