La división de investigación de Alibaba lanzó Qwen-Drive 1.0 —, un modelo que combina la percepción del entorno, las respuestas a preguntas sobre el tráfico y la planificación de rutas.

Según datos de The Decoder, los investigadores demostraron que los modelos texto-visuales no comienzan a comprender automáticamente el espacio tridimensional; la percepción espacial debe entrenarse de manera intencionada. El objetivo declarado es crear un único sistema que gestione tanto la interfaz a bordo como la conducción.

El significado práctico de este desarrollo es un intento de consolidar las funciones de asistencia al conductor y de interacción con el pasajero en un solo modelo. Sin embargo, la descripción presentada no incluye datos sobre precisión, pruebas en carretera o seguridad del sistema; la fuente también señala que la explicación de una frenada podría no coincidir con la maniobra ejecutada.