La division de recherche d'Alibaba a publié Qwen-Drive 1.0 —, un modèle qui combine la perception de l'environnement, les réponses aux questions sur la circulation routière et la planification d'itinéraire.

Selon The Decoder, les chercheurs ont démontré que les modèles texte-visuel ne commencent pas automatiquement à comprendre l'espace tridimensionnel; la perception spatiale doit être enseignée de manière ciblée. L'objectif déclaré est de créer un système unique gérant à la fois l'interface embarquée et la conduite.

La portée pratique de ce développement réside dans la tentative de fusionner les fonctions d'aide à la conduite et d'interaction avec les passagers au sein d'un modèle unique. Cependant, la description présentée ne contient aucune donnée sur la précision, les essais sur route ou la sécurité du système; la source note également que l'explication d'un freinage peut ne pas correspondre à la manœuvre effectuée.