Die Forschungseinheit von Alibaba hat das Qwen-Drive 1.0 —-Modell veröffentlicht, das die Wahrnehmung der Umgebung, die Beantwortung von Fragen zum Straßenverkehr und die Routenplanung kombiniert.

Laut The Decoder haben Forscher gezeigt, dass text-visuelle Modelle kein automatisches Verständnis des dreidimensionalen Raums entwickeln. Die räumliche Wahrnehmung muss gezielt trainiert werden. Das erklärte Ziel ist ein einziges System, das sowohl die Bordschnittstelle als auch das Fahren steuert.

Der praktische Nutzen der Entwicklung liegt im Versuch, Fahrerassistenzfunktionen und die Interaktion mit dem Fahrgast in einem einzigen Modell zu vereinen. Die vorliegende Beschreibung enthält jedoch keine Daten zur Genauigkeit, zu Straßentests oder zur Sicherheit des Systems; die Quelle merkt zudem an, dass die Erklärung für einen Bremsvorgang nicht mit dem tatsächlich ausgeführten Manöver übereinstimmen kann.