Anthropic testet Claude Code für die tägliche Wartung eigener Anwendungen. Laut The Decoder hat das Tool nach einigen Wochen 388 Anfragen zur Zusammenführung von Änderungen erstellt, und nach menschlicher Prüfung wurden 46% davon zusammengeführt.

Zu den Aufgaben gehörten das Auffinden von Ausfällen mittels Fuzzing und das Entfernen ungenutzten Codes. Der Erfinder von Claude Code, Boris Cherni, bezeichnete das Ergebnis als „frühe Anzeichen, dass dies möglich sein könnte“.

Der Wert des Experiments liegt in der Prüfung eines Szenarios, bei dem KI nicht eine einmalige Codegenerierung durchführt, sondern eine fortlaufende technische Arbeit innerhalb des Unternehmens erledigt. Allerdings liegen die verfügbaren Informationen als Metadaten einer unabhängigen Quelle vor, weshalb Unsicherheiten bestehen hinsichtlich der Qualität der Änderungen und der Verteilung der Aufgaben.