Anthropic は自社のアプリケーションに対する日常メンテナンスに Claude Code のテストを行っています。The Decoder のデータによると、数週間にわたりこのツールが 388 件の変更マージリクエストを作成し、人間による検証を経てそのうち 46% が統合されました。

タスクには、ファジングを用いたバグの発見や未使用コードの削除などが含まれていました。Claude Code の発明者である Boris Cherni は、この結果を「これが可能であることを示す初期の兆候」と表現しました。

本実験の重要性は、AI が単発のコード生成ではなく、企業内での継続的な技術作業を実行するシナリオを検証している点にあります。ただし、入手可能な情報は独立した一つの情報源からのメタデータとして提示されているに過ぎず、変更の品質やタスクの分布については依然として疑問が残ります。