なぜテスラは真の完全信頼性を持つ本物のオートパイロットを実現できないのか
Tesla
Moonshot AI
この記事は、従来のコンピュータビジョン手法が天井に達しており、完全自動運転やYouTubeのコンテンツIDなどのタスクを効率的に解決するには根本的に能力が不足していると論じています。また、現代のAIは真の認識ではなく統計的な相関関係に依存していると主張し、最小限のリソースで認識問題を解決する画期的なアプローチとしてTAPe(能動的知覚理論)を紹介しています。
この記事は、画像および動画処理の従来の手法、すなわちカプセルネットワークやビデオトランスフォーマーが、たとえ簡単なタスクであっても多大なリソースを必要とし、限界に達していると主張している。例として、YouTubeのContent IDを挙げており、10年の開発と1億ドルの投資にもかかわらず、短いクリップを効率的に処理できないとしている。テスラのFull Self-Driving(FSD)は、約束にもかかわらずSAEレベル2のままであると批判されており、常に人間の監視が必要で、事故後には調査に直面している。著者は、現代のAIは本質的に限界があると主張する。なぜなら、それは真の理解ではなく、大規模なデータセットからの統計的相関に依存しており、稀なシナリオでの失敗につながるからである。記事では、TAPe(Theory of Active Perception)を紹介している。これは、幾何学と意味論を符号化する構造化Tビットでシーンを表現し、最小限のリソースで認識を可能にする手法である。Content IDに関しては、TAPeはビデオを各48バイトで記述されるシーンに分割し、どんなサイズのアーカイブでも、GPUなしの単一サーバーで即座にマッチングを可能にする。著者は、自動運転においてはコンピュータビジョンだけでは不十分だが、TAPeがビジョンの部分を完全に解決すると述べている。
出典: Хабр — Data Mining —
原文
