Pourquoi Tesla ne proposera jamais un véritable autopilote fiable à part entière
Tesla
Moonshot AI
L'article soutient que les méthodes traditionnelles de vision par ordinateur ont atteint un plafond et sont fondamentalement incapables de résoudre efficacement des tâches comme le pilotage automatique intégral ou le système Content ID de YouTube. Il affirme que l'IA moderne repose sur des corrélations statistiques plutôt que sur une véritable reconnaissance, et présente TAPe (Théorie de la Perception Active) comme une approche révolutionnaire qui résout les problèmes de reconnaissance avec des ressources minimes.
L'article soutient que les méthodes traditionnelles de traitement d'images et de vidéos, y compris les réseaux à capsules et les transformeurs vidéo, ont atteint un goulot d'étranglement et exigent des ressources énormes même pour des tâches simples. Il cite l'exemple de Content ID de YouTube : malgré 10 ans de développement et 100 millions de dollars, il ne parvient toujours pas à traiter efficacement les courts extraits. Le système Full Self-Driving (FSD) de Tesla est critiqué pour être resté au niveau 2 de la SAE malgré ses promesses, nécessitant une supervision humaine constante et faisant face à des enquêtes après des accidents. L'auteur affirme que l'IA moderne est fondamentalement limitée car elle repose sur des corrélations statistiques issues de grands ensembles de données plutôt que sur une véritable compréhension, ce qui entraîne des échecs dans des scénarios rares. L'article présente TAPe (Théorie de la Perception Active), une méthode qui représente les scènes avec des T-bits structurés encodant la géométrie et la sémantique, permettant une reconnaissance avec un minimum de ressources. Pour Content ID, TAPe décompose la vidéo en scènes décrites par 48 octets chacune, permettant une correspondance instantanée dans des archives de toute taille à l'aide d'un seul serveur sans GPU. L'auteur déclare que pour le pilote automatique, la vision par ordinateur seule est insuffisante, mais que TAPe résout complètement la partie vision.
Source: Хабр — Data Mining —
original
