Miksi Tesla ei koskaan tee todella luotettavaa täysautopilottia
Tesla
Moonshot AI
Artikkelissa väitetään, että perinteiset tietokonenäkömeneetelmät ovat saavuttaneet katonsa eivätkä pohjimmiltaan kykene ratkaisemaan tehtäviä, kuten täysautopilottia tai YouTuben Content ID:tä tehokkaasti. Siinä väitetään, että moderni tekoäly perustuu tilastollisiin korrelaatioihin todellisen tunnistamisen sijaan, ja esitellään TAPe (Theory of Active Perception) läpimurtona, joka ratkaisee tunnistusongelmat vähäisillä resursseilla.
Artikkelissa väitetään, että perinteiset kuvan- ja videonkäsittelymenetelmät, mukaan lukien kapseliverkot ja videomuuntimet, ovat saavuttaneet pullonkaulan ja vaativat valtavia resursseja jopa yksinkertaisiin tehtäviin. Esimerkkinä käytetään YouTuben Content ID:tä: huolimatta 10 vuoden kehityksestä ja 100 miljoonasta dollarista, se ei edelleenkään pysty tehokkaasti käsittelemään lyhyitä leikkeitä. Teslan Full Self-Driving (FSD) -järjestelmää kritisoidaan siitä, että se on pysynyt SAE-tason 2 mukaisena lupauksista huolimatta, vaatien jatkuvaa ihmisen valvontaa ja joutuen tutkintojen kohteeksi onnettomuuksien jälkeen. Kirjoittaja väittää, että moderni tekoäly on perustavanlaatuisesti rajallista, koska se perustuu tilastollisiin korrelaatioihin suurista tietoaineistoista eikä todelliseen ymmärrykseen, mikä johtaa epäonnistumisiin harvinaisissa skenaarioissa. Artikkeli esittelee TAPe:n (Theory of Active Perception), menetelmän, joka esittää kohtaukset jäsenneltyinä T-bitteinä, jotka koodaavat geometrian ja semantiikan, mahdollistaen tunnistuksen minimaalisilla resursseilla. Content ID:tä varten TAPe jakaa videon kohtauksiin, jotka kuvataan kukin 48 tavulla, mahdollistaen välittömän täsmäytyksen minkä kokoisissa arkistoissa tahansa käyttäen yhtä palvelinta ilman grafiikkaprosessoreita. Kirjoittaja toteaa, että autopilotissa pelkkä tietokonenäkö ei riitä, mutta TAPe ratkaisee näköosan täysin.
Lähde: Хабр — Data Mining —
Alkuperäinen
