Eerste model van Ilya onthuld: SSI's testtijd-trainingsengine
OpenAI
NVIDIA
Een lek beweert dat de startup SSI van Ilya Sutskever een kleine redeneerengine ontwikkelt op basis van Test-Time Training (TTT), die mogelijk al in augustus wordt uitgebracht. Het model, getraind op samengestelde gegevens om te leren hoe te leren, actualiseert zijn gewichten tijdens de inferentie en kan mogelijk concurreren met grotere modellen. Dit sluit aan bij de publieke opvattingen van Ilya over continue leren en de recente investering van Nvidia in SSI.
Een lek op X door gebruiker 'Three Strawberries' beweert dat de startup SSI van Ilya Sutskever een kleine redeneringsengine onderzoekt die is gebaseerd op Test-Time Training (TTT). Het model gebruikt speciaal samengestelde gegevens om te leren hoe te leren, en werkt vervolgens tijdens het oplossen van problemen delen van de gewichten bij, waardoor zelfs een klein model kan concurreren met grotere. De leaker suggereert dat de huidige versie klaar is en dat de volgende versie tien keer groter wordt opgeschaald, terwijl de huidige versie mogelijk al in augustus debuteert voor een beperkt aantal gebruikers. Dit sluit aan bij eerdere uitspraken van Ilya over continu leren en artificiële algemene intelligentie (AGI), zijn overtuiging dat superintelligentie na implementatie moet leren, en de recente aankondiging van Nvidia over een strategisch partnerschap en investering in SSI, waardoor de rekenkracht van SSI met een orde van grootte toenam. De TTT-benadering verschilt van conventionele contextuitbreiding, omdat het context behandelt als trainingsgegevens, waardoor het model zichzelf kan veranderen tijdens inferentie, hoewel dit veiligheidszorgen oproept, waarvan de leaker beweert dat Ilya die heeft aangepakt. SSI, opgericht in 2024, is geheimzinnig geweest, maar dit lek suggereert een mogelijke doorbraak. Het nieuws verwijst ook naar een paper 'End-to-End Test-Time Training for Long Context' als gerelateerd werk.
Bron: QbitAI 量子位 —
origineel
