SQLite-gecomprimeerde tekstgeschiedenis-prototypes
OpenAI
Simon Willison deelt zijn idee om revisiegeschiedenissen op te slaan in SQLite met behulp van gecomprimeerde JSON-arrays van alle eerdere versies. Hij bespreekt het prototype met de GPT-Live-spraakmodus en laat vervolgens GPT-5.6 Sol Pro experimentele prototypes bouwen, die uitstekende compressieresultaten laten zien.
Simon Willison is geïnteresseerd in mogelijkheden voor het opslaan van revisiegeschiedenis in relationele databases. Tijdens een wandeling met zijn hond kreeg hij een idee: neem de volledige tekst van elke eerdere versie in een grote JSON-array van strings en pas zlib- of zstd-compressie toe op het geheel. Hij besprak het prototype met de GPT-Live-spraakmodus in de ChatGPT-iPhone-app en legde uit dat een geschiedenis-kolom op een tabel een blob kan zijn die een gecomprimeerde JSON-array van alle eerdere documenten opslaat, plus een aparte JSON-array van tijdstempels die geen compressie nodig heeft. Vervolgens typte hij een tekstprompt naar GPT-5.6 Sol Pro om experimentele prototypes in Python te bouwen. De prototypes werkten goed: 1.000 gesimuleerde revisies van een document resulteerden in 20,4 MB aan onbewerkte revisietekst die gecomprimeerd werd tot 80,3 KB als een Zstandard-gecomprimeerde JSON-array. Om de overhead van het decomprimeren en opnieuw decomprimeren van de volledige array bij elke bewerking te vermijden, stelde Sol voor om de geschiedenis op te splitsen in meerdere rijen, elk met een maximum van 128 revisies of 3 MB aan ongecomprimeerde JSON.
Bron: Simon Willison —
origineel
