Kehotteen kopioiminen kahdesti: Testasin '+76 %' -tempun ja selvitin totuuden
Google/DeepMind
Viralttinen elämänhakkerointi väittää, että kehotteen (promptin) kaksoiskopiointi suurelle kielimallille (LLM) parantaa tarkkuutta 76 prosentilla. Testasin tämän 3360 kyselyllä useiden Gemini-mallien avulla ja havaitsin, että vaikutus on todellinen mutta kapea: se korjaa tietyn ongelman, joka ei-päättelymalleilla on pitkien listojen kanssa, mutta se ei ole yleinen älykkyysparannus. Kuuluisa +76 prosenttia on yksittäinen stressitesti, eivätkä nykyaikaiset päättelymallit ole alttiita tälle tempulle.
Kirjoittaja testasi viruksena levinnyttä promptin kopiointikikkaa, joka viittasi Google Researchin preprint- julkaisuun 'Prompt Repetition Improves Non-Reasoning LLMs'. Alkuperäisessä tutkimuksessa kopioimalla promptin auttoi ei-päättelymalleja 47:ssä 70:stä vertailusta, ja +76 %:n luku tuli yksittäisestä stressitestistä Gemini 2.0 Flash-Lite -mallilla, joka on sittemmin poistettu käytöstä. Kirjoittaja suoritti oman kokeensa: 3360 kyselyä, 1,48 dollaria, käyttäen gemini-2.5-flash-lite (päättely pois päältä) ja gemini-3.5-flash-lite (ajatteleminen minimaalinen ja korkea). Stressitestisarjassa (NameIndex ja MiddleMatch-tehtävät) promptin kopioiminen paransi tarkkuutta +38,8 prosenttiyksikköä 2.5-mallilla, toistaen alkuperäisen vaikutuksen, mutta sillä ei ollut vaikutusta arkipäiväisiin tehtäviin. Kolmas kopio lisäsi vain +5 prosenttiyksikköä, eikä merkin, kuten 'Toista:', lisääminen tehnyt eroa. 3.5-mallilla minimaalisella ajattelulla vaikutus säilyi (+36,3 prosenttiyksikköä), mutta korkealla ajattelulla tarkkuus oli jo 100 % molemmilla prompteilla. Kikka myös vakautti muuten epädeterministisen mallin. Kirjoittaja kuitenkin huomauttaa, että kikka korjaa erityisesti tarkkaavuuden herpaantumista pitkissä listoissa, ei laskutoimituksia tai muita päättelypuutteita, ja kehottaa varovaisuuteen: tulokset rajoittuvat tiettyihin mallitunnuksiin ja päivämääriin, ja aineisto on itse tehty.
Lähde: Habr — хаб ИИ —
Alkuperäinen
