Onderzoek 🇺🇸 27.07.2026 07:02

ABBEL: LLM's trainen om overtuigingen bij te werken voor efficiënte langetermijninteractie

CursorCursor Alibaba/QwenAlibaba/Qwen
ABBEL is een raamwerk dat de prestaties van LLM's in langdurige taken verbetert door de informatie-inhoud van samenvattingen te isoleren en te superviseren met behulp van natuurlijke-taalovertuigingstoestanden. Het verkleint de prestatiekloof ten opzichte van volledige-contextmodellen met ongeveer 50%, terwijl het trainingsstappen halveert en aanzienlijk minder geheugen gebruikt.
ABBEL (Autoencoder Belief Bottleneck for Efficient Learning) pakt het probleem aan van LLM's die moeite hebben met lange interacties, waarbij de volledige contextgeschiedenis niet in het contextvenster past. In plaats van traditionele recursieve samenvattingen formuleert ABBEL samenvattingen als belief-toestanden die het model periodiek bijwerkt. Belief-kwalificatie voegt een hulp-RL-taak toe die beliefs beloont op basis van hoe goed ze recente waarnemingen kunnen reconstrueren. In de CollabBench-omgeving voor collaboratief programmeren behaalde ABBEL met reconstructiegebaseerde belief-kwalificatie een testdoorstaanspercentage van 0,48 (tegenover 0,52 voor volledige context) en een succespercentage van 0,36 (tegenover 0,39), terwijl het 6,01 piektokens gebruikte tegenover 14,08 voor volledige context, en slechts 50 trainingsstappen nodig had tegenover 100. In de Combinatieslot-taak stelde domeinkennis-gebaseerde belief-kwalificatie ABBEL in staat om de prestaties van volledige context te benaderen of te overtreffen. Bij multi-objectieve QA verminderde een Peak Belief Length Penalty het geheugengebruik met minimaal prestatieverlies. Het artikel is geschreven door Lidayan et al. van Berkeley AI.
Bron: BAIR (Berkeley AI) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws