Modelo de lenguaje pequeño en Node.js puro: una implementación sin magia
Un desarrollador creó un pequeño modelo de lenguaje causal en JavaScript puro usando Node.js, sin bibliotecas de aprendizaje automático como TensorFlow o PyTorch. El modelo implementa tokenización, incrustaciones, Transformer causal, cabezal de modelo de lenguaje, softmax, pérdida y retropropagación con autograd escalar. El entrenamiento incluye preentrenamiento, ajuste fino supervisado y ajuste fino supervisado adaptativo con ensayo para prevenir el olvido catastrófico, todo ejecutándose en aproximadamente cuatro minutos.
El proyecto implementa un pequeño modelo de lenguaje causal desde cero en Node.js puro (>=18.19) sin usar bibliotecas de ML. Utiliza tokenización a nivel de palabra (24 tokens), dos bloques Transformer causales, autoatención multi-cabeza, FFN con dos capas ocultas y el optimizador Adam. El pipeline de entrenamiento consiste en preentrenamiento sobre hechos declarativos, ajuste fino supervisado en 42 pares de preguntas y respuestas, y SFT adaptativo con ensayo para aprender nuevos hechos sin olvido catastrófico. El modelo tiene 2,160 parámetros. El entrenamiento produce un registro ASCII detallado de matrices y deltas. Todo el código está disponible en GitHub.
Fuente: Habr — хаб ML —
original
