Modelo de lenguaje pequeño en Node.js puro: una implementación sin magia
Un desarrollador creó un pequeño modelo de lenguaje causal en JavaScript puro usando Node.js, sin bibliotecas de aprendizaje automático como TensorFlow o PyTorch. El modelo implementa tokenización, embeddings, Transformer causal, cabeza de modelo de lenguaje (LM head), softmax, pérdida (loss) y retropropagación con autograd escalar. El entrenamiento incluye preentrenamiento, ajuste fino supervisado y ajuste fino adaptativo con ensayo para evitar el olvido catastrófico, todo ejecutándose en aproximadamente cuatro minutos.
El proyecto implementa un pequeño modelo de lenguaje causal desde cero en Node.js puro (>=18.19) sin usar bibliotecas de ML. Utiliza tokenización a nivel de palabra (24 tokens), dos bloques Transformer causales, autoatención multi-cabeza, FFN con dos capas ocultas y el optimizador Adam. El pipeline de entrenamiento consiste en preentrenamiento sobre hechos declarativos, ajuste fino supervisado en 42 pares de preguntas y respuestas, y SFT adaptativo con ensayo para aprender nuevos hechos sin olvido catastrófico. El modelo tiene 2,160 parámetros. El entrenamiento produce un registro ASCII detallado de matrices y deltas. Todo el código está disponible en GitHub.
Fuente: Habr — хаб ML —
original
