Cache élastique linéaire : une nouvelle approche de gestion du cache optimise les coûts cloud
Google/DeepMind
Google Research et Google Cloud ont introduit le cache élastique linéaire, une méthode qui ajuste dynamiquement la taille du cache pour minimiser le coût total. En formulant l'éviction de pages comme un problème de location de skis et en utilisant un modèle d'apprentissage automatique léger, cette approche a réduit l'utilisation de la mémoire jusqu'à 30 % dans les serveurs de production Spanner, avec seulement une augmentation de 0,5 % des coûts d'entrée-sortie.
Google Research et Google Cloud ont présenté le linear elastic caching lors de CIDR 2025. Cette méthode traite la mémoire comme un coût variable et utilise un algorithme de type « ski rental » pour déterminer la durée de vie (time-to-live, ou TTL) des pages mises en cache, combiné à un modèle d'apprentissage automatique léger (un arbre de décision peu profond) permettant de prédire le TTL optimal. En production sur Spanner, cette approche a permis de réduire la consommation mémoire jusqu'à 30 %, tout en n'entraînant qu'une hausse négligeable de 0,5 % des coûts d'entrées-sorties (I/O). Des évaluations menées sur des traces publiques ont également montré des économies de coûts constantes par rapport aux caches de taille fixe. Ces travaux ont été réalisés par Todd Lipcon, Manish Purohit, Tamas Sarlos et Ravi Kumar.
Source: Google Research —
original
