Van CTR tot deals: hoe Avito ML-monetiseringsmodellen bouwt
Het data science-team van Avito legt uit hoe ze de verwachte omzet uit gebruikersacties schatten en deze gebruiken in de rangschikking. Ze gebruiken CTR-, CVR- en biedaanpassingsmodellen, evalueren de kwaliteit met gestratificeerde ROC-AUC en pakken attributie- en positiebias aan.
Het artikel, geschreven door Alina Babenko, waarnemend DS-manager bij Avito, beschrijft hoe het team van het bedrijf monetisatiemodellen bouwt voor zoekopdrachten en aanbevelingen. De kerntaak is het schatten van de verwachte opbrengst uit gebruikersinteracties met advertenties en deze te verwerken in de ranking. De belangrijkste metriek is omzetgroei, maar het team moet dit in evenwicht brengen met de zoekkwaliteit voor gebruikers. Er worden drie soorten modellen gebruikt: CTR-modellen voorspellen de kans op een klik, CVR-modellen schatten de kans op een doelactie na een klik, en een correctiemodel past biedingen aan op basis van verkeerskwaliteit. Om de gemiddelde kosten per klik stabiel te houden, gebruiken ze query-kruisentropieverlies. Voor het evalueren van de rankingskwaliteit gebruiken ze gestratificeerde ROC-AUC in plaats van globale ROC-AUC, omdat gebruikers advertenties binnen één enkele zoekopdracht vergelijken. Calibratie wordt beoordeeld met de RIG-metriek. Ze worden geconfronteerd met uitdagingen op het gebied van attributie, waarbij ze last-click, first-click of multi-touch benaderingen gebruiken, en onderzoeken ze of ze minder gewicht kunnen toekennen aan vroege klikken. Om positiebias tegen te gaan, gebruiken ze ofwel drie CatBoost-modellen ofwel inverse propensity weighting. Ze zijn ook bezig met de overgang van CatBoost naar deep learning, wat al betere CTR-voorspellingskwaliteit laat zien, maar ze merken op dat het modelleren van deals complexer is dan klikken vanwege langere gebruikersreizen.
Bron: Habr — хаб ML —
origineel
