Tekoälyagenttien arviointi: Tuotantomalli Strands- ja AgentCore-työkaluilla AWS:ltä ja Motorwaylta
Amazon/AWS
Amazon Web Services
Anthropic
Motorway, brittiläinen online-automarkkinapaikka, kehitti yhdessä AWS:n kanssa tekoälyagenttien arviointiputken autojen etsintään jälleenmyyjiltä. Ratkaisu vähensi virheellisiä tuloksia yhdestä kahdeksasta yhteen viiteenkymmeneen kyselyssä ja lyhensi ongelmien tunnistusaikaa useista tunneista muutamaan minuuttiin. Sen ytimessä on kaksivaiheinen arviointistrategia, joka käyttää Strands Agents SDK:ta ja Amazon Bedrock AgentCorea.
Motorway, brittiläinen verkossa toimiva autokauppapaikka, jossa päivittäin jopa 8000 jälleenmyyjää kilpailee 2500 autosta, on yhteistyössä AWS PACEn kanssa luonut tekoälyagentin, joka etsii autoja jälleenmyyjien varastoista. Agentti käyttää kahdeksaa työkalua yhdistäen rakenteellisen suodatuksen 89 attribuutin perusteella ja vektorihoaku, joka perustuu LanceDB:hen ja Amazon Titan Text Embeddings V2:een. Varmistaakseen agentin luotettavuuden Motorway ja AWS rakensivat arviointiputken, joka vähensi virheellisten tulosten osuutta yhdestä kahdeksasta yhteen 50:een kyselyssä ja lyhensi ongelmien havaitsemisaikaa useista tunneista muutamiin minuutteihin. Putki sisältää kaksivaiheisen strategian: testaus rakennusvaiheessa strands-agents-evals-kirjaston avulla ja seuranta tuotannossa Amazon Bedrock AgentCore Evaluations -työkalulla. Arviointi suoritetaan kolmella tasolla: työkalujen käyttö (kynnysarvo >95 %), päättelylogiikka (>85 %) ja tulosteiden laatu (>90 %). LLM:n epädeterministisyyden hallintaan käytetään pass^k-mittaria, joka kuvaa onnistumisen todennäköisyyttä k peräkkäisellä yrityksellä. Putki sisältää viisi käyttöönottovaihetta laadullisine portteineen. Mukana toimitettavassa repositoriossa on muokattava malli, joka voidaan sovittaa muille agenteille.
Lähde: AWS ML blog —
Alkuperäinen
