Membangun Alur Kerja Agen dengan SageMaker AI dan Bedrock AgentCore
Amazon Web Services
Anthropic
Alibaba/Qwen
Posting ini menunjukkan cara menggabungkan endpoint yang kompatibel dengan OpenAI di Amazon SageMaker AI dengan runtime Amazon Bedrock AgentCore untuk membangun sistem multi-agen. Ini memandu melalui penerapan Qwen 3.5 9B di SageMaker AI, mengintegrasikannya ke dalam sistem multi-agen Strands Agents bersama model di Amazon Bedrock, dan mengirimkan seluruh alur kerja ke runtime Amazon Bedrock AgentCore. Fokusnya adalah pada mekanika integrasi, termasuk observabilitas tingkat token dari endpoint SageMaker, yang tidak disediakan Strands secara default.
Tantangan umum dalam membangun alur kerja agentik adalah menggabungkan model fondasi terkelola dengan model Anda sendiri yang dioptimalkan dari segi biaya atau khusus domain tanpa menulis ulang kerangka kerja agen. Postingan ini menunjukkan cara menggabungkan endpoint yang kompatibel dengan OpenAI di Amazon SageMaker AI dengan runtime Amazon Bedrock AgentCore dan penerapan terkelolanya. Arsitektur ini menghubungkan tiga jalur hosting model melalui satu kontainer Amazon Bedrock AgentCore: agen orkestrator (Claude Haiku 4.5 di Bedrock) untuk klasifikasi niat dan perutean, agen anggaran (Claude Sonnet 4.6 di Bedrock) untuk rincian anggaran, dan agen analisis keuangan (Qwen 3.5 9B di Amazon SageMaker AI) untuk analisis saham menggunakan pemanggilan alat. Penerapan ini mencakup token pembawa yang disegarkan otomatis untuk sesi berdurasi panjang, menggunakan pola agen sebagai alat dari Strands Agents, dan menerapkan melalui bedrock-agentcore-starter-toolkit. Tantangan utama adalah bahwa runtime Amazon Bedrock AgentCore secara otomatis menginstrumentasi agen dengan OpenTelemetry, tetapi endpoint yang kompatibel dengan OpenAI di SageMaker tidak mendapatkan telemetri token secara otomatis. Solusinya melibatkan pemancaran span gen_ai.chat secara manual yang membungkus pemanggilan agen SageMaker dan mengekstraksi penggunaan token dari AgentResult.metrics.accumulated_usage milik Strands. Selain itu, stream_options: {"include_usage": True} harus diatur karena vLLM tidak menyertakan potongan penggunaan dalam respons streaming secara default. Postingan ini juga membahas konfigurasi langkah demi langkah, contoh keluaran jejak, pembelajaran kunci, dan perluasan pola dengan model yang disetel halus, pengujian A/B dengan komponen inferensi, dan perutean yang sadar biaya.
Sumber: AWS ML blog —
asli
