AgenAplikasi 🇷🇺 12.08.2026 01:02

Mengubah 73 Komentar Review Bos menjadi Dataset: Membuat Digital Twin dari Seorang Reviewer

OpenAIOpenAI
Seorang pengembang di organisasi besar mengotomatiskan laporan kelayakan IT menggunakan pipeline LLM dan menghadapi review dengan 73 komentar dari manajernya. Alih-alih mengoreksi secara manual, mereka mengekstrak komentar dari file DOCX, mengelompokkannya dengan LLM menjadi 16 pola dan 6 grup, dan membangun checklist aturan. Mengintegrasikan checklist ke dalam pipeline sebagai langkah validasi terpisah dan menandai sumber setiap pernyataan (dari brief, estimasi, atau asumsi) secara drastis mengurangi koreksi berulang. Batch dokumen berikutnya lolos tanpa komentar yang berulang.
Seorang karyawan di sebuah organisasi besar menulis laporan studi kelayakan teknis untuk proyek-proyek AI, sebuah tugas yang telah ia otomatisasi dengan agen LLM yang mengumpulkan dokumen proyek, mengekstrak teks, mengisi JSON terstruktur, dan menghasilkan DOCX dari templat. Setelah mengirimkan sembilan laporan, manajernya mengembalikannya dengan 73 komentar, banyak yang berulang dan terkait dengan sumber yang hilang, klaim yang tidak didukung, dan kontradiksi. Ia menggunakan Python untuk mengekstrak komentar dari file DOCX, kemudian meminta LLM untuk mengelompokkan 73 komentar tersebut menjadi 16 pola dalam 6 kelompok, termasuk kepatuhan pada brief, dukungan bukti, batas kompetensi, pilihan arsitektur, kedalaman pertanyaan, dan penahapan. Ia mengidentifikasi bahwa hampir semua komentar bersifat epistemologis — menuntut status klaim yang jelas, karena LLM menghasilkan teks yang seragam percaya diri. Ia membuat tiga perubahan pada alur kerja: menandai setiap klaim sebagai [B] dari brief, [E] perkiraan ahli, atau [D] asumsi; menambahkan checklist sebagai langkah terpisah dalam alur kerja; dan menyimpan checklist tersebut dalam memori persisten agen. Empat dokumen berikutnya lolos tanpa komentar berulang, dan hanya masalah substantif baru yang tersisa. Penulis mengakui ukuran sampel yang kecil dan bahwa efeknya sebagian berasal dari penandaan sumber itu sendiri, bukan menggunakannya untuk melewati peninjau tetapi untuk memformalkan standar kualitas implisit peninjau.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru