Claude Fable 5 Ungguli GPT-5.6 dalam Penulisan Ulang Kode dari Nol. Ini Alasannya
Anthropic
OpenAI
Tolok ukur MirrorCode dari Epoch AI menunjukkan Claude Fable 5 menyelesaikan 64% tugas dibandingkan dengan 20% untuk GPT-5.6 Sol. Kesenjangan ini berasal dari keandalan, bukan kemampuan mentah: Sol sering menyelesaikan tugas secara parsial, sementara Fable secara konsisten menyelesaikannya. Kinerja kuat Fable dalam Ada, bahasa dengan data pelatihan yang langka, menunjukkan keterampilan daripada hafalan.
Epoch AI memperbarui papan peringkat MirrorCode, mengungkapkan bahwa Claude Fable 5 milik Anthropic berhasil menyelesaikan 64% tugas, sementara GPT-5.6 Sol milik OpenAI hanya mampu menyelesaikan 20%. Perbedaan tiga kali lipat ini tampak aneh mengingat kedua model menunjukkan kinerja yang sebanding pada tes lain, tetapi Epoch AI dan Anthropic tidak memberikan penjelasan resmi. MirrorCode, yang dikembangkan bersama METR, mengharuskan model untuk menulis ulang seluruh program dari awal, hanya melihat 'kotak hitam' yang dapat dieksekusi, dokumentasi, dan tes yang terlihat; solusi harus melewati semua tes tersembunyi. Tolok ukur ini mencakup 15 program nyata seperti sed dan Ruff, masing-masing diimplementasikan dalam dua bahasa, dengan anggaran 10 miliar token dan waktu 7 hari per percobaan. Analisis peta panas menunjukkan bahwa Sol sering kali menyelesaikan tugas secara parsial (tingkat keberhasilan 50%, 33%, 17%), sementara Fable hampir selalu menyelesaikannya dengan tuntas (100%, 83%). Petunjuk lain: kinerja Fable hanya turun sedikit pada Ada (61% vs 64% pada Go), sementara model OpenAI kehilangan signifikan pada Ada — Sol turun dari 24% menjadi 19%, GPT-5.4 dari 21% menjadi 12%, dan GPT-5.5 dari 17% menjadi 5%. Karena hampir tidak ada implementasi program-program ini dalam bahasa Ada di data pelatihan, ketahanan Fable terhadap Ada menunjukkan keterampilan asli, bukan hafalan. Namun, pemeriksaan kontaminasi Epoch sendiri menemukan tanda-tanda hafalan pada 17 dari 25 program, dan pengaturan spesifikasi yang tepat dari tolok ukur ini berbeda dari pengembangan dunia nyata.
Sumber: Habr — хаб ИИ —
asli
