Menurut benchmark terbaru Artificial Analysis, Claude Opus 5 memperoleh skor 61 pada indeks kecerdasan, hanya unggul tipis dari skor 60 Fable 5. GPT-5.6 Sol mencetak 59, sedangkan Kimi K3 mencetak 57.
Opus 5 rata-rata menghabiskan $2,03 per tugas, 26% lebih rendah dibandingkan $2,75 milik Fable 5. Model ini memuncaki penilaian pada uji evaluasi GDPval-AA v2 dan tugas pengetahuan AA-Briefcase, serta berada di peringkat pertama pada indeks Agent pemrograman saat dipasangkan dengan Claude Code. Model ini meraih 89% pada Terminal-Bench v2.1, hampir menyamai GPT-5.6 Sol.