Mengutip Engadget, data tersebut menunjukkan peningkatan penggunaan Claude dalam proses R&D internal Anthropic. Berdasarkan pengukuran perusahaan, porsi pekerjaan yang berada pada tingkat AI leads masih di bawah 1% pada awal tahun 2026, sebelum meningkat menjadi 26% pada bulan Agustus 2026.
Anthropic menegaskan bahwa istilah leads tidak berarti Claude bekerja sepenuhnya tanpa manusia. Dalam metodologi yang digunakan perusahaan, kategori tersebut berarti AI dapat menyelesaikan sebagian besar pekerjaan secara end-to-end berdasarkan instruksi tingkat tinggi, sementara manusia tetap melakukan pengawasan.
Dengan demikian, angka 26% tidak dapat diartikan sebagai Claude secara mandiri membangun model AI berikutnya. Anthropic menyatakan Claude belum beroperasi sepenuhnya secara otonom pada bagian mana pun dari R&D yang diukur.
Claude Terlibat dalam Lebih dari 90% R&D
Selain 26% pekerjaan pada tingkat AI leads, Anthropic menyebut lebih dari 90% pekerjaan R&D yang diukur sudah berada pada tingkat AI collaborates atau lebih tinggi. Dalam kategori tersebut, AI mampu mengerjakan bagian besar dari sebuah pekerjaan, tetapi masih berada di bawah arahan manusia secara dekat.Pengukuran ini menggunakan skala Automation Level (AL) yang dikembangkan Epoch AI. Skala tersebut bergerak dari AL0, ketika tidak terdapat keterlibatan AI, hingga AL5, ketika AI dapat menjalankan pekerjaan sepenuhnya secara mandiri tanpa manusia dalam prosesnya.
Pada skala tersebut, AL3 menggambarkan kondisi ketika AI berkolaborasi dan mengerjakan bagian besar pekerjaan di bawah arahan manusia. Sementara AL4, kategori AI leads, menunjukkan bahwa AI dapat menyelesaikan sebagian besar pekerjaan dari instruksi tingkat tinggi dengan manusia tetap melakukan supervisi.
AL5 menggambarkan operasi AI secara penuh tanpa keterlibatan manusia. Anthropic menggunakan skala tersebut untuk membangun Anthropic R&D Automation Index. Anthropic mengumpulkan daftar pekerjaan R&D AI, menilai tingkat otomatisasi setiap kategori, kemudian memberikan bobot berdasarkan waktu kerja karyawan yang dialokasikan untuk pekerjaan tersebut.
Untuk membangun indeks, Anthropic mengambil sampel 20% staf dari setiap departemen yang terlibat dalam siklus R&D model selama setiap pekan pada bulan Juli 2026. Proses tersebut menghasilkan sekitar 15.000 tugas R&D yang kemudian dikelompokkan Claude ke dalam struktur dengan 542 kategori pada berbagai tingkat.
Anthropic kemudian menggunakan Claude untuk meneliti tingkat otomatisasi setiap kategori. Hasil penilaian model juga dibandingkan dengan penilaian dari karyawan yang bertanggung jawab atas bidang pekerjaan terkait.
Anthropic melaporkan bahwa penilaian Claude dan manusia memiliki tingkat kesesuaian penuh sebesar 59%, sedangkan kesesuaian penuh antara dua penilai manusia mencapai 35%. Dalam 97% kasus, penilaian Claude dan manusia berada dalam rentang satu tingkat otomatisasi.
Sekitar 30.000 Agen AI Digunakan untuk R&D
Penggunaan AI di Anthropic tidak hanya tercermin dari persentase pekerjaan yang dipimpin Claude. Perusahaan juga mengungkap jumlah agen AI yang digunakan dalam aktivitas penelitian dan rekayasa. Per bulan Agustus 2026, sekitar 30.000 agen menjalankan pekerjaan penelitian dan engineering pada platform internal Anthropic yang paling banyak digunakan.Seluruh agen tersebut berada di bawah sistem pemantauan yang dirancang untuk mendeteksi dan membatasi tindakan berisiko. Anthropic membagi pengawasan tersebut menjadi online monitoring dan offline monitoring.
Pemantauan online dilakukan sebelum tindakan agen dieksekusi, sementara pemantauan offline menganalisis aktivitas setelah tindakan dilakukan. Dalam analisis terhadap lebih dari satu miliar keputusan yang dibuat agen R&D selama Agustus, sekitar 0,002% keputusan diblokir oleh sistem pemantauan online.
Angka tersebut setara dengan sekitar satu keputusan dari setiap 47.000 keputusan. Anthropic juga melaporkan bahwa sistem pemantauan offline menandai sekitar 100.000 transkrip setiap pekan untuk pemeriksaan lebih lanjut.
Setelah melalui penyaringan, sekitar 50 kasus dengan prioritas tertinggi per pekan diteruskan kepada pemeriksa manusia.
Baca Juga :
Claude vs ChatGPT, Apa Bedanya?
Anthropic Usulkan Pengukuran Perkembangan AI
Pengungkapan mengenai penggunaan Claude tersebut merupakan bagian dari upaya Anthropic membuat perkembangan AI di perusahaan frontier lebih mudah diukur dan dibandingkan. Selain tingkat otomatisasi R&D, perusahaan mengusulkan dua ukuran lain, yaitu tingkat pengawasan terhadap agen AI serta alokasi komputasi untuk R&D.Untuk penggunaan komputasi, Anthropic mencatat sekitar 6% komputasi yang digunakan untuk R&D AI dalam sampel satu pekan dialokasikan untuk pekerjaan keselamatan AI. Jika hanya menghitung komputasi untuk R&D yang digerakkan AI, porsinya mencapai sekitar 12%.
Anthropic menekankan bahwa angka tersebut merupakan estimasi konservatif dan bukan ukuran langsung dari seluruh sumber daya yang digunakan untuk keselamatan AI. Anthropic mengatakan metrik tersebut dirancang agar dapat digunakan pula oleh pengembang AI frontier lainnya.
Anthropic menyebut adanya dua tantangan untuk membandingkan hasil antarperusahaan, yaitu belum adanya metodologi bersama serta penggunaan model AI sendiri untuk melakukan sebagian evaluasi. Untuk mengatasi persoalan tersebut, Anthropic menyatakan akan melibatkan evaluator pihak ketiga yang memperoleh akses terhadap proses, sistem, dan data internal tertentu.
Tujuannya adalah memungkinkan verifikasi independen terhadap pengukuran dan praktik keselamatan yang dilaporkan. Pengungkapan ini memberikan gambaran mengenai meningkatnya peran AI dalam pengembangan AI tersebut.
Namun, angka 26% tetap harus dipahami dalam konteks metodologi Anthropic. Angka tersebut mengukur proporsi pekerjaan R&D dalam kerangka indeks perusahaan, bukan persentase keseluruhan kemampuan Claude atau tingkat kemandirian penuh model.
Anthropic juga menyatakan Claude belum sepenuhnya otonom dalam kategori R&D yang diukur. Karena itu, manusia masih terlibat dalam pengawasan meskipun AI telah mengambil peran lebih besar dalam proses penelitian dan pengembangan di perusahaan tersebut.