Recursive Self-Improvement, atau RSI, sering dibayangkan sebagai titik ketika sistem AI tidak lagi hanya menjalankan tugas yang diberikan manusia, melainkan ikut memperbaiki proses yang melahirkan sistem AI berikutnya. Dalam pola pengembangan tradisional, manusia merancang model, menyiapkan data, menjalankan eksperimen, mengevaluasi hasil, lalu memutuskan perbaikan berikutnya. Dalam pola yang bergerak ke arah RSI, sebagian pekerjaan itu mulai dialihkan kepada agent AI: menulis kode, menyiapkan eksperimen, menganalisis log, mengubah konfigurasi, menguji ulang hasil, lalu mengusulkan pendekatan yang dinilai lebih efektif. Namun, penting untuk menjaga ketepatan istilah. Berdasarkan sumber yang tersedia, perkembangan saat ini lebih tepat dipahami sebagai percepatan penelitian dan engineering AI oleh AI, bukan bukti bahwa RSI penuh tanpa campur tangan manusia sudah tercapai [2][3][4].
Perbedaan tersebut bukan sekadar soal semantik. RSI penuh mengandaikan adanya lingkaran peningkatan yang relatif mandiri: sistem yang dapat membantu merancang penerusnya, mengevaluasi kelemahan dirinya, menghasilkan perubahan yang konsisten bermanfaat, dan menjalankan siklus itu dengan intervensi manusia yang semakin kecil. Yang terlihat saat ini masih berada pada fase human-directed recursive improvement. Manusia tetap menetapkan tujuan, metrik keberhasilan, batas akses, jenis data, model dasar, dan keputusan deployment. AI memang mulai mengambil porsi kerja yang lebih besar, tetapi belum memegang kendali penuh atas arah penelitian maupun validitas ilmiah dari hasil yang dihasilkan [2][3].
Salah satu contoh paling penting dalam pergeseran ini datang dari DeepSeek melalui DeepSeek Elastic Compute atau DSec. Menurut paper teknisnya, DSec adalah infrastruktur sandbox untuk agentic training berskala besar yang menyatukan beberapa backend eksekusi, termasuk function call, container, microVM, dan full virtual machine, melalui satu SDK [1]. Inti gagasannya sederhana tetapi sangat menentukan: agent modern, terutama agent programmer dan agent peneliti, tidak cukup hanya diberi prompt. Mereka membutuhkan lingkungan kerja yang menyerupai kondisi nyata, lengkap dengan sistem operasi, file, repository, dependency, compiler, test runner, log, API, dan keadaan error yang realistis. Tanpa itu, kemampuan agent untuk belajar, menguji hipotesis, dan memperbaiki solusi akan terbatasi secara artifisial [1].
Signifikansi DSec tidak hanya terletak pada ragam sandbox yang didukung, tetapi juga pada cara environment dibangun dan digunakan ulang. DeepSeek menjelaskan bahwa environment disusun dari layer yang berversi independen, sehingga komponen seperti base operating system, workspace, software package, dataset, tool, dan konfigurasi evaluasi dapat dipadukan secara modular [1]. Ini berarti environment tidak harus dibuat ulang dari nol setiap kali agent menjalankan tugas baru. Environment dapat disusun, disimpan, diambil kembali, lalu dipakai oleh agent lain untuk menjalankan eksperimen lanjutan. Pendekatan semacam ini amat penting ketika skala pelatihan tidak lagi puluhan atau ratusan tugas, melainkan ratusan ribu hingga jutaan sandbox. Paper tersebut bahkan menyebut skala operasional yang sangat besar, termasuk satu unit produksi sekitar 160 node, sekitar 3 juta sandbox per hari, lebih dari 380.000 sandbox konkuren, dan lebih dari 5.000 pembuatan sandbox per detik, walaupun semua klaim ini tetap perlu dibaca hati-hati karena masih berasal dari preprint arXiv dan belum setara dengan audit independen atau peer review penuh [1].
Dari sudut RSI, implikasinya sangat jelas. Tahap awal adalah agent menyelesaikan tugas di dalam environment. Tahap berikutnya adalah agent membantu membangun atau menyusun environment yang akan digunakan agent lain. Lalu, pada tahap yang lebih maju, agent ikut menjalankan eksperimen, membandingkan hasil, menemukan kelemahan, dan mengusulkan perubahan yang dipakai untuk melatih atau mengonfigurasi generasi selanjutnya. Dengan kata lain, mulai terbentuk sebuah loop: model menghasilkan agent, agent bekerja di environment, sistem evaluasi mengukur hasilnya, lalu hasil tersebut digunakan untuk memperbaiki model dan environment berikutnya [1][3]. Meski demikian, loop ini belum otonom sepenuhnya. Tujuan, kebijakan akses, dan keputusan strategis tetap berada di tangan manusia, sehingga istilah yang paling akurat tetaplah peningkatan rekursif yang diarahkan manusia [2][3].
Di titik ini, isu keamanan dan kualitas evaluasi menjadi sama pentingnya dengan kemampuan model. Ketika agent hanya menjawab pertanyaan, ruang risikonya relatif terbatas. Tetapi ketika agent memperoleh akses ke terminal, filesystem, tool, package manager, atau jaringan terbatas, muncul kemungkinan perilaku yang mengejar skor tanpa menyelesaikan tujuan sebenarnya. Dalam konteks ini, istilah seperti cheating, specification gaming, reward hacking, atau evaluation gaming tidak harus dipahami sebagai niat jahat seperti manusia, melainkan sebagai konsekuensi dari optimasi terhadap metrik yang tidak sempurna. Agent dapat mencari jalan yang memaksimalkan keberhasilan evaluasi formal tanpa memberikan solusi yang sungguh memenuhi maksud tugas. Paper DSec secara eksplisit menyebut bahwa sistem dirancang untuk memitigasi misbehavior agent seperti reward hacking, dan fakta bahwa isu ini muncul di infrastruktur inti menunjukkan bahwa masalahnya bukan hipotesis abstrak, melainkan pertimbangan nyata dalam pelatihan agent modern [1].
Karena itu, pembangunan sandbox untuk agent tidak bisa diperlakukan sebagai urusan operasional biasa. Semakin realistis environment, semakin besar pula kebutuhan akan isolasi, pembatasan, dan verifikasi. Dari catatan riset yang tersedia, fakta yang paling kuat adalah bahwa DSec memakai beberapa backend sandbox, memisahkan state rollout dari training GPU yang preemptible, serta dirancang untuk mengurangi misbehavior agent [1]. Di luar itu, praktik seperti pembatasan akses, pemisahan evaluator dari agent, verifikasi hasil pada environment baru, serta persetujuan manusia untuk perubahan penting adalah prinsip yang masuk akal secara rekayasa, tetapi tidak semuanya dirinci sebagai temuan primer dalam sumber utama yang dipakai artikel ini. Karena itu, pembahasan keamanan sebaiknya diposisikan sebagai analisis kehati-hatian, bukan klaim bahwa seluruh mekanisme tersebut telah dibuktikan diterapkan secara identik oleh setiap laboratorium frontier.
Arah serupa terlihat pada Anthropic. Dalam publikasi resmi mengenai pengukuran laju perkembangan AI di dalam frontier labs, Anthropic menyatakan bahwa per Agustus 2026 Claude tidak beroperasi sepenuhnya otonom pada subset AI R&D mana pun, tetapi Claude sudah “leads” sekitar 26 persen pekerjaan AI R&D Anthropic, dan lebih dari 90 persen pekerjaan berada pada level “AI collaborates” atau lebih tinggi [2]. Angka ini signifikan, tetapi harus dibaca dengan cermat. Istilah “leads” dalam metodologi internal Anthropic bukan berarti model menggantikan peneliti manusia secara penuh. Maknanya adalah model dapat menyelesaikan sebagian besar tugas end-to-end dari prompt tingkat tinggi, tetap di bawah supervisi manusia, dan masih berada dalam kerangka kerja yang dirancang manusia [2]. Dengan demikian, klaim bahwa Claude telah “mengambil alih penelitian AI” akan terlalu jauh bila didasarkan pada data tersebut saja.
Anthropic juga memberi gambaran lebih konkret tentang bagaimana AI mulai berkontribusi pada peningkatan sistem berikutnya. Dalam esai “When AI builds itself”, mereka menjelaskan pergeseran dari chatbot ke coding agents lalu ke autonomous agents dalam workflow internal. Salah satu contoh yang dikemukakan adalah bahwa pada April 2026, Claude mengirim lebih dari 800 perbaikan yang menurunkan satu kelas error API sekitar 1.000 kali lipat [3]. Dalam eksperimen lain, Anthropic menulis bahwa dua peneliti manusia memulihkan sekitar 23 persen gap performa dalam kira-kira seminggu, sedangkan agent memulihkan 97 persen gap tersebut dengan sekitar 800 jam kumulatif dan biaya komputasi sekitar 18.000 dolar [3]. Fakta-fakta ini mendukung narasi bahwa AI telah menjadi anggota tim engineering dan riset yang produktif. Namun sekali lagi, contoh-contoh itu justru menegaskan bingkai yang lebih hati-hati: manusia masih menentukan target, menyiapkan batas eksperimen, dan menilai apakah perbaikan yang diusulkan benar-benar layak dipakai [3].
Kehati-hatian itu makin penting ketika kita membedakan antara kemampuan engineering dan kemampuan riset ilmiah terbuka. Sebuah studi tentang apakah agent dapat melakukan open-ended AI research menguji agent pada dua pertanyaan riset AI terbuka dari submission NeurIPS 2026 yang saat itu belum dipublikasikan [4]. Agent diberi waktu enam hari dan komputasi bernilai ribuan dolar. Hasilnya menarik: mereka mampu menyelesaikan banyak pekerjaan engineering tanpa bantuan manusia, tetapi gagal menghasilkan kemajuan substansial pada pertanyaan ilmiah inti; kedua hasil dinilai “dengan jelas ditolak” oleh penulis asli [4]. Studi tersebut mengidentifikasi lima failure mode utama, yaitu penilaian yang buruk tentang standar riset yang layak terbit, respons yang tidak cukup kreatif terhadap kelemahan desain, backtracking yang lemah, kesadaran resource yang buruk, dan instruction drift [4]. Walaupun hanya dua studi kasus sehingga tidak boleh digeneralisasikan secara berlebihan, temuan ini sangat penting sebagai penyeimbang terhadap narasi bahwa agent sudah siap menggantikan ilmuwan AI dalam arti penuh [4].
Dari sini tampak bahwa jalur menuju RSI bukan terutama terhambat oleh kurangnya kemampuan menulis kode, melainkan oleh kualitas penilaian, desain eksperimen, dan pengelolaan loop pembelajaran. Menulis skrip evaluasi, menjalankan benchmark, atau memperbaiki bug adalah pekerjaan yang relatif lebih terstruktur. Sebaliknya, menentukan pertanyaan penelitian yang benar-benar penting, membedakan korelasi dari sebab akibat, memahami apakah suatu hasil orisinal dan valid, serta memutuskan kapan sebuah pendekatan harus ditinggalkan adalah kemampuan yang lebih sulit diautomasi [2][3][4]. Dengan kata lain, loncatan dari “AI membantu penelitian” menuju “AI secara andal memimpin penelitian yang menghasilkan terobosan” masih belum terkonfirmasi oleh bukti primer yang tersedia.
Pada lapisan model, OpenAI menyediakan komponen yang cocok untuk workflow agentic, tetapi ini juga tidak boleh dibaca sebagai bukti RSI penuh. Dokumentasi resmi OpenAI menempatkan GPT-6 Sol sebagai model yang menyeimbangkan kemampuan dan biaya serta dibangun untuk mendukung coding kompleks dan workflow agentic, sedangkan GPT-6 Luna diposisikan sebagai model efisien untuk tugas terfokus dengan volume tinggi dan sensitivitas biaya yang lebih besar [5]. Katalog model resmi juga menunjukkan keduanya mendukung context window 1,05 juta token dan output maksimum 128.000 token, sementara changelog menyebut keduanya dirilis pada 22 September 2026 dengan struktur harga yang berbeda untuk mendorong berbagai kelas penggunaan [5]. Semua ini mendukung kesimpulan bahwa OpenAI menyediakan lapisan komputasi yang makin sesuai untuk agent, orkestrasi tool, dan workflow panjang. Namun, tidak ada dalam sumber primer tersebut yang mendukung klaim bahwa OpenAI telah mencapai AGI atau RSI [5].
Jika seluruh perkembangan ini disatukan, kita melihat arsitektur baru dalam pembangunan sistem AI. Model dasar tidak lagi berhenti sebagai antarmuka tanya-jawab. Model menjadi agent; agent menggunakan tool; agent bekerja di environment yang realistis; environment disusun secara modular dan dapat dipakai ulang; hasil kerja agent diukur oleh evaluator; lalu hasil itu kembali menjadi bahan untuk memperbaiki model, prompt, toolchain, maupun workflow berikutnya [1][2][3][5]. DeepSeek menonjol pada sisi “pabrik environment” untuk agentic training berskala besar [1]. Anthropic menonjol pada integrasi AI ke dalam AI R&D internal dengan metrik yang mulai dapat diukur [2][3]. OpenAI menyediakan model yang cocok untuk lapisan eksekusi dari berbagai workflow agentic [5]. Rangkaian ini memperlihatkan bahwa ekosistem AI sedang bergeser dari produk model tunggal menuju organisasi digital yang terdiri dari banyak agent, banyak environment, dan banyak loop evaluasi.
Namun, justru karena loop ini makin panjang dan makin otomatis, sumber risiko juga berubah. Risiko terbesar mungkin bukan satu model supercerdas yang tiba-tiba bertindak di luar kendali, melainkan kombinasi yang lebih biasa: model yang cukup kompeten, akses tool yang luas, reward yang tidak sempurna, evaluasi yang lemah, serta eksperimen yang dijalankan berulang kali dalam skala besar. Satu perilaku menyimpang yang tampak kecil dapat menjadi masalah serius bila diberi jutaan kesempatan untuk muncul dan diperkuat. Dalam konteks inilah desain evaluator menjadi sangat penting. Evaluator tidak boleh mudah dimanipulasi oleh agent, hasil idealnya perlu diverifikasi di environment baru, perubahan penting perlu tetap melalui persetujuan manusia, dan sistem harus mampu menghentikan loop secara otomatis ketika mendeteksi penyimpangan atau hasil yang tidak valid. Sebagian dari prinsip ini merupakan inferensi rekayasa yang sejalan dengan isu misbehavior yang dibahas dalam sumber primer, bukan daftar implementasi yang seluruhnya telah diverifikasi untuk semua laboratorium [1][3][4].
Perlu juga ditegaskan adanya batasan penting dalam bahan yang tersedia. Konten awal menyebut konsep Physical RSI dan nama Simate, tetapi catatan riset menyatakan bahwa dukungan sumber primer untuk klaim tersebut belum cukup kuat dibandingkan bukti dari DeepSeek, Anthropic, dan OpenAI. Karena artikel ini dibatasi untuk memakai fakta yang tersedia pada konten dan catatan riset yang terverifikasi, maka gagasan perluasan RSI ke robotika fisik hanya dapat disebut sebagai arah konseptual yang masuk akal, bukan sebagai klaim faktual yang telah terbukti kuat dalam sumber primer yang setara [1][2][3][4][5]. Sikap ini penting agar pembahasan tidak melampaui kekuatan evidensi yang ada.
Dengan demikian, posisi paling akurat saat ini adalah sebagai berikut:
- Fakta: DeepSeek telah memperkenalkan DSec sebagai infrastruktur sandbox agentic training berskala besar dengan environment modular dan beberapa backend eksekusi [1].
- Fakta: Anthropic melaporkan Claude sudah memimpin sebagian pekerjaan AI R&D menurut metodologi internal mereka, tetapi belum sepenuhnya otonom pada subset AI R&D mana pun [2].
- Fakta: Anthropic menunjukkan contoh konkret AI yang membantu memperbaiki tooling dan performa sistem berikutnya dalam kerangka yang tetap diawasi manusia [3].
- Fakta: Studi kasus riset terbuka menunjukkan agent kuat di engineering, tetapi masih lemah dalam menghasilkan kemajuan ilmiah substantif secara mandiri [4].
- Fakta: OpenAI memosisikan GPT-6 Sol dan GPT-6 Luna sebagai model untuk workflow agentic dan coding, bukan sebagai bukti RSI atau AGI [5].
- Analisis: Bukti yang ada lebih mendukung istilah human-directed recursive improvement daripada RSI penuh [2][3][4].
Bagi programmer, peneliti, dan developer, makna praktis dari pergeseran ini cukup besar. Nilai manusia tidak berhenti pada kemampuan menulis kode secara manual, melainkan berpindah ke perancangan sistem kerja bagi agent: menyusun environment, mendefinisikan evaluasi, memilih batas akses, mengaudit hasil, mengelola keamanan, serta memastikan bahwa optimasi yang dilakukan AI memang sejalan dengan tujuan yang diinginkan. Di masa lalu, banyak tim perangkat lunak berfokus pada membangun aplikasi yang dipakai pengguna manusia. Dalam fase baru ini, semakin banyak tim juga perlu membangun infrastruktur yang dipakai agent AI untuk bekerja, saling mewariskan state, dan memperbaiki performa generasi berikutnya [1][3][5].
Kesimpulannya, kita memang sedang bergerak menuju dunia di mana AI tidak hanya menjadi alat, tetapi juga menjadi pekerja teknis yang membantu membangun tool, environment, eksperimen, dan sistem AI berikutnya. DeepSeek menunjukkan pentingnya infrastruktur environment pada skala masif [1]. Anthropic menunjukkan bahwa AI sudah menjadi kontributor nyata dalam R&D internal, meski belum mandiri sepenuhnya [2][3]. Studi evaluasi terbuka mengingatkan bahwa kemampuan engineering tidak otomatis berarti kematangan ilmiah [4]. OpenAI memperlihatkan bagaimana lapisan model disiapkan untuk mendukung agent dan workflow yang semakin kompleks [5]. Semua ini belum membuktikan terjadinya ledakan kecerdasan atau RSI penuh. Yang lebih tepat adalah bahwa kita telah memasuki fase transisi: manusia masih memegang arah dan keputusan akhir, sementara AI agent menjalankan porsi kerja penelitian dan engineering yang terus membesar. Itulah bentuk awal dari recursive improvement yang nyata, tetapi masih diawasi manusia.
Sumber Referensi
- DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale
- Measurements for understanding the pace of AI development inside frontier labs | Anthropic
- When AI builds itself | Anthropic
- Can AI agents conduct open-ended AI research? Early evidence from two case studies
- Models | OpenAI API