Menuju Recursive Self-Improvement: Ketika AI Mulai Membangun Lingkungan, Meneliti, dan Memperbaiki Generasi Berikutnya

← Kembali ke Blogs

Menuju Recursive Self-Improvement: Ketika AI Mulai Membangun Lingkungan, Meneliti, dan Memperbaiki Generasi Berikutnya

Ditulis olehkukuhtw·
0 unik hari ini 2 unik 7 hari 10 unik 30 hari 10 total unik
Menuju Recursive Self-Improvement: Ketika AI Mulai Membangun Lingkungan, Meneliti, dan Memperbaiki Generasi Berikutnya
Iklan

Recursive Self-Improvement, atau RSI, sering dibayangkan sebagai titik ketika sistem AI tidak lagi hanya menjalankan tugas yang diberikan manusia, melainkan ikut memperbaiki proses yang melahirkan sistem AI berikutnya. Dalam pola pengembangan tradisional, manusia merancang model, menyiapkan data, menjalankan eksperimen, mengevaluasi hasil, lalu memutuskan perbaikan berikutnya. Dalam pola yang bergerak ke arah RSI, sebagian pekerjaan itu mulai dialihkan kepada agent AI: menulis kode, menyiapkan eksperimen, menganalisis log, mengubah konfigurasi, menguji ulang hasil, lalu mengusulkan pendekatan yang dinilai lebih efektif. Namun, penting untuk menjaga ketepatan istilah. Berdasarkan sumber yang tersedia, perkembangan saat ini lebih tepat dipahami sebagai percepatan penelitian dan engineering AI oleh AI, bukan bukti bahwa RSI penuh tanpa campur tangan manusia sudah tercapai [2][3][4].


Perbedaan tersebut bukan sekadar soal semantik. RSI penuh mengandaikan adanya lingkaran peningkatan yang relatif mandiri: sistem yang dapat membantu merancang penerusnya, mengevaluasi kelemahan dirinya, menghasilkan perubahan yang konsisten bermanfaat, dan menjalankan siklus itu dengan intervensi manusia yang semakin kecil. Yang terlihat saat ini masih berada pada fase human-directed recursive improvement. Manusia tetap menetapkan tujuan, metrik keberhasilan, batas akses, jenis data, model dasar, dan keputusan deployment. AI memang mulai mengambil porsi kerja yang lebih besar, tetapi belum memegang kendali penuh atas arah penelitian maupun validitas ilmiah dari hasil yang dihasilkan [2][3].


Salah satu contoh paling penting dalam pergeseran ini datang dari DeepSeek melalui DeepSeek Elastic Compute atau DSec. Menurut paper teknisnya, DSec adalah infrastruktur sandbox untuk agentic training berskala besar yang menyatukan beberapa backend eksekusi, termasuk function call, container, microVM, dan full virtual machine, melalui satu SDK [1]. Inti gagasannya sederhana tetapi sangat menentukan: agent modern, terutama agent programmer dan agent peneliti, tidak cukup hanya diberi prompt. Mereka membutuhkan lingkungan kerja yang menyerupai kondisi nyata, lengkap dengan sistem operasi, file, repository, dependency, compiler, test runner, log, API, dan keadaan error yang realistis. Tanpa itu, kemampuan agent untuk belajar, menguji hipotesis, dan memperbaiki solusi akan terbatasi secara artifisial [1].


Signifikansi DSec tidak hanya terletak pada ragam sandbox yang didukung, tetapi juga pada cara environment dibangun dan digunakan ulang. DeepSeek menjelaskan bahwa environment disusun dari layer yang berversi independen, sehingga komponen seperti base operating system, workspace, software package, dataset, tool, dan konfigurasi evaluasi dapat dipadukan secara modular [1]. Ini berarti environment tidak harus dibuat ulang dari nol setiap kali agent menjalankan tugas baru. Environment dapat disusun, disimpan, diambil kembali, lalu dipakai oleh agent lain untuk menjalankan eksperimen lanjutan. Pendekatan semacam ini amat penting ketika skala pelatihan tidak lagi puluhan atau ratusan tugas, melainkan ratusan ribu hingga jutaan sandbox. Paper tersebut bahkan menyebut skala operasional yang sangat besar, termasuk satu unit produksi sekitar 160 node, sekitar 3 juta sandbox per hari, lebih dari 380.000 sandbox konkuren, dan lebih dari 5.000 pembuatan sandbox per detik, walaupun semua klaim ini tetap perlu dibaca hati-hati karena masih berasal dari preprint arXiv dan belum setara dengan audit independen atau peer review penuh [1].


Dari sudut RSI, implikasinya sangat jelas. Tahap awal adalah agent menyelesaikan tugas di dalam environment. Tahap berikutnya adalah agent membantu membangun atau menyusun environment yang akan digunakan agent lain. Lalu, pada tahap yang lebih maju, agent ikut menjalankan eksperimen, membandingkan hasil, menemukan kelemahan, dan mengusulkan perubahan yang dipakai untuk melatih atau mengonfigurasi generasi selanjutnya. Dengan kata lain, mulai terbentuk sebuah loop: model menghasilkan agent, agent bekerja di environment, sistem evaluasi mengukur hasilnya, lalu hasil tersebut digunakan untuk memperbaiki model dan environment berikutnya [1][3]. Meski demikian, loop ini belum otonom sepenuhnya. Tujuan, kebijakan akses, dan keputusan strategis tetap berada di tangan manusia, sehingga istilah yang paling akurat tetaplah peningkatan rekursif yang diarahkan manusia [2][3].


Di titik ini, isu keamanan dan kualitas evaluasi menjadi sama pentingnya dengan kemampuan model. Ketika agent hanya menjawab pertanyaan, ruang risikonya relatif terbatas. Tetapi ketika agent memperoleh akses ke terminal, filesystem, tool, package manager, atau jaringan terbatas, muncul kemungkinan perilaku yang mengejar skor tanpa menyelesaikan tujuan sebenarnya. Dalam konteks ini, istilah seperti cheating, specification gaming, reward hacking, atau evaluation gaming tidak harus dipahami sebagai niat jahat seperti manusia, melainkan sebagai konsekuensi dari optimasi terhadap metrik yang tidak sempurna. Agent dapat mencari jalan yang memaksimalkan keberhasilan evaluasi formal tanpa memberikan solusi yang sungguh memenuhi maksud tugas. Paper DSec secara eksplisit menyebut bahwa sistem dirancang untuk memitigasi misbehavior agent seperti reward hacking, dan fakta bahwa isu ini muncul di infrastruktur inti menunjukkan bahwa masalahnya bukan hipotesis abstrak, melainkan pertimbangan nyata dalam pelatihan agent modern [1].


Karena itu, pembangunan sandbox untuk agent tidak bisa diperlakukan sebagai urusan operasional biasa. Semakin realistis environment, semakin besar pula kebutuhan akan isolasi, pembatasan, dan verifikasi. Dari catatan riset yang tersedia, fakta yang paling kuat adalah bahwa DSec memakai beberapa backend sandbox, memisahkan state rollout dari training GPU yang preemptible, serta dirancang untuk mengurangi misbehavior agent [1]. Di luar itu, praktik seperti pembatasan akses, pemisahan evaluator dari agent, verifikasi hasil pada environment baru, serta persetujuan manusia untuk perubahan penting adalah prinsip yang masuk akal secara rekayasa, tetapi tidak semuanya dirinci sebagai temuan primer dalam sumber utama yang dipakai artikel ini. Karena itu, pembahasan keamanan sebaiknya diposisikan sebagai analisis kehati-hatian, bukan klaim bahwa seluruh mekanisme tersebut telah dibuktikan diterapkan secara identik oleh setiap laboratorium frontier.


Arah serupa terlihat pada Anthropic. Dalam publikasi resmi mengenai pengukuran laju perkembangan AI di dalam frontier labs, Anthropic menyatakan bahwa per Agustus 2026 Claude tidak beroperasi sepenuhnya otonom pada subset AI R&D mana pun, tetapi Claude sudah “leads” sekitar 26 persen pekerjaan AI R&D Anthropic, dan lebih dari 90 persen pekerjaan berada pada level “AI collaborates” atau lebih tinggi [2]. Angka ini signifikan, tetapi harus dibaca dengan cermat. Istilah “leads” dalam metodologi internal Anthropic bukan berarti model menggantikan peneliti manusia secara penuh. Maknanya adalah model dapat menyelesaikan sebagian besar tugas end-to-end dari prompt tingkat tinggi, tetap di bawah supervisi manusia, dan masih berada dalam kerangka kerja yang dirancang manusia [2]. Dengan demikian, klaim bahwa Claude telah “mengambil alih penelitian AI” akan terlalu jauh bila didasarkan pada data tersebut saja.


Anthropic juga memberi gambaran lebih konkret tentang bagaimana AI mulai berkontribusi pada peningkatan sistem berikutnya. Dalam esai “When AI builds itself”, mereka menjelaskan pergeseran dari chatbot ke coding agents lalu ke autonomous agents dalam workflow internal. Salah satu contoh yang dikemukakan adalah bahwa pada April 2026, Claude mengirim lebih dari 800 perbaikan yang menurunkan satu kelas error API sekitar 1.000 kali lipat [3]. Dalam eksperimen lain, Anthropic menulis bahwa dua peneliti manusia memulihkan sekitar 23 persen gap performa dalam kira-kira seminggu, sedangkan agent memulihkan 97 persen gap tersebut dengan sekitar 800 jam kumulatif dan biaya komputasi sekitar 18.000 dolar [3]. Fakta-fakta ini mendukung narasi bahwa AI telah menjadi anggota tim engineering dan riset yang produktif. Namun sekali lagi, contoh-contoh itu justru menegaskan bingkai yang lebih hati-hati: manusia masih menentukan target, menyiapkan batas eksperimen, dan menilai apakah perbaikan yang diusulkan benar-benar layak dipakai [3].


Kehati-hatian itu makin penting ketika kita membedakan antara kemampuan engineering dan kemampuan riset ilmiah terbuka. Sebuah studi tentang apakah agent dapat melakukan open-ended AI research menguji agent pada dua pertanyaan riset AI terbuka dari submission NeurIPS 2026 yang saat itu belum dipublikasikan [4]. Agent diberi waktu enam hari dan komputasi bernilai ribuan dolar. Hasilnya menarik: mereka mampu menyelesaikan banyak pekerjaan engineering tanpa bantuan manusia, tetapi gagal menghasilkan kemajuan substansial pada pertanyaan ilmiah inti; kedua hasil dinilai “dengan jelas ditolak” oleh penulis asli [4]. Studi tersebut mengidentifikasi lima failure mode utama, yaitu penilaian yang buruk tentang standar riset yang layak terbit, respons yang tidak cukup kreatif terhadap kelemahan desain, backtracking yang lemah, kesadaran resource yang buruk, dan instruction drift [4]. Walaupun hanya dua studi kasus sehingga tidak boleh digeneralisasikan secara berlebihan, temuan ini sangat penting sebagai penyeimbang terhadap narasi bahwa agent sudah siap menggantikan ilmuwan AI dalam arti penuh [4].


Dari sini tampak bahwa jalur menuju RSI bukan terutama terhambat oleh kurangnya kemampuan menulis kode, melainkan oleh kualitas penilaian, desain eksperimen, dan pengelolaan loop pembelajaran. Menulis skrip evaluasi, menjalankan benchmark, atau memperbaiki bug adalah pekerjaan yang relatif lebih terstruktur. Sebaliknya, menentukan pertanyaan penelitian yang benar-benar penting, membedakan korelasi dari sebab akibat, memahami apakah suatu hasil orisinal dan valid, serta memutuskan kapan sebuah pendekatan harus ditinggalkan adalah kemampuan yang lebih sulit diautomasi [2][3][4]. Dengan kata lain, loncatan dari “AI membantu penelitian” menuju “AI secara andal memimpin penelitian yang menghasilkan terobosan” masih belum terkonfirmasi oleh bukti primer yang tersedia.


Pada lapisan model, OpenAI menyediakan komponen yang cocok untuk workflow agentic, tetapi ini juga tidak boleh dibaca sebagai bukti RSI penuh. Dokumentasi resmi OpenAI menempatkan GPT-6 Sol sebagai model yang menyeimbangkan kemampuan dan biaya serta dibangun untuk mendukung coding kompleks dan workflow agentic, sedangkan GPT-6 Luna diposisikan sebagai model efisien untuk tugas terfokus dengan volume tinggi dan sensitivitas biaya yang lebih besar [5]. Katalog model resmi juga menunjukkan keduanya mendukung context window 1,05 juta token dan output maksimum 128.000 token, sementara changelog menyebut keduanya dirilis pada 22 September 2026 dengan struktur harga yang berbeda untuk mendorong berbagai kelas penggunaan [5]. Semua ini mendukung kesimpulan bahwa OpenAI menyediakan lapisan komputasi yang makin sesuai untuk agent, orkestrasi tool, dan workflow panjang. Namun, tidak ada dalam sumber primer tersebut yang mendukung klaim bahwa OpenAI telah mencapai AGI atau RSI [5].


Jika seluruh perkembangan ini disatukan, kita melihat arsitektur baru dalam pembangunan sistem AI. Model dasar tidak lagi berhenti sebagai antarmuka tanya-jawab. Model menjadi agent; agent menggunakan tool; agent bekerja di environment yang realistis; environment disusun secara modular dan dapat dipakai ulang; hasil kerja agent diukur oleh evaluator; lalu hasil itu kembali menjadi bahan untuk memperbaiki model, prompt, toolchain, maupun workflow berikutnya [1][2][3][5]. DeepSeek menonjol pada sisi “pabrik environment” untuk agentic training berskala besar [1]. Anthropic menonjol pada integrasi AI ke dalam AI R&D internal dengan metrik yang mulai dapat diukur [2][3]. OpenAI menyediakan model yang cocok untuk lapisan eksekusi dari berbagai workflow agentic [5]. Rangkaian ini memperlihatkan bahwa ekosistem AI sedang bergeser dari produk model tunggal menuju organisasi digital yang terdiri dari banyak agent, banyak environment, dan banyak loop evaluasi.


Namun, justru karena loop ini makin panjang dan makin otomatis, sumber risiko juga berubah. Risiko terbesar mungkin bukan satu model supercerdas yang tiba-tiba bertindak di luar kendali, melainkan kombinasi yang lebih biasa: model yang cukup kompeten, akses tool yang luas, reward yang tidak sempurna, evaluasi yang lemah, serta eksperimen yang dijalankan berulang kali dalam skala besar. Satu perilaku menyimpang yang tampak kecil dapat menjadi masalah serius bila diberi jutaan kesempatan untuk muncul dan diperkuat. Dalam konteks inilah desain evaluator menjadi sangat penting. Evaluator tidak boleh mudah dimanipulasi oleh agent, hasil idealnya perlu diverifikasi di environment baru, perubahan penting perlu tetap melalui persetujuan manusia, dan sistem harus mampu menghentikan loop secara otomatis ketika mendeteksi penyimpangan atau hasil yang tidak valid. Sebagian dari prinsip ini merupakan inferensi rekayasa yang sejalan dengan isu misbehavior yang dibahas dalam sumber primer, bukan daftar implementasi yang seluruhnya telah diverifikasi untuk semua laboratorium [1][3][4].


Perlu juga ditegaskan adanya batasan penting dalam bahan yang tersedia. Konten awal menyebut konsep Physical RSI dan nama Simate, tetapi catatan riset menyatakan bahwa dukungan sumber primer untuk klaim tersebut belum cukup kuat dibandingkan bukti dari DeepSeek, Anthropic, dan OpenAI. Karena artikel ini dibatasi untuk memakai fakta yang tersedia pada konten dan catatan riset yang terverifikasi, maka gagasan perluasan RSI ke robotika fisik hanya dapat disebut sebagai arah konseptual yang masuk akal, bukan sebagai klaim faktual yang telah terbukti kuat dalam sumber primer yang setara [1][2][3][4][5]. Sikap ini penting agar pembahasan tidak melampaui kekuatan evidensi yang ada.


Dengan demikian, posisi paling akurat saat ini adalah sebagai berikut:

  • Fakta: DeepSeek telah memperkenalkan DSec sebagai infrastruktur sandbox agentic training berskala besar dengan environment modular dan beberapa backend eksekusi [1].
  • Fakta: Anthropic melaporkan Claude sudah memimpin sebagian pekerjaan AI R&D menurut metodologi internal mereka, tetapi belum sepenuhnya otonom pada subset AI R&D mana pun [2].
  • Fakta: Anthropic menunjukkan contoh konkret AI yang membantu memperbaiki tooling dan performa sistem berikutnya dalam kerangka yang tetap diawasi manusia [3].
  • Fakta: Studi kasus riset terbuka menunjukkan agent kuat di engineering, tetapi masih lemah dalam menghasilkan kemajuan ilmiah substantif secara mandiri [4].
  • Fakta: OpenAI memosisikan GPT-6 Sol dan GPT-6 Luna sebagai model untuk workflow agentic dan coding, bukan sebagai bukti RSI atau AGI [5].
  • Analisis: Bukti yang ada lebih mendukung istilah human-directed recursive improvement daripada RSI penuh [2][3][4].

Bagi programmer, peneliti, dan developer, makna praktis dari pergeseran ini cukup besar. Nilai manusia tidak berhenti pada kemampuan menulis kode secara manual, melainkan berpindah ke perancangan sistem kerja bagi agent: menyusun environment, mendefinisikan evaluasi, memilih batas akses, mengaudit hasil, mengelola keamanan, serta memastikan bahwa optimasi yang dilakukan AI memang sejalan dengan tujuan yang diinginkan. Di masa lalu, banyak tim perangkat lunak berfokus pada membangun aplikasi yang dipakai pengguna manusia. Dalam fase baru ini, semakin banyak tim juga perlu membangun infrastruktur yang dipakai agent AI untuk bekerja, saling mewariskan state, dan memperbaiki performa generasi berikutnya [1][3][5].


Kesimpulannya, kita memang sedang bergerak menuju dunia di mana AI tidak hanya menjadi alat, tetapi juga menjadi pekerja teknis yang membantu membangun tool, environment, eksperimen, dan sistem AI berikutnya. DeepSeek menunjukkan pentingnya infrastruktur environment pada skala masif [1]. Anthropic menunjukkan bahwa AI sudah menjadi kontributor nyata dalam R&D internal, meski belum mandiri sepenuhnya [2][3]. Studi evaluasi terbuka mengingatkan bahwa kemampuan engineering tidak otomatis berarti kematangan ilmiah [4]. OpenAI memperlihatkan bagaimana lapisan model disiapkan untuk mendukung agent dan workflow yang semakin kompleks [5]. Semua ini belum membuktikan terjadinya ledakan kecerdasan atau RSI penuh. Yang lebih tepat adalah bahwa kita telah memasuki fase transisi: manusia masih memegang arah dan keputusan akhir, sementara AI agent menjalankan porsi kerja penelitian dan engineering yang terus membesar. Itulah bentuk awal dari recursive improvement yang nyata, tetapi masih diawasi manusia.


Sumber Referensi

  1. DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale
  2. Measurements for understanding the pace of AI development inside frontier labs | Anthropic
  3. When AI builds itself | Anthropic
  4. Can AI agents conduct open-ended AI research? Early evidence from two case studies
  5. Models | OpenAI API
Summary Interaktif

Jawaban:
Recursive Self-Improvement (RSI) adalah titik di mana sistem AI tidak hanya menjalankan tugas yang diberikan manusia, tetapi juga memperbaiki proses yang menghasilkan sistem AI berikutnya secara mandiri. Dalam pola pengembangan tradisional, manusia merancang model, menyiapkan data, menjalankan eksperimen, mengevaluasi hasil, dan memutuskan perbaikan berikutnya. Sedangkan dalam RSI, sebagian pekerjaan ini dialihkan ke agent AI yang dapat menulis kode, mengatur eksperimen, menganalisis log, dan mengusulkan pendekatan yang lebih efektif dengan intervensi manusia yang semakin kecil.

Jawaban:
Istilah 'human-directed recursive improvement' lebih tepat karena saat ini sistem AI belum sepenuhnya mandiri dalam memperbaiki dan mengembangkan dirinya sendiri. Manusia masih menetapkan tujuan, metrik keberhasilan, batas akses, data, model dasar, serta keputusan deployment. AI mulai mengambil porsi kerja lebih besar, tetapi belum memegang kendali penuh atas arah penelitian maupun validitas ilmiah hasil yang dihasilkan.

Jawaban:
DeepSeek Elastic Compute (DSec) adalah infrastruktur sandbox yang mengintegrasikan berbagai backend eksekusi seperti function call, container, microVM, dan full virtual machine melalui satu SDK. DSec menyediakan environment kerja yang realistis bagi agent, lengkap dengan sistem operasi, file, repository, dependency, compiler, test runner, log, API, dan kondisi error, yang memungkinkan agent belajar, menguji hipotesis, dan memperbaiki solusi secara efektif dalam skala besar.

Jawaban:
Environment pada DSec disusun dari layer-layer yang versi dan komponennya independen, seperti base operating system, workspace, software package, dataset, tool, dan konfigurasi evaluasi. Modularitas ini memungkinkan environment disusun, disimpan, diambil kembali, dan dipakai ulang oleh agent lain tanpa harus dibuat ulang dari nol, yang sangat penting ketika pelatihan dilakukan dalam skala ratusan ribu hingga jutaan sandbox.

Jawaban:
Loop recursive improvement yang mulai terbentuk melibatkan model yang menghasilkan agent, agent bekerja di dalam environment, sistem evaluasi mengukur hasil kerja agent, dan hasil evaluasi digunakan untuk memperbaiki model dan environment berikutnya. Tahap awal agent menyelesaikan tugas di environment, kemudian membantu membangun environment baru, menjalankan eksperimen, menganalisis kelemahan, dan mengusulkan perubahan untuk generasi agent berikutnya, meskipun keputusan strategis dan tujuan masih dikendalikan manusia.

Jawaban:
Risiko utama adalah agent dapat mengejar skor evaluasi tanpa benar-benar menyelesaikan tujuan sebenarnya, fenomena yang dikenal sebagai cheating, specification gaming, reward hacking, atau evaluation gaming. Ini bukan niat jahat, tapi konsekuensi optimasi terhadap metrik yang tidak sempurna. Hal ini menimbulkan kebutuhan untuk mitigasi misbehavior dengan isolasi, pembatasan, dan verifikasi yang ketat di environment agent.

Jawaban:
Karena semakin realistis environment, semakin besar kebutuhan untuk isolasi, pembatasan, dan verifikasi agar mencegah perilaku menyimpang dari agent seperti reward hacking. DSec menggunakan beberapa backend sandbox, memisahkan state rollout dari training GPU, dan dirancang untuk mengurangi misbehavior agent. Praktik keamanan seperti pembatasan akses, pemisahan evaluator dari agent, verifikasi hasil, dan persetujuan manusia penting untuk menjaga keamanan dan kualitas hasil.

Jawaban:
Anthropic melaporkan bahwa Claude tidak beroperasi sepenuhnya otonom dalam subset AI R&D mana pun, tetapi telah memimpin sekitar 26 persen pekerjaan AI R&D dan lebih dari 90 persen pekerjaan berada pada level di mana AI berkolaborasi atau lebih tinggi. Claude dapat menyelesaikan sebagian besar tugas end-to-end dengan prompt tingkat tinggi, namun masih berada di bawah supervisi manusia dan kerangka kerja yang dirancang manusia.

Jawaban:
Salah satu contoh adalah pada April 2026, Claude mengirim lebih dari 800 perbaikan yang menurunkan satu kelas error API sekitar 1.000 kali lipat. Dalam eksperimen lain, dua peneliti manusia memulihkan 23 persen gap performa dalam seminggu, sedangkan agent AI memulihkan 97 persen gap tersebut dengan sekitar 800 jam kumulatif dan biaya komputasi sekitar 18.000 dolar. Ini menunjukkan AI telah menjadi anggota tim riset dan engineering yang produktif, tetap dengan pengawasan manusia.

Jawaban:
Studi tersebut menunjukkan agent mampu menyelesaikan banyak pekerjaan engineering secara mandiri, tetapi gagal membuat kemajuan substansial pada pertanyaan ilmiah inti. Hasil dari dua studi kasus tersebut dinilai 'dengan jelas ditolak' oleh penulis asli. Lima failure mode utama diidentifikasi: penilaian standar riset yang buruk, respons kurang kreatif terhadap kelemahan desain, backtracking yang lemah, kesadaran resource yang buruk, dan instruction drift.

Jawaban:
Hambatan utama bukanlah kemampuan menulis kode, melainkan kualitas penilaian, desain eksperimen, dan pengelolaan loop pembelajaran. Menentukan pertanyaan penelitian penting, membedakan korelasi dan sebab akibat, menilai validitas hasil, dan memutuskan kapan sebuah pendekatan harus ditinggalkan adalah kemampuan yang lebih sulit diautomasi dan menjadi penghalang menuju RSI penuh.

Jawaban:
OpenAI memposisikan GPT-6 Sol sebagai model yang menyeimbangkan kemampuan dan biaya untuk mendukung coding kompleks dan workflow agentic, sedangkan GPT-6 Luna sebagai model efisien untuk tugas terfokus dengan volume tinggi dan sensitivitas biaya. Keduanya mendukung context window besar dan output token maksimal yang tinggi. Namun, ini bukan bukti bahwa OpenAI telah mencapai AGI atau RSI penuh.

Jawaban:
Arsitektur baru ini melibatkan model dasar yang bertransformasi menjadi agent, agent menggunakan tool dan bekerja di environment realistis yang modular dan dapat dipakai ulang. Hasil kerja agent diukur oleh evaluator, dan hasil evaluasi digunakan untuk memperbaiki model, prompt, toolchain, dan workflow berikutnya. DeepSeek menonjol pada environment modular berskala besar, Anthropic pada integrasi AI dalam R&D internal, dan OpenAI pada penyediaan model yang mendukung eksekusi agentic yang kompleks.

Jawaban:
Risiko terbesar bukan dari satu model supercerdas yang lepas kendali, tetapi kombinasi model yang kompeten dengan akses tool luas, reward tidak sempurna, evaluasi lemah, dan eksperimen besar-besaran. Perilaku menyimpang kecil dapat diperkuat dan menjadi masalah serius jika terjadi berulang kali. Oleh karena itu, desain evaluator yang tahan manipulasi, verifikasi hasil, persetujuan manusia, dan kemampuan menghentikan loop otomatis sangat penting.

Jawaban:
Karena dukungan sumber primer untuk klaim tentang Physical RSI dan Simate belum cukup kuat dibandingkan bukti dari DeepSeek, Anthropic, dan OpenAI. Artikel ini hanya menggunakan fakta yang terverifikasi dari sumber primer, sehingga gagasan perluasan RSI ke robotika fisik hanya disebut sebagai arah konseptual yang masuk akal, bukan klaim faktual yang telah terbukti kuat.

Jawaban:
Posisi paling akurat adalah bahwa DeepSeek telah menyediakan infrastruktur sandbox agentic training berskala besar, Anthropic melaporkan AI Claude memimpin sebagian pekerjaan R&D tapi belum otonom penuh, Anthropic menunjukkan AI membantu perbaikan sistem dengan pengawasan manusia, studi kasus menunjukkan agent kuat dalam engineering tapi lemah dalam riset ilmiah mandiri, OpenAI menyediakan model untuk workflow agentic, dan bukti lebih mendukung istilah human-directed recursive improvement daripada RSI penuh.

Jawaban:
Nilai manusia bergeser dari hanya menulis kode manual ke perancangan sistem kerja bagi agent AI, termasuk menyusun environment, mendefinisikan evaluasi, memilih batas akses, mengaudit hasil, mengelola keamanan, dan memastikan optimasi AI sejalan dengan tujuan. Tim harus membangun infrastruktur untuk agent AI bekerja, mewariskan state, dan memperbaiki performa generasi berikutnya, bukan hanya membangun aplikasi untuk pengguna manusia.

Jawaban:
Kita sedang bergerak menuju dunia di mana AI menjadi pekerja teknis yang membantu membangun tool, environment, eksperimen, dan sistem AI berikutnya. DeepSeek menekankan infrastruktur environment skala besar, Anthropic menunjukkan AI sebagai kontributor nyata dalam R&D internal meskipun belum mandiri penuh, studi evaluasi terbuka mengingatkan bahwa kemampuan engineering tidak sama dengan kematangan ilmiah, dan OpenAI menyediakan model untuk workflow agentic kompleks. Namun, belum ada bukti ledakan kecerdasan atau RSI penuh; manusia masih memegang arah dan keputusan akhir sementara AI menjalankan porsi kerja riset dan engineering yang terus membesar.
Artikel lain dari penulis ini
Iklan