Prompt Engineer Tidak Cukup: Mengapa Harnessing Menentukan AI Agent yang Benar-Benar Bekerja

← Kembali ke Blogs

Prompt Engineer Tidak Cukup: Mengapa Harnessing Menentukan AI Agent yang Benar-Benar Bekerja

Ditulis olehkukuhtw·
1 unik hari ini 3 unik 7 hari 17 unik 30 hari 78 total unik
Prompt Engineer Tidak Cukup: Mengapa Harnessing Menentukan AI Agent yang Benar-Benar Bekerja
Iklan

Dalam banyak diskusi tentang adopsi AI, perhatian sering berhenti pada satu pertanyaan: model mana yang paling pintar? Perusahaan membandingkan GPT, Claude, Gemini, Llama, Qwen, dan model lain berdasarkan kemampuan menjawab, menulis, atau menganalisis. Namun, dalam praktik implementasi, kecerdasan model saja tidak otomatis menghasilkan sistem yang efektif. Dua tim dapat memakai model yang sama, tetapi memperoleh hasil yang sangat berbeda dari sisi kualitas, kecepatan, keamanan, dan konsistensi. Perbedaan itu sering bukan berasal dari model, melainkan dari sistem kerja yang dibangun di sekelilingnya.


Di sinilah konsep harnessing menjadi penting. Secara sederhana, LLM dapat dipahami sebagai otak, sedangkan harness adalah lingkungan kerja yang membuat otak itu mampu bekerja secara nyata. Harness mencakup instruksi, akses tool, konteks, memori, workflow, evaluasi, dan guardrails. Rumus ringkasnya adalah: AI Agent = LLM + Tools + Context + Memory + Workflow + Guardrails + Evaluation. Tanpa susunan itu, model hanya menghasilkan respons; dengan susunan itu, model dapat menjadi agent yang mampu menjalankan tugas bertahap dan terverifikasi.


Karena itu, kemampuan prompt engineering tetap penting, tetapi tidak cukup. Prompting membantu mengarahkan cara model berpikir: apa tujuan tugas, format jawaban, batasan, dan konteks minimum. Akan tetapi, pekerjaan nyata jarang selesai hanya dengan satu instruksi yang baik. Saat agent diminta memperbaiki bug, meninjau repository, menjalankan test, memeriksa dependency, membandingkan perubahan, lalu memperbaiki hasil jika gagal, kebutuhan utamanya bukan lagi sekadar prompt yang rapi, melainkan sistem yang memungkinkan seluruh langkah itu terjadi secara aman dan berulang.


Dengan kata lain, prompting mengatur apa yang diminta dari model, sedangkan harnessing mengatur bagaimana model bekerja. Pergeseran ini semakin jelas dalam tulisan OpenAI tentang harness engineering. OpenAI menjelaskan bahwa ketika agent mengambil porsi pekerjaan coding yang besar, tugas engineer bergeser dari menulis kode secara langsung menjadi merancang environment, menspesifikkan intent, dan membangun feedback loop agar agent bekerja konsisten [1]. Dalam eksperimen yang mereka paparkan, tim Codex bahkan menyebut produk internal dibangun dengan kode, testing, konfigurasi, dokumentasi, observability, dan tools internal yang ditulis oleh agent, sementara manusia memegang peran penentu tujuan dan perancang lingkungan kerjanya [1].


Fakta tersebut penting karena menunjukkan satu hal: model pintar belum tentu melahirkan sistem yang andal bila lingkungannya buruk. Bayangkan dua coding agent menggunakan LLM yang sama. Agent pertama hanya menerima instruksi, “Perbaiki bug pada aplikasi ini.” Agent kedua bekerja dengan repository terstruktur, dokumentasi arsitektur, file instruksi seperti AGENTS.md, akses terminal, perintah build, test runner, static analysis, aturan keamanan, dan mekanisme review. Secara analitis, sangat masuk akal bila agent kedua menghasilkan pekerjaan yang lebih konsisten dan lebih mudah diverifikasi. Bukan karena otaknya berbeda, tetapi karena lingkungan kerjanya lebih lengkap dan lebih jelas.


Landasan ilmiah untuk cara kerja seperti ini dapat dilihat pada riset ReAct. Penelitian tersebut menunjukkan pola agent modern yang tidak hanya menjawab, tetapi juga menjalankan siklus reasoning → action → observation → reasoning berikutnya [4]. Model tidak berhenti pada penjelasan internal. Ia dapat mengambil tindakan ke sumber eksternal, melihat hasilnya, lalu memperbarui rencana. ReAct dilaporkan membantu mengurangi masalah halusinasi dan propagasi error yang kerap muncul pada pendekatan reasoning tanpa aksi eksternal [4]. Artinya, agent yang efektif bukan hanya yang pandai “berpikir”, tetapi yang mampu berpikir sambil bertindak dan memeriksa kenyataan.


Argumen bahwa lingkungan kerja memengaruhi kemampuan agent juga diperkuat oleh SWE-agent. Penelitian ini secara eksplisit menyoroti pentingnya agent-computer interface yang dirancang khusus agar model dapat menavigasi repository, membaca file, mengedit kode, menjalankan program, dan memahami hasil terminal [5]. Temuan itu relevan untuk dunia kerja saat ini: peningkatan performa agent tidak selalu datang dari model yang lebih besar, tetapi bisa berasal dari desain interface dan harness yang lebih tepat. Dalam konteks software engineering, desain lingkungan yang legible, testable, dan auditable dapat menjadi keunggulan yang lebih bernilai daripada sekadar mengganti model.


Anthropic memberi nuansa penting pada diskusi ini melalui pembedaan antara workflow dan agent. Menurut mereka, workflow adalah sistem ketika LLM dan tools diorkestrasi melalui jalur yang telah ditentukan, sedangkan agent adalah sistem ketika LLM memiliki kendali lebih dinamis untuk memilih proses dan penggunaan tool [2]. Anthropic juga menekankan bahwa implementasi yang paling sukses sering justru dimulai dari pola yang sederhana dan composable, bukan dari kompleksitas agentic yang berlebihan [2]. Ini penting sebagai koreksi: harness engineering bukan ajakan membuat sistem serumit mungkin, melainkan membangun struktur secukupnya agar tugas benar-benar bisa selesai.


Persoalan harness menjadi lebih kentara pada pekerjaan berdurasi panjang. Anthropic menjelaskan bahwa frontier coding models yang dijalankan lintas banyak context window dapat tetap gagal bila hanya diberi prompt tingkat tinggi [3]. Mereka menyebut dua failure mode yang sangat praktis: agent mencoba mengerjakan terlalu banyak sekaligus lalu kehabisan konteks dan meninggalkan state setengah jadi; atau agent berikutnya melihat ada progres, lalu salah menyimpulkan pekerjaan telah selesai [3]. Solusi yang mereka bahas berada pada level harness: menyiapkan fondasi awal, memecah kerja secara inkremental, menjaga kebersihan workspace, dan meninggalkan artefak progres yang jelas untuk sesi berikutnya [3]. Di sini terlihat bahwa dokumentasi bukan hanya untuk manusia, tetapi juga berfungsi sebagai memori operasional bagi agent.


Dari sudut implementasi perusahaan, komponen harness yang baik umumnya mencakup beberapa lapisan berikut:

  • Instructions: system prompt, aturan kerja, definition of done, acceptance criteria.
  • Context: repository, spesifikasi, dokumentasi arsitektur, riwayat perubahan.
  • Tools: terminal, browser, Git, database client, API client, test runner.
  • Memory: progress file, decision log, task history, session summary.
  • Guardrails: sandbox, pembatasan akses, approval manusia, pengelolaan secrets.
  • Evaluation: unit test, integration test, static analysis, review manusia.
  • Recovery: retry, rollback, reflection, handoff ke manusia atau agent lain.

Secara analitis, inilah alasan mengapa organisasi tidak cukup hanya memberi akses chatbot kepada karyawan. Tanpa harness yang jelas, AI mudah menghasilkan output tidak konsisten, perubahan tanpa jejak audit, penggunaan data yang berisiko, serta hasil yang sulit direproduksi. Sebaliknya, dengan harness, organisasi dapat menetapkan sumber data resmi, standar dokumentasi, workflow kerja, quality gate, batas akses, dan mekanisme rollback. Pada titik itu, AI tidak lagi menjadi eksperimen personal, melainkan kapabilitas organisasi yang lebih terstruktur.


Hal yang juga perlu ditegaskan adalah batasannya. Istilah harness engineering sendiri belum menjadi istilah akademik baku yang mapan seperti prompt engineering; penggunaan paling eksplisit saat ini datang dari praktik engineering OpenAI [1]. Selain itu, bukti paling kuat dalam sumber yang tersedia memang banyak berasal dari domain coding dan agentic software work [1][3][5]. Karena itu, generalisasi ke seluruh use case bisnis perlu dilakukan dengan hati-hati. Tidak semua pekerjaan membutuhkan agent penuh, dan tidak semua persoalan memerlukan harness yang kompleks. Dalam banyak kasus, workflow sederhana justru lebih tepat [2].


Kesimpulannya jelas. Prompt engineering masih penting karena membantu model memahami instruksi dengan lebih baik. Namun, ketika targetnya adalah AI agent yang harus bekerja lintas banyak langkah, memakai tool, memeriksa hasil, mengingat progres, dan melanjutkan tugas dengan aman, prompt saja tidak cukup. Keandalan sistem lebih banyak ditentukan oleh kualitas harness di sekeliling model: interface, dokumentasi, memori, evaluasi, dan guardrails [1][3][5]. LLM memberi kecerdasan, tetapi harness mengubah kecerdasan itu menjadi kerja nyata yang terukur dan dapat diverifikasi. Bagi perusahaan, keunggulan berikutnya bukan sekadar memilih model paling pintar, melainkan membangun lingkungan kerja agent yang paling jelas, paling aman, dan paling dapat diaudit.


Referensi: [1] OpenAI, Harness engineering: leveraging Codex in an agent-first world. [2] Anthropic, Building effective agents. [3] Anthropic, Effective harnesses for long-running agents. [4] Yao dkk., ReAct: Synergizing Reasoning and Acting in Language Models. [5] Yang dkk., SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering.


Sumber Referensi

  1. Harness engineering: leveraging Codex in an agent-first world | OpenAI
  2. Building effective agents | Anthropic
  3. Effective harnesses for long-running agents | Anthropic
  4. ReAct: Synergizing Reasoning and Acting in Language Models | arXiv
  5. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering | arXiv
Summary Interaktif

Jawaban:
Prompt engineering adalah teknik untuk mengarahkan cara berpikir model melalui instruksi yang jelas, menetapkan tujuan tugas, format jawaban, dan batasan konteks minimum. Namun, prompt engineering hanya mengatur apa yang diminta dari model. Sedangkan harnessing adalah lingkungan kerja yang mengatur bagaimana model bekerja secara nyata dengan melibatkan instruksi, akses tools, konteks, memori, workflow, evaluasi, dan guardrails. Harnessing memungkinkan model tidak hanya memberikan respons, tetapi menjalankan tugas bertahap yang terverifikasi dan konsisten.

Jawaban:
Kecerdasan model LLM saja tidak cukup karena dua tim yang menggunakan model yang sama dapat memperoleh hasil yang berbeda dari segi kualitas, kecepatan, keamanan, dan konsistensi. Hal ini disebabkan oleh perbedaan lingkungan kerja atau harness yang dibangun di sekeliling model. Lingkungan yang lengkap dan terstruktur dengan instruksi, tools, konteks, memori, workflow, guardrails, dan evaluasi memungkinkan agent bekerja lebih efektif dan menghasilkan output yang dapat diverifikasi serta konsisten.

Jawaban:
Komponen utama harness yang baik meliputi: 1) Instructions seperti system prompt, aturan kerja, definition of done, dan acceptance criteria; 2) Context berupa repository, spesifikasi, dokumentasi arsitektur, dan riwayat perubahan; 3) Tools seperti terminal, browser, Git, database client, API client, dan test runner; 4) Memory yang mencakup progress file, decision log, task history, dan session summary; 5) Guardrails seperti sandbox, pembatasan akses, approval manusia, dan pengelolaan secrets; 6) Evaluation yang meliputi unit test, integration test, static analysis, dan review manusia; serta 7) Recovery berupa retry, rollback, reflection, dan handoff ke manusia atau agent lain.

Jawaban:
ReAct merupakan pola kerja agent modern yang menggabungkan reasoning (penalaran) dengan action (tindakan) dan observation (pengamatan) secara siklus, yaitu reasoning → action → observation → reasoning berikutnya. Dengan pendekatan ini, model tidak hanya memberikan penjelasan internal, tetapi juga dapat mengambil tindakan terhadap sumber eksternal, melihat hasilnya, lalu memperbarui rencana. ReAct membantu mengurangi masalah halusinasi dan propagasi error yang umum terjadi pada pendekatan reasoning tanpa aksi eksternal, sehingga agent menjadi lebih efektif dan andal.

Jawaban:
Penelitian SWE-agent menyoroti pentingnya agent-computer interface yang dirancang khusus agar model dapat menavigasi repository, membaca file, mengedit kode, menjalankan program, dan memahami hasil terminal. Desain interface dan harness yang tepat dapat meningkatkan performa agent lebih signifikan dibandingkan hanya menggunakan model yang lebih besar. Dalam konteks software engineering, desain lingkungan yang legible, testable, dan auditable memberikan keunggulan yang lebih bernilai daripada sekadar mengganti model LLM.

Jawaban:
Menurut Anthropic, workflow adalah sistem di mana LLM dan tools diorkestrasi melalui jalur yang telah ditentukan secara tetap, sedangkan agent adalah sistem di mana LLM memiliki kendali yang lebih dinamis untuk memilih proses dan penggunaan tools. Perbedaan ini penting karena implementasi yang sukses sering dimulai dari pola workflow yang sederhana dan composable, bukan dari sistem agentik yang kompleks. Hal ini mengoreksi anggapan bahwa harness engineering harus membuat sistem yang rumit, melainkan membangun struktur yang cukup agar tugas dapat diselesaikan dengan efektif.

Jawaban:
Dua failure mode praktis yang diidentifikasi adalah: 1) agent mencoba mengerjakan terlalu banyak tugas sekaligus sehingga kehabisan konteks dan meninggalkan state setengah jadi; 2) agent berikutnya salah menyimpulkan bahwa pekerjaan telah selesai karena melihat adanya progres tanpa verifikasi lengkap. Solusi harness untuk masalah ini adalah menyiapkan fondasi awal yang kuat, memecah kerja secara inkremental, menjaga kebersihan workspace, dan meninggalkan artefak progres yang jelas agar sesi berikutnya dapat melanjutkan pekerjaan dengan akurat.

Jawaban:
Tanpa harness yang jelas, penggunaan AI oleh organisasi rentan menghasilkan output yang tidak konsisten, perubahan tanpa jejak audit, risiko penggunaan data yang tinggi, serta hasil yang sulit direproduksi. Harness memungkinkan organisasi menetapkan sumber data resmi, standar dokumentasi, workflow kerja, quality gate, batas akses, dan mekanisme rollback. Dengan demikian, AI dapat menjadi kapabilitas organisasi yang terstruktur dan dapat diandalkan, bukan sekadar eksperimen personal.

Jawaban:
Batasan konsep harness engineering adalah bahwa istilah ini belum menjadi istilah akademik baku dan paling eksplisit digunakan dalam praktik engineering OpenAI. Bukti dan studi yang tersedia banyak berasal dari domain coding dan pekerjaan software agentik. Oleh karena itu, generalisasi penerapan harness engineering ke seluruh use case bisnis harus dilakukan dengan hati-hati. Tidak semua pekerjaan membutuhkan agent penuh atau harness yang kompleks; dalam banyak kasus, workflow sederhana lebih sesuai dan efektif.

Jawaban:
Keunggulan berikutnya bagi perusahaan bukan hanya memilih model LLM paling pintar karena kecerdasan model saja tidak menjamin keandalan dan efektivitas sistem. Kualitas sistem AI lebih banyak ditentukan oleh harness di sekeliling model, seperti interface, dokumentasi, memori, evaluasi, dan guardrails yang membentuk lingkungan kerja agent. Harness mengubah kecerdasan model menjadi kerja nyata yang terukur dan dapat diverifikasi, sehingga perusahaan dapat memperoleh hasil yang konsisten, aman, dan mudah diaudit, menjadikan AI sebagai kapabilitas organisasi yang terstruktur.
Artikel lain dari penulis ini
Iklan