Pernah ngobrol dengan ChatGPT dan merasa seperti ngobrol sama manusia beneran? Atau pakai Google Translate dan hasilnya makin akurat dari tahun ke tahun?
š§ Semua itu berkat algoritma Transformer, si jenius yang jadi otak utama di balik kecanggihan AI bahasa.
Tapi... gimana cara kerjanya? Jangan khawatir. Yuk kita bahas lewat analogi sederhana ā karena nggak semua orang suka baca rumus matrix ribuan baris š .

Bayangkan Transformer seperti Sekolah dengan Banyak Murid
Coba bayangin kamu ada di sebuah kelas besar dengan 12 murid. Setiap murid ini mewakili satu kata dalam sebuah kalimat.
Contoh kalimat:
āAku makan nasi goreng enak di malam hari.ā
Murid 1: Aku
Murid 2: makan
Murid 3: nasi
Murid 4: goreng
Murid 5: enak
Murid 6: di
Murid 7: malam
Murid 8: hari
Nah, tugas masing-masing murid adalah memahami arti kata mereka, tapi juga mengerti peran dan hubungan mereka dengan murid lain dalam kalimat.
Self-Attention: Murid-Murid yang Saling Melihat
Di sekolah Transformer, ada metode belajar unik yang disebut Self-Attention.
š§ Artinya: Setiap murid (kata) tidak hanya melihat dirinya sendiri, tapi menengok kiri-kanan untuk melihat siapa yang penting untuk dipahami.
Contohnya:
- Kata āmakanā akan melihat āakuā (siapa yang makan) dan ānasi gorengā (apa yang dimakan).
- Kata āenakā akan melihat ānasi gorengā (yang enak).
- Kata āmalamā akan melihat ādiā dan āhariā untuk tahu konteks waktunya.
Setiap hubungan ini diberi skor pentingnya. Kalau ānasi gorengā sangat berkaitan dengan āenakā, maka skor keterkaitannya tinggi.
⨠Inilah kekuatan Self-Attention: setiap kata bisa fokus ke kata-kata lain yang relevan, tak peduli seberapa jauh posisinya dalam kalimat.
Proses Belajar: Nilai di-update Berulang Kali
Setelah saling melihat dan memberi skor perhatian, setiap murid mengupdate pemahamannya sendiri. Mereka mulai menyimpulkan:
- āAku ternyata subjeknya.ā
- āGoreng itu bagian dari ānasi gorengā, bukan aktivitas.ā
- āāDi malam hariā adalah waktu makan.ā
Proses ini terjadi berulang kali dalam beberapa lapisan (disebut layers) sampai pemahaman mereka semakin matang. Semakin dalam lapisan, semakin abstrak pemahaman yang dibentuk.
Positional Encoding: Supaya Tidak Lupa Urutan
Eh, tapi gimana caranya mereka tahu urutan kata? Kan komputer cuma ngerti angka.
Di sinilah Positional Encoding masuk.
Bayangkan setiap murid pakai name tag bertuliskan posisi mereka:
- Murid 1 = āAkuā (posisi ke-1)
- Murid 2 = āmakanā (posisi ke-2), dst.
Dengan begini, sistem tahu bedanya antara:
āAku makan kamuā
dan
āKamu makan akuā
Karena maknanya bisa 180 derajat kalau urutan kacau š
Output: Setelah Belajar, Apa yang Dilakukan?
Setelah semua kata saling memahami konteksnya lewat self-attention, dan sudah diproses beberapa lapisan, hasil akhirnya:
- Bisa digunakan untuk memprediksi kata berikutnya (misalnya untuk menulis).
- Bisa digunakan untuk menerjemahkan kalimat ke bahasa lain.
- Bisa digunakan untuk menjawab pertanyaan karena dia sudah "ngerti" konteksnya.
Transformer: Lebih Pintar dari Pendahulunya
Sebelum Transformer, ada model bernama RNN dan LSTM. Tapi mereka punya keterbatasan:
- Sulit mengingat kata-kata yang letaknya jauh dalam kalimat.
- Lambat karena harus proses satu per satu dari kiri ke kanan.
Transformer memecahkan itu dengan:
ā Memproses seluruh kalimat sekaligus (parallel)
ā Menentukan fokus ke kata penting lewat self-attention
ā Bisa melihat konteks panjang (bahkan paragraf atau halaman)
Penutup: Transformer Mengubah Dunia
š Sejak diperkenalkan oleh Google dalam paper āAttention Is All You Needā (2017), algoritma Transformer telah menjadi fondasi model bahasa besar seperti:
- ChatGPT (OpenAI)
- BERT dan T5 (Google)
- LLaMA (Meta)
- Claude (Anthropic)
Jadi, ketika kamu bicara ke AI dan dia bisa paham, merespons sopan, bahkan bikin puisi lucu ā ingatlah bahwa semua itu dimulai dari sebuah algoritma bernama Transformer, yang cara kerjanya... mirip murid-murid saling menatap dan memahami dalam satu kelas.