Pada tanggal 3 Juni 2025, OpenAI merilis dua varian model speech-to-speech terbaru yang siap bikin pengalaman ngobrol sama AI jadi makin asik dan natural. Ada gpt-4o-realtime-preview-2025-06-03 yang fokus ke interaksi real-time, dan gpt-4o-audio-preview-2025-06-03 yang cocok buat chatbot audio dengan sesi lebih terstruktur.
Yuk, kita kulik fitur, cara pakai, harga, sampai seluk-beluk token yang dipakai biar kamu makin paham gimana cara manfaatin teknologi keren ini buat bikin aplikasi suara kekinian!
Fitur Utama
- Speech-to-Speech (S2S): Kedua model ini bisa nerima input suara, olah, dan keluarkan suara yang natural banget. Cocok buat voice-chatbot, asisten suara, sampai perangkat IoT kayak smart speaker.
- Konteks Lebar 128K Token: Bisa “nginget” percakapan atau instruksi panjang sampai 128 ribu token, bikin interaksi jadi koheren dan lancar.
- Peningkatan Instruction Following & Tool Calling: Lebih jago dalam nangkep instruksi suara, bisa panggil API eksternal, dan langsung berhenti output pas kamu interupsi.
Perbedaan Model
- gpt-4o-realtime-preview-2025-06-03: Buat interaksi dua arah real-time, AI langsung merespon pas kamu jeda ngomong tanpa perlu nunggu kamu selesai ngomong.
- gpt-4o-audio-preview-2025-06-03: Cocok buat chatbot yang komunikasi audio tapi sesi request-response, mirip voice message. Input dan output audio di-encode jadi file WAV/MP3.
Cara Pakai
- Realtime API (gpt-4o-realtime-preview): gunakan endpoint
https://api.openai.com/v1/realtimedan Agents SDK TypeScript. Contoh kode simpel buat connect dan mulai sesi real-time sudah disediakan, bikin AI langsung siap nyapa dan jawab kamu secara cepat. - Chat Completions API (gpt-4o-audio-preview): pakai endpoint
https://api.openai.com/v1/chat/completions. Kirim audio base64 di body request, nanti dapat balasan audio juga yang bisa langsung diputar.
Harga
OpenAI ngitung biaya per 1 juta audio token, bukan teks token. Untuk model preview ini:
- Input: sekitar 40 USD per 1 juta token
- Output: sekitar 80 USD per 1 juta token
Kalau dikonversi ke biaya per menit audio, input sekitar 2,4 sen dan output sekitar 9,6 sen per menit, jauh lebih murah dibanding tarif normal yang sekitar 6 dan 24 sen.
Seberapa Banyak 1 Juta Token?
- Sekitar 11 jam audio input bisa ditampung 1 juta token audio (model preview).
- Output 1 juta token bisa menghasilkan sekitar 22 jam audio.
- Untuk teks, 1 juta token kira-kira setara dengan 750 ribu kata atau 1.500 halaman A4.
Contoh Kasus & Estimasi Biaya
- Voice Chatbot 30 menit (Realtime API): Biaya input sekitar 1,8 USD, output sekitar 0,88 USD, total kurang lebih 2,68 USD untuk 30 menit interaksi dua arah.
- Voice Message Bot (Chat Completions API): 3 voice message total 3 menit, biaya input dan output masing-masing sekitar 0,18 USD, total sekitar 0,36 USD.
Manfaat & Tips
- Respons Cepat & Natural: AI langsung merespon pas kamu jeda ngomong, bikin chat audio terasa lancar tanpa delay.
- Mudah Integrasi: Bisa dipakai di web, mobile, atau perangkat IoT dengan latensi rendah dan kualitas audio jernih.
- Debugging Mudah: Ada dashboard yang tampilkan grafik input output dan waveforms, bikin troubleshooting gampang.
- Optimasi Biaya: Gunakan varian mini untuk kebutuhan ringan, cache audio yang sering dipakai, dan batch proses untuk efisiensi token.
Kesimpulan
Model speech-to-speech terbaru dari OpenAI ini cocok banget buat kamu yang mau bikin aplikasi suara keren dan interaktif dengan biaya yang cukup terjangkau. Baik buat voice chatbot interaktif, tutorial suara otomatis, maupun asisten suara smart home, teknologi ini siap jadi andalanmu.
Dengan pemahaman tentang token dan harga, kamu bisa rencanain anggaran dan strategi pengembangan dengan lebih matang. Jangan lupa eksplorasi varian mini kalau butuh solusi hemat tapi tetap oke kualitasnya.
Selamat berkreasi dan semoga artikel ini ngebantu kamu tahu lebih dalam tentang model speech-to-speech terbaru ini!
Referensi: