Peluncuran Model Speech-to-Speech Terbaru OpenAI: gpt-4o-realtime-preview & gpt-4o-audio-preview

← Kembali ke Blogs

Peluncuran Model Speech-to-Speech Terbaru OpenAI: gpt-4o-realtime-preview & gpt-4o-audio-preview

Ditulis olehkukuhtw·
0 unik hari ini 0 unik 7 hari 13 unik 30 hari 113 total unik
Peluncuran Model Speech-to-Speech Terbaru OpenAI: gpt-4o-realtime-preview & gpt-4o-audio-preview
Iklan

Pada tanggal 3 Juni 2025, OpenAI merilis dua varian model speech-to-speech terbaru yang siap bikin pengalaman ngobrol sama AI jadi makin asik dan natural. Ada gpt-4o-realtime-preview-2025-06-03 yang fokus ke interaksi real-time, dan gpt-4o-audio-preview-2025-06-03 yang cocok buat chatbot audio dengan sesi lebih terstruktur.


Yuk, kita kulik fitur, cara pakai, harga, sampai seluk-beluk token yang dipakai biar kamu makin paham gimana cara manfaatin teknologi keren ini buat bikin aplikasi suara kekinian!


Fitur Utama
  • Speech-to-Speech (S2S): Kedua model ini bisa nerima input suara, olah, dan keluarkan suara yang natural banget. Cocok buat voice-chatbot, asisten suara, sampai perangkat IoT kayak smart speaker.
  • Konteks Lebar 128K Token: Bisa “nginget” percakapan atau instruksi panjang sampai 128 ribu token, bikin interaksi jadi koheren dan lancar.
  • Peningkatan Instruction Following & Tool Calling: Lebih jago dalam nangkep instruksi suara, bisa panggil API eksternal, dan langsung berhenti output pas kamu interupsi.

Perbedaan Model
  • gpt-4o-realtime-preview-2025-06-03: Buat interaksi dua arah real-time, AI langsung merespon pas kamu jeda ngomong tanpa perlu nunggu kamu selesai ngomong.
  • gpt-4o-audio-preview-2025-06-03: Cocok buat chatbot yang komunikasi audio tapi sesi request-response, mirip voice message. Input dan output audio di-encode jadi file WAV/MP3.

Cara Pakai
  • Realtime API (gpt-4o-realtime-preview): gunakan endpoint https://api.openai.com/v1/realtime dan Agents SDK TypeScript. Contoh kode simpel buat connect dan mulai sesi real-time sudah disediakan, bikin AI langsung siap nyapa dan jawab kamu secara cepat.
  • Chat Completions API (gpt-4o-audio-preview): pakai endpoint https://api.openai.com/v1/chat/completions. Kirim audio base64 di body request, nanti dapat balasan audio juga yang bisa langsung diputar.

Harga

OpenAI ngitung biaya per 1 juta audio token, bukan teks token. Untuk model preview ini:

  • Input: sekitar 40 USD per 1 juta token
  • Output: sekitar 80 USD per 1 juta token

Kalau dikonversi ke biaya per menit audio, input sekitar 2,4 sen dan output sekitar 9,6 sen per menit, jauh lebih murah dibanding tarif normal yang sekitar 6 dan 24 sen.


Seberapa Banyak 1 Juta Token?
  • Sekitar 11 jam audio input bisa ditampung 1 juta token audio (model preview).
  • Output 1 juta token bisa menghasilkan sekitar 22 jam audio.
  • Untuk teks, 1 juta token kira-kira setara dengan 750 ribu kata atau 1.500 halaman A4.

Contoh Kasus & Estimasi Biaya
  • Voice Chatbot 30 menit (Realtime API): Biaya input sekitar 1,8 USD, output sekitar 0,88 USD, total kurang lebih 2,68 USD untuk 30 menit interaksi dua arah.
  • Voice Message Bot (Chat Completions API): 3 voice message total 3 menit, biaya input dan output masing-masing sekitar 0,18 USD, total sekitar 0,36 USD.

Manfaat & Tips
  • Respons Cepat & Natural: AI langsung merespon pas kamu jeda ngomong, bikin chat audio terasa lancar tanpa delay.
  • Mudah Integrasi: Bisa dipakai di web, mobile, atau perangkat IoT dengan latensi rendah dan kualitas audio jernih.
  • Debugging Mudah: Ada dashboard yang tampilkan grafik input output dan waveforms, bikin troubleshooting gampang.
  • Optimasi Biaya: Gunakan varian mini untuk kebutuhan ringan, cache audio yang sering dipakai, dan batch proses untuk efisiensi token.

Kesimpulan

Model speech-to-speech terbaru dari OpenAI ini cocok banget buat kamu yang mau bikin aplikasi suara keren dan interaktif dengan biaya yang cukup terjangkau. Baik buat voice chatbot interaktif, tutorial suara otomatis, maupun asisten suara smart home, teknologi ini siap jadi andalanmu.

Dengan pemahaman tentang token dan harga, kamu bisa rencanain anggaran dan strategi pengembangan dengan lebih matang. Jangan lupa eksplorasi varian mini kalau butuh solusi hemat tapi tetap oke kualitasnya.

Selamat berkreasi dan semoga artikel ini ngebantu kamu tahu lebih dalam tentang model speech-to-speech terbaru ini!


Referensi:
Summary Interaktif

Jawaban:
Model speech-to-speech terbaru OpenAI memiliki fitur utama seperti kemampuan menerima input suara, mengolah, dan menghasilkan suara yang sangat natural, cocok untuk voice-chatbot, asisten suara, dan perangkat IoT. Model ini juga mendukung konteks lebar hingga 128 ribu token sehingga percakapan atau instruksi panjang dapat diingat dengan baik. Selain itu, ada peningkatan dalam kemampuan mengikuti instruksi suara, pemanggilan API eksternal, dan kemampuan untuk langsung menghentikan output saat interupsi terjadi.

Jawaban:
Model gpt-4o-realtime-preview-2025-06-03 dirancang untuk interaksi dua arah secara real-time dimana AI merespon langsung saat pengguna jeda berbicara tanpa menunggu selesai. Sedangkan model gpt-4o-audio-preview-2025-06-03 cocok untuk chatbot yang menggunakan komunikasi audio dengan pola sesi request-response seperti voice message, di mana input dan output audio di-encode dalam format file WAV atau MP3.

Jawaban:
Untuk model gpt-4o-realtime-preview, digunakan Realtime API dengan endpoint https://api.openai.com/v1/realtime dan Agents SDK TypeScript, dengan contoh kode yang memungkinkan koneksi dan sesi real-time cepat. Sedangkan untuk model gpt-4o-audio-preview, digunakan Chat Completions API dengan endpoint https://api.openai.com/v1/chat/completions, di mana audio dikirim dalam format base64 di body request dan balasan berupa audio juga dapat langsung diputar.

Jawaban:
Biaya untuk model preview speech-to-speech adalah sekitar 40 USD per 1 juta token input dan 80 USD per 1 juta token output audio. Jika dikonversi ke biaya per menit audio, maka input sekitar 2,4 sen per menit dan output sekitar 9,6 sen per menit, yang jauh lebih murah dibanding tarif normal yang sekitar 6 dan 24 sen per menit.

Jawaban:
1 juta token audio input dapat menampung sekitar 11 jam audio, sedangkan 1 juta token output bisa menghasilkan sekitar 22 jam audio.

Jawaban:
Untuk voice chatbot dengan interaksi dua arah selama 30 menit menggunakan Realtime API, biaya input sekitar 1,8 USD, biaya output sekitar 0,88 USD, sehingga total biaya kurang lebih 2,68 USD.

Jawaban:
Manfaat utama termasuk respons AI yang cepat dan natural tanpa delay, kemudahan integrasi di berbagai platform seperti web, mobile, dan perangkat IoT dengan latensi rendah dan kualitas audio jernih, serta kemudahan debugging melalui dashboard yang menampilkan grafik input-output dan waveforms. Tips optimasi biaya meliputi penggunaan varian mini untuk kebutuhan ringan, caching audio yang sering dipakai, dan batch processing untuk efisiensi token.

Jawaban:
Pemahaman tentang token dan harga memungkinkan pengembang merencanakan anggaran dan strategi pengembangan dengan lebih matang, sehingga dapat mengoptimalkan biaya sekaligus menjaga kualitas aplikasi suara yang dibuat. Ini juga membantu dalam memilih varian model yang tepat dan mengelola penggunaan token agar efisien.
Artikel lain dari penulis ini
Iklan