Kembali ke Semua ArtikelAudio & Realtime
Audio & Realtime

Model OpenAI untuk Audio dan Realtime: Dari Whisper hingga GPT-4o Voice

Perbandingan teknologi suara OpenAI: Speech-to-Text Whisper, Text-to-Speech (TTS), dan protokol websocket suara-ke-suara langsung GPT-4o Realtime.

Tim Peneliti OpenAI Models Compare
•
Dipublikasikan: 2025-02-12

## Arsitektur Tradisional vs Speech-to-Speech Asli

Selama bertahun-tahun, membangun asisten suara cerdas membutuhkan tiga tahapan terpisah: 1. **Audio ke Teks:** Menggunakan Whisper STT (~1000–1500 ms). 2. **Penalaran Teks:** Menggunakan model LLM seperti GPT-4 (~1000–2000 ms). 3. **Teks ke Audio:** Menggunakan model TTS (~500–1000 ms).

Total latensi mencapai 3 hingga 5 detik. Jeda sepanjang ini merusak keintiman percakapan alami manusia.

---

Terobosan GPT-4o Realtime API

Dengan **GPT-4o Realtime**, OpenAI memproses audio langsung ke audio secara terpadu (*native speech-to-speech*) melalui koneksi WebSocket persisten: - **Latensi Turun ke ~300 ms:** Setara dengan kecepatan respon percakapan manusia alami. - **Deteksi Interupsi Alami:** Pengguna dapat menyela di tengah kalimat tanpa membuat bot bingung. - **Nuansa Emosional:** Model dapat mendengar intonasi sedih, gembira, atau terburu-buru dari nada suara pengguna dan merespons dengan intonasi yang sesuai.

---

Biaya dan Perbandingan Model Audio

| Model | Kegunaan | Biaya Resmi | |---|---|---| | **Whisper-1** | Transkripsi Rekaman / Audio-ke-Teks | $0.006 per menit rekaman | | **TTS-1** | Sintesis Suara Cepat | $15.00 per 1M karakter teks | | **TTS-1 HD** | Sintesis Suara Mutu Studio | $30.00 per 1M karakter teks | | **GPT-4o Realtime** | Percakapan Suara Live 2-Arah | Teks: $5/$20 per 1M tk • Audio: $100/$200 per 1M tk |

Tags:#Whisper#TTS#Realtime API#Voice Bot#Audio