Skip to main content

13.5 · Alur Audio End-to-End

Alur Lengkap​

[1. AI berbicara (TTS)]
↓ Audio dimainkan ke speaker/headphone
[2. Pengguna mendengar]
↓
[3. Pengguna menekan tombol mic]
↓ Recording dimulai
[4. Pengguna berbicara]
↓ Audio di-stream ke STT
[5. STT menghasilkan teks]
↓ Teks + metadata audio dikirim ke AI
[6. AI memproses]
↓ Evaluasi + generate respons
[7. Respons AI diubah ke suara (TTS)]
↓
[8. Audio respons dimainkan]
↓
[Kembali ke step 2 atau sesi selesai]

Latency Budget​

StepTarget Latency
STT processing< 2 detik
AI processing< 3 detik
TTS generation< 2 detik
Total end-to-end< 5-7 detik (dari selesai bicara sampai AI mulai merespons)

Catatan: Latency ini kritis untuk pengalaman percakapan yang natural. Jika terlalu lama, percakapan terasa tidak natural dan membuat frustrasi.

Handling Edge Cases​

CasePenanganan
Mic permission deniedTampilkan penjelasan mengapa mic dibutuhkan + link ke settings
Background noise tinggiNotifikasi: "Sepertinya agak berisik. Coba pindah ke tempat yang lebih tenang?"
STT tidak menangkap"Maaf, aku tidak bisa mendengar dengan jelas. Bisa diulang?"
Internet putusSimpan state, resume saat koneksi kembali
Latency tinggiTampilkan thinking indicator ("AI sedang memproses...")