13.5 · Alur Audio End-to-End
Alur Lengkap
[1. AI berbicara (TTS)]
↓ Audio dimainkan ke speaker/headphone
[2. Pengguna mendengar]
↓
[3. Pengguna menekan tombol mic]
↓ Recording dimulai
[4. Pengguna berbicara]
↓ Audio di-stream ke STT
[5. STT menghasilkan teks]
↓ Teks + metadata audio dikirim ke AI
[6. AI memproses]
↓ Evaluasi + generate respons
[7. Respons AI diubah ke suara (TTS)]
↓
[8. Audio respons dimainkan]
↓
[Kembali ke step 2 atau sesi selesai]
Latency Budget
| Step | Target Latency |
|---|---|
| STT processing | < 2 detik |
| AI processing | < 3 detik |
| TTS generation | < 2 detik |
| Total end-to-end | < 5-7 detik (dari selesai bicara sampai AI mulai merespons) |
Catatan: Latency ini kritis untuk pengalaman percakapan yang natural. Jika terlalu lama, percakapan terasa tidak natural dan membuat frustrasi.
Handling Edge Cases
| Case | Penanganan |
|---|---|
| Mic permission denied | Tampilkan penjelasan mengapa mic dibutuhkan + link ke settings |
| Background noise tinggi | Notifikasi: "Sepertinya agak berisik. Coba pindah ke tempat yang lebih tenang?" |
| STT tidak menangkap | "Maaf, aku tidak bisa mendengar dengan jelas. Bisa diulang?" |
| Internet putus | Simpan state, resume saat koneksi kembali |
| Latency tinggi | Tampilkan thinking indicator ("AI sedang memproses...") |