13.1 · Speech-to-Text (STT) Requirements
Fungsi
Menangkap ucapan pengguna (bahasa Inggris) dan mengubahnya menjadi teks untuk dievaluasi oleh AI.
Kebutuhan
| Aspek | Requirement |
|---|---|
| Bahasa | English (berbagai aksen, termasuk non-native Indonesian) |
| Akurasi | > 85% word accuracy untuk non-native speaker |
| Latency | < 2 detik setelah pengguna selesai bicara |
| Streaming | Real-time transcription (preferred, untuk UX yang natural) |
| Noise handling | Bisa menangani background noise rumah/café |
| Punctuation | Auto-punctuation untuk analisis kalimat |
| Filler detection | Mendeteksi "um", "uh", "like" sebagai data fluency |
| Silence detection | Mendeteksi jeda panjang sebagai data confidence |
Provider Candidates
- Google Cloud Speech-to-Text
- OpenAI Whisper
- Deepgram
- Azure Speech Services
Acceptance Criteria
- STT menangkap ucapan bahasa Inggris dari non-native speaker
- Akurasi ≥ 85% dalam kondisi normal
- Latency < 2 detik
- Filler words dan silence terdeteksi