Skip to main content

13.1 · Speech-to-Text (STT) Requirements

Fungsi​

Menangkap ucapan pengguna (bahasa Inggris) dan mengubahnya menjadi teks untuk dievaluasi oleh AI.

Kebutuhan​

AspekRequirement
BahasaEnglish (berbagai aksen, termasuk non-native Indonesian)
Akurasi> 85% word accuracy untuk non-native speaker
Latency< 2 detik setelah pengguna selesai bicara
StreamingReal-time transcription (preferred, untuk UX yang natural)
Noise handlingBisa menangani background noise rumah/café
PunctuationAuto-punctuation untuk analisis kalimat
Filler detectionMendeteksi "um", "uh", "like" sebagai data fluency
Silence detectionMendeteksi jeda panjang sebagai data confidence

Provider Candidates​

  • Google Cloud Speech-to-Text
  • OpenAI Whisper
  • Deepgram
  • Azure Speech Services

Acceptance Criteria​

  • STT menangkap ucapan bahasa Inggris dari non-native speaker
  • Akurasi ≥ 85% dalam kondisi normal
  • Latency < 2 detik
  • Filler words dan silence terdeteksi