Word error rate · lower is better
2.93%
Reson8 (Reson8)
3.09%Cartesia Ink 2 (Cartesia)
3.46%
Smallest Pulse (Smallest)
3.53%GPT Realtime Whisper (OpenAI)
3.80%
Google Chirp 2 (Google)
15 Models · 2 Datasets · 60 Min of Conversation
Converse-STT
Conversational Speech-to-Text Benchmark
Can frontier models accurately understand and transcribe natural conversation?
Evaluates frontier AI and speech-to-text models on Real World Conversational Data and on agent-generated, publicly available Pipecat audio. It measures word error rate (WER) on each dataset and shows how each model's score shifts between them.
Category
Speech-to-TextLanguages
English