Realtime
Speech-to-speech models for live, interruptible voice conversations.
The realtime models behind voice interfaces: a person speaks and the model speaks back in sub-second, interruptible turns. Each entry documents its audio and text pricing, its voices, and its turn-taking behavior. These power the live voice agent rather than a one-shot generation.
8 models
OGPT Realtime 2.1Realtime
OpenAI
$64.00/ 1M audio out
10
Voices
Realtime
Latency
Audition 10 voices
GGemini 2.5 Flash Native AudioRealtime
Google
$12.00/ 1M audio out
30
Voices
Realtime
Latency
Audition 30 voices
GGemini 3.1 Flash LiveRealtime
Google
$12.00/ 1M audio out
30
Voices
Realtime
Latency
Audition 30 voices
OGPT Realtime 2.1 MiniRealtime
OpenAI
$20.00/ 1M audio out
10
Voices
Realtime
Latency
Audition 10 voices
XGrok Voice (Think Fast 2.0)Realtime
X.ai
$0.08/ min of conversation
28
Voices
Realtime
Latency
Audition 28 voices
QQwen Audio 3.0 Realtime FlashRealtime
Qwen· viaAlibaba Cloud
$15.00/ 1M audio out
5
Voices
Realtime
Latency
Audition 5 voices
QQwen Audio 3.0 Realtime PlusRealtime
Qwen· viaAlibaba Cloud
$24.00/ 1M audio out
5
Voices
Realtime
Latency
Audition 5 voices
QQwen3.5 Omni Plus RealtimeRealtime
Qwen· viaAlibaba Cloud
$62.00/ 1M audio out
1
Voices
Realtime
Latency
Audition 1 voices