> ## Documentation Index
> Fetch the complete documentation index at: https://usefulai.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Best Real-Time Transcription Models in 2026

> Compare the best real-time transcription models in 2026 for voice agents, live captions, meetings, and multilingual streaming, plus local options.

<div className="uai-updated-row">Updated July 12, 2026</div>

Real-time transcription models turn speech into text as you talk, trading off accuracy, latency, price, and how fast they detect when a speaker finishes. Vendor latency claims rarely mean the same thing, so we ranked 15 streaming models on one independent benchmark.

Our primary score is final-transcript accuracy from the Artificial Analysis streaming speech-to-text benchmark, normalized to a 0-100 scale where higher is better. It covers English-language audio only, so treat it as a strong baseline, not the last word: telephony, accents, and other languages can shift the order.

## Best Real-Time Transcription Models

<div className="uai-overview-table uai-overview-table--ranked">
  |  # | Model                                                                                                                                                                                                                                    | Best for                                | Score <Tooltip tip="UsefulAI's 0-100 streaming score is normalized from Artificial Analysis final-transcript word error. Higher means more accurate."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About score</span></span></Tooltip> | Price <Tooltip tip="Current USD per hour of streaming audio for the represented route. Volume, plan, region, features, and self-hosting can change the price."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About price</span></span></Tooltip> | License <Tooltip tip="Proprietary means no public model weights. Open weight means weights are available, though exact licenses and commercial-use terms vary."><span className="uai-tip-icon"><Icon icon="circle-info" size={12} color="currentColor" /><span className="uai-sr-only">About license</span></span></Tooltip> |
  | -: | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- | --------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
  |  1 | <a href="https://elevenlabs.io/realtime-speech-to-text" target="_blank" rel="noreferrer"><img src={"/images/icons/48/elevenlabs.io.png"} alt="" noZoom />ElevenLabs Scribe v2 Realtime</a>                                               | Highest-accuracy multilingual streaming |                                                                                                                                                                                                                                                                                                              100 |                                                                                                                                                                                                                                                                                                               \$0.39/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  2 | <a href="https://docs.cartesia.ai/build-with-cartesia/stt/latest" target="_blank" rel="noreferrer"><img src={"/images/icons/48/cartesia.ai.png"} alt="" noZoom />Cartesia Ink 2</a>                                                      | Accuracy-first voice agents             |                                                                                                                                                                                                                                                                                                              100 |                                                                                                                                                                                                                                                                                                               \$0.40/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  3 | <a href="https://www.alibabacloud.com/help/en/model-studio/real-time-speech-recognition-user-guide" target="_blank" rel="noreferrer"><img src={"/images/icons/48/qwen.ai.png"} alt="" noZoom />Qwen3 ASR Flash Realtime</a>              | Budget multilingual accuracy            |                                                                                                                                                                                                                                                                                                               98 |                                                                                                                                                                                                                                                                                                               \$0.17/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  4 | <a href="https://docs.x.ai/developers/models/speech-to-text" target="_blank" rel="noreferrer"><img src={"/images/icons/48/x.ai.png"} alt="" noZoom />Grok Speech-to-Text Streaming</a>                                                   | Low-cost streaming with turn detection  |                                                                                                                                                                                                                                                                                                               96 |                                                                                                                                                                                                                                                                                                               \$0.20/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  5 | <a href="https://www.assemblyai.com/blog/contextual-awareness-in-universal-3-5-pro-realtime" target="_blank" rel="noreferrer"><img src={"/images/icons/48/assemblyai.com.png"} alt="" noZoom />AssemblyAI Universal-3.5 Pro Realtime</a> | Tunable accuracy for voice agents       |                                                                                                                                                                                                                                                                                                               93 |                                                                                                                                                                                                                                                                                                               \$0.45/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  6 | <a href="https://soniox.com/docs/stt/models" target="_blank" rel="noreferrer"><img src={"/images/icons/48/soniox.com.png"} alt="" noZoom />Soniox v5 Real-Time</a>                                                                       | Best price-to-performance streaming     |                                                                                                                                                                                                                                                                                                               89 |                                                                                                                                                                                                                                                                                                               \$0.12/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  7 | <a href="https://docs.cloud.google.com/speech-to-text/docs/models/chirp-3" target="_blank" rel="noreferrer"><img src={"/images/icons/48/google.com.png"} alt="" noZoom />Google Chirp 3 Streaming</a>                                    | Broad multilingual coverage             |                                                                                                                                                                                                                                                                                                               86 |                                                                                                                                                                                                                                                                                                               \$0.24/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  8 | <a href="https://developers.openai.com/api/docs/models/gpt-realtime-whisper" target="_blank" rel="noreferrer"><img src={"/images/icons/48/openai.com.png"} alt="" noZoom />OpenAI GPT Realtime Whisper</a>                               | Realtime voice-app transcription        |                                                                                                                                                                                                                                                                                                               85 |                                                                                                                                                                                                                                                                                                               \$1.02/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  |  9 | <a href="https://docs.inworld.ai/stt/overview" target="_blank" rel="noreferrer"><img src={"/images/icons/48/inworld.ai.png"} alt="" noZoom />Inworld STT 1 Realtime</a>                                                                  | Cheapest low-latency streaming          |                                                                                                                                                                                                                                                                                                               82 |                                                                                                                                                                                                                                                                                                               \$0.10/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 10 | <a href="https://docs.mistral.ai/models/model-cards/voxtral-mini-transcribe-realtime-26-02" target="_blank" rel="noreferrer"><img src={"/images/icons/48/mistral.ai.png"} alt="" noZoom />Mistral Voxtral Mini Transcribe Realtime</a>   | Self-hostable streaming accuracy        |                                                                                                                                                                                                                                                                                                               80 |                                                                                                                                                                                                                                                                                                               \$0.36/hour | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 11 | <a href="https://learn.microsoft.com/en-us/azure/ai-services/speech-service/speech-to-text" target="_blank" rel="noreferrer"><img src={"/images/icons/48/microsoft.com.png"} alt="" noZoom />Azure AI Speech Real-Time Transcription</a> | Enterprise multilingual transcription   |                                                                                                                                                                                                                                                                                                               80 |                                                                                                                                                                                                                                                                                                               \$0.40/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 12 | <a href="https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b" target="_blank" rel="noreferrer"><img src={"/images/icons/48/nvidia.com.png"} alt="" noZoom />NVIDIA Nemotron 3.5 ASR Streaming 0.6B</a>                         | Self-hosted streaming ASR               |                                                                                                                                                                                                                                                                                                               79 |                                                                                                                                                                                                                                                                                                                       n/a | <span className="uai-badge uai-badge--emerald">Open weight</span>                                                                                                                                                                                                                                                            |
  | 13 | <a href="https://docs.aws.amazon.com/transcribe/latest/dg/streaming.html" target="_blank" rel="noreferrer"><img src={"/images/icons/48/aws.amazon.com.png"} alt="" noZoom />Amazon Transcribe Streaming</a>                              | Managed enterprise streaming            |                                                                                                                                                                                                                                                                                                               74 |                                                                                                                                                                                                                                                                                                               \$0.60/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 14 | <a href="https://developers.deepgram.com/docs/models-languages-overview" target="_blank" rel="noreferrer"><img src={"/images/icons/48/deepgram.com.png"} alt="" noZoom />Deepgram Nova-3</a>                                             | Fast voice-agent default                |                                                                                                                                                                                                                                                                                                               64 |                                                                                                                                                                                                                                                                                                               \$0.25/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
  | 15 | <a href="https://developers.deepgram.com/docs/flux/quickstart" target="_blank" rel="noreferrer"><img src={"/images/icons/48/deepgram.com.png"} alt="" noZoom />Deepgram Flux General EN</a>                                              | Fastest endpointing for agents          |                                                                                                                                                                                                                                                                                                               55 |                                                                                                                                                                                                                                                                                                               \$0.34/hour | <span className="uai-badge uai-badge--zinc">Proprietary</span>                                                                                                                                                                                                                                                               |
</div>

<label className="uai-overview-more">
  <input type="checkbox" className="uai-overview-toggle" />

  <span className="uai-overview-more-open"><span className="uai-overview-more-count">Show more</span><Icon icon="chevron-down" size={13} /></span>
  <span className="uai-overview-more-close"><span>Show less</span><Icon icon="chevron-up" size={13} /></span>
</label>

***

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/gagbTTg8B6ywPGFE/images/icons/144/elevenlabs.io.png?fit=max&auto=format&n=gagbTTg8B6ywPGFE&q=85&s=9125f7ed780225d05b6dde1d4ed0e78f" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/elevenlabs.io.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [ElevenLabs Scribe v2 Realtime](https://elevenlabs.io/realtime-speech-to-text)

        <span className="uai-itemcard-byline">ElevenLabs</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Highest-accuracy multilingual streaming</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://elevenlabs.io/realtime-speech-to-text" target="_blank" rel="noreferrer" aria-label="Visit ElevenLabs Scribe v2 Realtime" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit ElevenLabs</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The most accurate streaming model in the benchmark, with clean live partials and wide language support - the default pick when transcript quality matters most.
    </div>

    <div className="uai-itemcard-facts" aria-label="ElevenLabs Scribe v2 Realtime facts">
      <span>Score <strong>100</strong></span>
      <span>Price <strong>{"$0.39/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.141s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-elevenlabs-scribe-v2-realtime-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-elevenlabs-scribe-v2-realtime-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Top-tier final accuracy paired with unusually clean, stable partial transcripts, so words hold their place as you speak instead of rewriting themselves.</li>
            <li>Language coverage is broad and detection is automatic, which makes it the safest choice when accuracy across many languages is the priority.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-elevenlabs-scribe-v2-realtime-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-elevenlabs-scribe-v2-realtime-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It is proprietary and API-only, with no self-host route, and sits at the pricier end of the field.</li>
            <li>Diarization is comparatively weak, so for clean multi-speaker separation you may prefer AssemblyAI or a dedicated diarization step.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-elevenlabs-scribe-v2-realtime-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-elevenlabs-scribe-v2-realtime-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://elevenlabs.io/docs/eleven-api/guides/how-to/speech-to-text/realtime" target="_blank" rel="noreferrer" className="underline underline-offset-2">ElevenLabs Realtime Speech-to-Text API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/O2NMryn9hetXwNok/images/icons/144/cartesia.ai.png?fit=max&auto=format&n=O2NMryn9hetXwNok&q=85&s=e9196f0c86dbe2f714ba8560b24a79ee" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/cartesia.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Cartesia Ink 2](https://docs.cartesia.ai/build-with-cartesia/stt/latest)

        <span className="uai-itemcard-byline">Cartesia</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Accuracy-first voice agents</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.cartesia.ai/build-with-cartesia/stt/latest" target="_blank" rel="noreferrer" aria-label="Visit Cartesia Ink 2" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Cartesia</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Ties for the top accuracy spot and adds genuine semantic endpointing, making it one of the strongest picks built specifically for voice agents.
    </div>

    <div className="uai-itemcard-facts" aria-label="Cartesia Ink 2 facts">
      <span>Score <strong>100</strong></span>
      <span>Price <strong>{"$0.40/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.211s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-cartesia-ink-2-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-cartesia-ink-2-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Final-transcript accuracy is at the very top of the field, and its semantic endpointing judges when you have actually finished a thought rather than just paused.</li>
            <li>That combination makes it one of the most convincing streaming models for building responsive voice agents.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-cartesia-ink-2-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-cartesia-ink-2-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It is English-only, which rules it out for multilingual products, and it is proprietary and API-only.</li>
            <li>If you need broad language coverage, ElevenLabs Scribe v2 or a multilingual model like Qwen3 or Nemotron will serve you better.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-cartesia-ink-2-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-cartesia-ink-2-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.cartesia.ai/build-with-cartesia/stt/latest" target="_blank" rel="noreferrer" className="underline underline-offset-2">Cartesia Speech-to-Text API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/qwen.ai.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=77ec239e207f3d7865895d11af129b39" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/qwen.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Qwen3 ASR Flash Realtime](https://www.alibabacloud.com/help/en/model-studio/real-time-speech-recognition-user-guide)

        <span className="uai-itemcard-byline">Alibaba</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Budget multilingual accuracy</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.alibabacloud.com/help/en/model-studio/real-time-speech-recognition-user-guide" target="_blank" rel="noreferrer" aria-label="Visit Qwen3 ASR Flash Realtime" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Alibaba</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      One of the cheapest ways to get near-top final accuracy, as long as you can live with rough, unstable live partials.
    </div>

    <div className="uai-itemcard-facts" aria-label="Qwen3 ASR Flash Realtime facts">
      <span>Score <strong>98</strong></span>
      <span>Price <strong>{"$0.17/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.476s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-qwen3-asr-flash-realtime-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-qwen3-asr-flash-realtime-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>You get final accuracy close to the best models here at one of the lowest prices in the field, plus strong multilingual and dialect coverage.</li>
            <li>For high-volume, cost-sensitive transcription where the finished transcript matters more than the live feed, it is hard to beat on value.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-qwen3-asr-flash-realtime-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-qwen3-asr-flash-realtime-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Its live partials are rough and unstable - fine if you only consume the final transcript, but a poor fit for interfaces where users watch words appear as they talk.</li>
            <li>For steady live captions, Soniox v5, Cartesia Ink 2, or ElevenLabs are better.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-qwen3-asr-flash-realtime-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-qwen3-asr-flash-realtime-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://www.alibabacloud.com/help/en/model-studio/real-time-speech-recognition-user-guide" target="_blank" rel="noreferrer" className="underline underline-offset-2">Alibaba Cloud Model Studio</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/sV7VJe4pqO2Le0pu/images/icons/144/x.ai.png?fit=max&auto=format&n=sV7VJe4pqO2Le0pu&q=85&s=421f0adc6c1e753bf2ad0cd1661abbc7" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/x.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Grok Speech-to-Text Streaming](https://docs.x.ai/developers/models/speech-to-text)

        <span className="uai-itemcard-byline">SpaceXAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Low-cost streaming with turn detection</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.x.ai/developers/models/speech-to-text" target="_blank" rel="noreferrer" aria-label="Visit Grok Speech-to-Text Streaming" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit SpaceX AI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A cheap newcomer with accurate final transcripts and built-in turn detection, though its live partials lag well behind the accuracy leaders.
    </div>

    <div className="uai-itemcard-facts" aria-label="Grok Speech-to-Text Streaming facts">
      <span>Score <strong>96</strong></span>
      <span>Price <strong>{"$0.20/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.373s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-grok-speech-to-text-streaming-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-grok-speech-to-text-streaming-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Accurate final transcripts and built-in turn detection at a low price, from a newcomer clearly aiming at the voice-agent market.</li>
            <li>If you want inexpensive streaming and mostly care about the committed transcript, it is a credible option worth testing.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-grok-speech-to-text-streaming-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-grok-speech-to-text-streaming-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Like Qwen3, its live partials trail the accuracy leaders, so it is weaker for interfaces that display text as you talk.</li>
            <li>It is also very new, so integrations and tooling are thinner than Deepgram's or AssemblyAI's. Proprietary and API-only.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-grok-speech-to-text-streaming-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-grok-speech-to-text-streaming-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.x.ai/developers/models/speech-to-text" target="_blank" rel="noreferrer" className="underline underline-offset-2">xAI API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/O2NMryn9hetXwNok/images/icons/144/assemblyai.com.png?fit=max&auto=format&n=O2NMryn9hetXwNok&q=85&s=0f393f743b8cac7b8f01a94439e0ea86" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/assemblyai.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [AssemblyAI Universal-3.5 Pro Realtime](https://www.assemblyai.com/blog/contextual-awareness-in-universal-3-5-pro-realtime)

        <span className="uai-itemcard-byline">AssemblyAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Tunable accuracy for voice agents</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://www.assemblyai.com/blog/contextual-awareness-in-universal-3-5-pro-realtime" target="_blank" rel="noreferrer" aria-label="Visit AssemblyAI Universal-3.5 Pro Realtime" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit AssemblyAI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A top-accuracy incumbent with a rare accuracy-versus-latency switch, though diarization is a paid, slower add-on rather than a core strength.
    </div>

    <div className="uai-itemcard-facts" aria-label="AssemblyAI Universal-3.5 Pro Realtime facts">
      <span>Score <strong>93</strong></span>
      <span>Price <strong>{"$0.45/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.445s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-assemblyai-universal-3-5-pro-realtime-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-assemblyai-universal-3-5-pro-realtime-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Among the most accurate streaming models, with an explicit switch between maximum accuracy and minimum latency that few rivals offer, so you can tune the same model to the job.</li>
            <li>Stable, immutable transcripts make it dependable for live captioning.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-assemblyai-universal-3-5-pro-realtime-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-assemblyai-universal-3-5-pro-realtime-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Speaker diarization is a paid add-on and has historically been slower than the core transcription, so multi-speaker work costs more and lags.</li>
            <li>If diarization is central, test it carefully; if raw value matters more, Soniox v5 undercuts it heavily.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-assemblyai-universal-3-5-pro-realtime-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-assemblyai-universal-3-5-pro-realtime-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://www.assemblyai.com/docs/streaming/getting-started/transcribe-streaming-audio" target="_blank" rel="noreferrer" className="underline underline-offset-2">AssemblyAI Streaming API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/fTqNrv6I1z_YE97n/images/icons/144/soniox.com.png?fit=max&auto=format&n=fTqNrv6I1z_YE97n&q=85&s=f4c9424dc4bf92e9a0e9d03f15761111" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/soniox.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Soniox v5 Real-Time](https://soniox.com/docs/stt/models)

        <span className="uai-itemcard-byline">Soniox</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Best price-to-performance streaming</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://soniox.com/docs/stt/models" target="_blank" rel="noreferrer" aria-label="Visit Soniox v5 Real-Time" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Soniox</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The value outlier here - near-top accuracy and among the fastest finals at the lowest price, and still oddly absent from most roundups.
    </div>

    <div className="uai-itemcard-facts" aria-label="Soniox v5 Real-Time facts">
      <span>Score <strong>89</strong></span>
      <span>Price <strong>{"$0.12/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.054s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-soniox-v5-real-time-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-soniox-v5-real-time-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It combines near-top accuracy, among the fastest finals in the field, and the lowest price of any highlighted model, which is a genuinely rare mix.</li>
            <li>There is also a first-party mobile app, so it is one of the few here you can try without writing code.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-soniox-v5-real-time-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-soniox-v5-real-time-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>The main hesitation is maturity: it is a smaller, newer vendor than the incumbents, which matters for risk-averse enterprise buyers.</li>
            <li>Feature depth like advanced diarization is still catching up to AssemblyAI and the larger clouds. Proprietary and API-first.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-soniox-v5-real-time-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-soniox-v5-real-time-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://app.soniox.com/help-center/mobile-app/usage/getting-started" target="_blank" rel="noreferrer" className="underline underline-offset-2">Soniox Mobile App</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://soniox.com/docs/stt/rt/real-time-transcription" target="_blank" rel="noreferrer" className="underline underline-offset-2">Soniox Realtime Speech-to-Text API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/google.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=11e0c725f841c45443116a184b63beac" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/google.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Google Chirp 3 Streaming](https://docs.cloud.google.com/speech-to-text/docs/models/chirp-3)

        <span className="uai-itemcard-byline">Google</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Broad multilingual coverage</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.cloud.google.com/speech-to-text/docs/models/chirp-3" target="_blank" rel="noreferrer" aria-label="Visit Google Chirp 3 Streaming" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Google</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Broad language coverage from a major cloud ASR, but slow finalization and steep list pricing make it hard to recommend for latency-sensitive work.
    </div>

    <div className="uai-itemcard-facts" aria-label="Google Chirp 3 Streaming facts">
      <span>Score <strong>86</strong></span>
      <span>Price <strong>{"$0.24/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>1.276s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-google-chirp-3-streaming-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-google-chirp-3-streaming-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Very broad language coverage plus the enterprise controls - data residency, regional endpoints, compliance - that regulated products often require.</li>
            <li>As a pure recognition model it is accurate across a wide multilingual range, which is its real reason to exist.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-google-chirp-3-streaming-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-google-chirp-3-streaming-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Finalization is the slowest of any model here, which disqualifies it for latency-sensitive voice agents, and its list pricing is steep until you reach very high volume.</li>
            <li>For real-time work, Soniox v5 or Deepgram are far better fits.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-google-chirp-3-streaming-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-google-chirp-3-streaming-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.cloud.google.com/speech-to-text/docs/streaming-recognize" target="_blank" rel="noreferrer" className="underline underline-offset-2">Google Cloud Speech-to-Text API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/openai.com.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=745b8837f7535bc53cd70fc2f7024d58" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/openai.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [OpenAI GPT Realtime Whisper](https://developers.openai.com/api/docs/models/gpt-realtime-whisper)

        <span className="uai-itemcard-byline">OpenAI</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Realtime voice-app transcription</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://developers.openai.com/api/docs/models/gpt-realtime-whisper" target="_blank" rel="noreferrer" aria-label="Visit OpenAI GPT Realtime Whisper" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit OpenAI</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Solid, general-purpose realtime transcription that you pay a heavy premium for - most teams should downshift to a cheaper OpenAI transcribe model.
    </div>

    <div className="uai-itemcard-facts" aria-label="OpenAI GPT Realtime Whisper facts">
      <span>Score <strong>85</strong></span>
      <span>Price <strong>{"$1.02/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.688s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-openai-gpt-realtime-whisper-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-openai-gpt-realtime-whisper-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>General-purpose accuracy that holds up well across everyday speech, delivered through a mature, well-documented realtime interface built for conversational voice apps.</li>
            <li>For products that want transcription which just works without configuration, it is a dependable default.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-openai-gpt-realtime-whisper-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-openai-gpt-realtime-whisper-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It is by far the most expensive option here, and it does not lead on accuracy or latency to justify that premium.</li>
            <li>Most teams should drop to a cheaper transcribe model such as GPT-4o Transcribe, or move to Soniox v5 for value.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-openai-gpt-realtime-whisper-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-openai-gpt-realtime-whisper-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://developers.openai.com/api/docs/models/gpt-realtime-whisper" target="_blank" rel="noreferrer" className="underline underline-offset-2">OpenAI Realtime API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/52KaILwddzz5TNZ_/images/icons/144/inworld.ai.png?fit=max&auto=format&n=52KaILwddzz5TNZ_&q=85&s=3671789f084bb60b5e580245818c545a" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/inworld.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Inworld STT 1 Realtime](https://docs.inworld.ai/stt/overview)

        <span className="uai-itemcard-byline">Inworld</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Cheapest low-latency streaming</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.inworld.ai/stt/overview" target="_blank" rel="noreferrer" aria-label="Visit Inworld STT 1 Realtime" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Inworld</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The cheapest option on this list pairs low latency with built-in turn detection, a strong budget pick for real-time voice work.
    </div>

    <div className="uai-itemcard-facts" aria-label="Inworld STT 1 Realtime facts">
      <span>Score <strong>82</strong></span>
      <span>Price <strong>{"$0.10/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.082s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-inworld-stt-1-realtime-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-inworld-stt-1-realtime-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>The lowest price on the list combined with very low latency is a strong pairing, and built-in turn detection means you get endpointing without bolting on a separate voice-activity step.</li>
            <li>For cost-conscious real-time voice work, it punches above its price.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-inworld-stt-1-realtime-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-inworld-stt-1-realtime-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Accuracy is mid-pack rather than class-leading, so for demanding transcription you will want ElevenLabs, Cartesia, or AssemblyAI.</li>
            <li>It is proprietary and API-only, and as a newer entrant its ecosystem is thinner than the incumbents'.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-inworld-stt-1-realtime-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-inworld-stt-1-realtime-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.inworld.ai/stt/overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Inworld Speech-to-Text API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/mistral.ai.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=d5217a212a6b3a169c776cdf75f6e60b" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/mistral.ai.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Mistral Voxtral Mini Transcribe Realtime](https://docs.mistral.ai/models/model-cards/voxtral-mini-transcribe-realtime-26-02)

        <span className="uai-itemcard-byline">Mistral</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Self-hostable streaming accuracy</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.mistral.ai/models/model-cards/voxtral-mini-transcribe-realtime-26-02" target="_blank" rel="noreferrer" aria-label="Visit Mistral Voxtral Mini Transcribe Realtime" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Mistral</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The standout open-weight pick - it reaches hosted-grade accuracy at low latency and can run on your own GPU, minus diarization and turn detection.
    </div>

    <div className="uai-itemcard-facts" aria-label="Mistral Voxtral Mini Transcribe Realtime facts">
      <span>Score <strong>80</strong></span>
      <span>Price <strong>{"$0.36/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Time to final <strong>0.682s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>The strongest open-weight option here: it reaches hosted-grade accuracy at low, configurable latency and is genuinely multilingual.</li>
            <li>You can call the hosted API or run the weights yourself, which gives you privacy and data control while shifting cost to your own hardware.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>There is no diarization or turn detection in the realtime model, so voice agents need extra components around it. Self-hosting needs a capable GPU, not a laptop, so "open" does not mean effortless.</li>
            <li>Cartesia or Deepgram Flux handle turn-taking natively.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-mistral-voxtral-mini-transcribe-realtime-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.mistral.ai/studio-api/audio/speech_to_text" target="_blank" rel="noreferrer" className="underline underline-offset-2">Mistral Audio Transcription API</a>.</li>
            <li><strong>Run locally</strong> — If you have a high-end machine, you can run it with <a href="https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602" target="_blank" rel="noreferrer" className="underline underline-offset-2">vLLM</a> after downloading weights from <a href="https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/52KaILwddzz5TNZ_/images/icons/144/microsoft.com.png?fit=max&auto=format&n=52KaILwddzz5TNZ_&q=85&s=fc9019cc1050a1467e3173bf01ab7caf" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/microsoft.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Azure AI Speech Real-Time Transcription](https://learn.microsoft.com/en-us/azure/ai-services/speech-service/speech-to-text)

        <span className="uai-itemcard-byline">Microsoft</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Enterprise multilingual transcription</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://learn.microsoft.com/en-us/azure/ai-services/speech-service/speech-to-text" target="_blank" rel="noreferrer" aria-label="Visit Azure AI Speech Real-Time Transcription" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Microsoft</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A mature enterprise ASR with deep customization and compliance features, but it trails the newer wave on latency and real-time value.
    </div>

    <div className="uai-itemcard-facts" aria-label="Azure AI Speech Real-Time Transcription facts">
      <span>Score <strong>80</strong></span>
      <span>Price <strong>{"$0.40/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.625s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-azure-ai-speech-real-time-transcription-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-azure-ai-speech-real-time-transcription-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Deep customization - custom vocabulary, pronunciation, and tuned models - plus broad language support and the compliance and data-handling controls enterprises need.</li>
            <li>For regulated, large-scale deployments that value configurability over raw speed, it remains a serious option.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-azure-ai-speech-real-time-transcription-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-azure-ai-speech-real-time-transcription-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It trails the newer wave on latency and, at standard real-time rates, on price, so it is a weak value pick for greenfield projects.</li>
            <li>For faster or cheaper streaming, Soniox v5, Deepgram, or Inworld are stronger. Proprietary and API-based.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-azure-ai-speech-real-time-transcription-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-azure-ai-speech-real-time-transcription-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>App</strong> — Available in <a href="https://learn.microsoft.com/en-us/azure/ai-services/speech-service/speech-studio-overview" target="_blank" rel="noreferrer" className="underline underline-offset-2">Microsoft Speech Studio</a>.</li>
            <li><strong>API</strong> — Accessible via <a href="https://learn.microsoft.com/en-us/azure/ai-services/speech-service/speech-to-text" target="_blank" rel="noreferrer" className="underline underline-offset-2">Azure AI Speech API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Te6KzZ86-OxPuEC2/images/icons/144/nvidia.com.png?fit=max&auto=format&n=Te6KzZ86-OxPuEC2&q=85&s=da3a69cf52131d76f5aa096d31f1a718" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/nvidia.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [NVIDIA Nemotron 3.5 ASR Streaming 0.6B](https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b)

        <span className="uai-itemcard-byline">NVIDIA</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Self-hosted streaming ASR</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b" target="_blank" rel="noreferrer" aria-label="View NVIDIA Nemotron 3.5 ASR Streaming 0.6B on Hugging Face" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">View on Hugging Face</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The most flexible self-hosted pick - open weights, tunable latency, and multilingual coverage in a compact 0.6B model.
    </div>

    <div className="uai-itemcard-facts" aria-label="NVIDIA Nemotron 3.5 ASR Streaming 0.6B facts">
      <span>Score <strong>79</strong></span>
      <span>Price <strong>{"n/a"}</strong></span>
      <span>License <span className="uai-badge uai-badge--emerald">Open weight</span></span>
      <span>Time to final <strong>0.418s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Open weights with runtime-selectable latency let you dial the accuracy-speed trade without swapping models, and it is multilingual and light enough to self-host at high concurrency.</li>
            <li>Running it yourself keeps audio on your infrastructure and makes cost depend on your hardware rather than an API meter.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>You own the deployment: serving, scaling, and updates are on you, which is real work versus a managed API. Peak accuracy trails the top hosted models.</li>
            <li>If you want open weights without the ops, Voxtral Mini offers a hosted API too.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-nvidia-nemotron-3-5-asr-streaming-0-6b-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://build.nvidia.com/nvidia/nemotron-asr-streaming/api" target="_blank" rel="noreferrer" className="underline underline-offset-2">NVIDIA Build API trial</a>.</li>
            <li><strong>Run locally</strong> — If you have a high-end machine, you can run it with <a href="https://docs.nvidia.com/nim/speech/latest/asr/deploy-asr-models/nemotron-asr-streaming.html" target="_blank" rel="noreferrer" className="underline underline-offset-2">NVIDIA NeMo or Speech NIM</a> after downloading weights from <a href="https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b" target="_blank" rel="noreferrer" className="underline underline-offset-2">Hugging Face</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/O2NMryn9hetXwNok/images/icons/144/aws.amazon.com.png?fit=max&auto=format&n=O2NMryn9hetXwNok&q=85&s=71c98e62e87ab4587dc368301e4ac9e0" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/aws.amazon.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Amazon Transcribe Streaming](https://docs.aws.amazon.com/transcribe/latest/dg/streaming.html)

        <span className="uai-itemcard-byline">Amazon</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Managed enterprise streaming</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://docs.aws.amazon.com/transcribe/latest/dg/streaming.html" target="_blank" rel="noreferrer" aria-label="Visit Amazon Transcribe Streaming" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit AWS</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      A dependable managed streaming service that now trails newer models on accuracy, latency, and price, with little to pull you toward it.
    </div>

    <div className="uai-itemcard-facts" aria-label="Amazon Transcribe Streaming facts">
      <span>Score <strong>74</strong></span>
      <span>Price <strong>{"$0.60/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.620s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-amazon-transcribe-streaming-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-amazon-transcribe-streaming-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>A mature, heavily operated managed service with predictable behavior, custom vocabulary, and the scale and reliability large deployments count on.</li>
            <li>It handles high-volume streaming transcription dependably across a wide set of languages.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-amazon-transcribe-streaming-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-amazon-transcribe-streaming-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It now trails newer models on accuracy and latency while costing more than most, so there is little reason to start here on the merits.</li>
            <li>For better accuracy, latency, or price, Soniox v5, Deepgram, or ElevenLabs all lead it.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-amazon-transcribe-streaming-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-amazon-transcribe-streaming-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://docs.aws.amazon.com/transcribe/latest/APIReference/API_streaming_StartStreamTranscription.html" target="_blank" rel="noreferrer" className="underline underline-offset-2">Amazon Transcribe Streaming API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/deepgram.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=c38be388669369e23390b67010ac681b" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/deepgram.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Deepgram Nova-3](https://developers.deepgram.com/docs/models-languages-overview)

        <span className="uai-itemcard-byline">Deepgram</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Fast voice-agent default</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://developers.deepgram.com/docs/models-languages-overview" target="_blank" rel="noreferrer" aria-label="Visit Deepgram Nova-3" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Deepgram</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      The long-standing voice-agent default: very fast and reliable on clean audio, though newer models have caught and passed it on accuracy.
    </div>

    <div className="uai-itemcard-facts" aria-label="Deepgram Nova-3 facts">
      <span>Score <strong>64</strong></span>
      <span>Price <strong>{"$0.25/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.066s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-nova-3-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-nova-3-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Fast, reliable streaming that made it the long-time default for voice agents, with strong tooling, mature SDKs, and consistent low-latency behavior on clean audio.</li>
            <li>For straightforward English voice pipelines, it is still a safe, well-supported workhorse.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-nova-3-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-nova-3-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>On noisy, accented, or telephony audio its accuracy slips more than the newer leaders, and several models now beat it on final quality.</li>
            <li>If accuracy is the priority, Soniox v5, ElevenLabs, or Cartesia are stronger; for turn-taking, look at Flux.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-nova-3-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-nova-3-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://developers.deepgram.com/docs/live-streaming-audio" target="_blank" rel="noreferrer" className="underline underline-offset-2">Deepgram Live Streaming API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

<div className="uai-itemcard" role="article">
  <div className="uai-itemcard-head">
    <span className="uai-itemcard-icon">
      <img src="https://mintcdn.com/usefulai/Ez-pJDkPpztLE7Cr/images/icons/144/deepgram.com.png?fit=max&auto=format&n=Ez-pJDkPpztLE7Cr&q=85&s=c38be388669369e23390b67010ac681b" alt="" noZoom loading="lazy" width="144" height="144" data-path="images/icons/144/deepgram.com.png" />
    </span>

    <div className="uai-itemcard-identity">
      <div className="uai-itemcard-row uai-itemcard-row--title">
        ## [Deepgram Flux General EN](https://developers.deepgram.com/docs/flux/quickstart)

        <span className="uai-itemcard-byline">Deepgram</span>
      </div>

      <div className="uai-itemcard-row">
        <span className="uai-itemcard-note uai-itemcard-note--blue">Fastest endpointing for agents</span>
      </div>
    </div>

    <div className="uai-itemcard-end">
      <a href="https://developers.deepgram.com/docs/flux/quickstart" target="_blank" rel="noreferrer" aria-label="Visit Deepgram Flux General EN" className="uai-itemcard-cta uai-itemcard-cta--blue no-underline">Visit Deepgram</a>
    </div>
  </div>

  <div className="uai-itemcard-body">
    <div className="uai-itemcard-summary">
      Built for turn-taking rather than raw accuracy - it delivers the fastest finals and fused end-of-turn detection, a deliberate voice-agent trade.
    </div>

    <div className="uai-itemcard-facts" aria-label="Deepgram Flux General EN facts">
      <span>Score <strong>55</strong></span>
      <span>Price <strong>{"$0.34/hour"}</strong></span>
      <span>License <span className="uai-badge uai-badge--zinc">Proprietary</span></span>
      <span>Time to final <strong>0.021s</strong></span>
    </div>

    <div className="uai-itemcard-details-group">
      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-flux-general-en-strengths" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-flux-general-en-strengths"><span>Strengths</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>Purpose-built for conversational turn-taking: it fuses transcription with end-of-turn detection and delivers the fastest finals in the field, so agents can respond the moment you actually stop talking.</li>
            <li>For latency-critical voice agents, that focus is the whole point.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-flux-general-en-tradeoffs" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-flux-general-en-tradeoffs"><span>Tradeoffs</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li>It is English-only in this model, and on final-transcript accuracy it sits at the back of this list, so transcription-quality work is better served elsewhere.</li>
            <li>For higher accuracy, look at Soniox v5 or ElevenLabs; for multilingual, choose a different model entirely.</li>
          </ul>
        </div>
      </div>

      <div className="uai-itemcard-details">
        <input type="checkbox" id="real-time-transcription-deepgram-flux-general-en-how-to-access" className="uai-itemcard-details-toggle" />

        <label htmlFor="real-time-transcription-deepgram-flux-general-en-how-to-access"><span>How to access</span><span className="uai-itemcard-details-chevron" /></label>

        <div className="uai-itemcard-details-body">
          <ul>
            <li><strong>API</strong> — Accessible via <a href="https://developers.deepgram.com/docs/flux/quickstart" target="_blank" rel="noreferrer" className="underline underline-offset-2">Deepgram Flux API</a>.</li>
          </ul>
        </div>
      </div>
    </div>
  </div>
</div>

***

## How to Choose

When choosing between these models, consider:

* **Access:** Decide first whether you need a managed API, a first-party app, or a self-hosted model, because that choice drives cost, privacy, latency, and setup work. Most models here are API-only. Only Voxtral Mini and Nemotron 3.5 offer a real self-host route, and Soniox and Azure add a first-party app or portal for trying the model without code.
* **Quality:** We use final-transcript accuracy from the Artificial Analysis streaming benchmark, scored 0-100 where higher is better. Watch the partial-versus-final split: a few models (Qwen3, Grok) produce excellent final transcripts but rough live partials, which is invisible in a single accuracy number and matters if users watch text appear as they speak.
* **Price:** We compare on price per hour of streaming audio. Streaming costs more than batch, committed and volume tiers swing prices widely, and features like diarization are often billed on top - so confirm the tier and add-ons before you budget.
* **Time to final transcript:** This is seconds from the end of speech to the final transcript; lower matters most for voice agents, where the practical target is a sub-500ms end-to-end response. Raw latency is only half of it - how well a model detects that a speaker has finished (its endpointing) shapes the felt responsiveness just as much.

For most teams building voice agents, start with Soniox v5 for value, Cartesia Ink 2 or Deepgram Flux when turn-taking is the hard part, and ElevenLabs Scribe v2 when transcript quality outweighs everything. For private or offline deployments, Voxtral Mini and Nemotron 3.5 are the two open-weight picks worth real testing.

***

## Other Models We Considered

<div className="not-prose my-4 flex flex-col gap-1.5 uai-article-prose text-zinc-700 dark:text-zinc-300">
  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/openai.com.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=21ac965dc6ee5751127e6d435043629b" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/openai.com.png" /><a href="https://developers.openai.com/api/docs/models/gpt-4o-transcribe" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">OpenAI GPT-4o Transcribe</a> <span className="uai-ink-muted">(OpenAI)</span> — Cheaper OpenAI transcription than the realtime model, capable but not latency-first.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/BapVfRsLI8g6LXdP/images/icons/48/speechmatics.com.png?fit=max&auto=format&n=BapVfRsLI8g6LXdP&q=85&s=cff366ecfaac9171cfb6b60a74a5fdcd" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/speechmatics.com.png" /><a href="https://docs.speechmatics.com/speech-to-text/models" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Speechmatics Realtime Enhanced</a> <span className="uai-ink-muted">(Speechmatics)</span> — Strong multilingual and enterprise specialist, but final accuracy trails the leaders.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/BapVfRsLI8g6LXdP/images/icons/48/smallest.ai.png?fit=max&auto=format&n=BapVfRsLI8g6LXdP&q=85&s=81d8e83f1c6ea881cdca2824662b495f" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/smallest.ai.png" /><a href="https://docs.smallest.ai/waves/v-4-0-0/model-cards/speech-to-text/pulse" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Smallest Pulse</a> <span className="uai-ink-muted">(Smallest.ai)</span> — Very fast finalization, but accuracy and pricing trail the top value picks.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/openai.com.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=21ac965dc6ee5751127e6d435043629b" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/openai.com.png" /><a href="https://huggingface.co/openai/whisper-large-v3" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">OpenAI Whisper Large v3</a> <span className="uai-ink-muted">(OpenAI)</span> — A great open local baseline, but not truly streaming without wrappers.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/nvidia.com.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=a4db231e3535440e4b967473be5ffb18" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/nvidia.com.png" /><a href="https://huggingface.co/nvidia/parakeet-unified-en-0.6b" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">NVIDIA Parakeet Unified EN 0.6B</a> <span className="uai-ink-muted">(NVIDIA)</span> — Local favorite for accuracy and speed, but English-only and GPU-bound.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/huggingface.co.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=760541dee73285f3eb28c4ced26d9a3c" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/huggingface.co.png" /><a href="https://kyutai.org/stt/" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Kyutai STT</a> <span className="uai-ink-muted">(Kyutai)</span> — Open streaming that runs on a typical machine, but no managed API.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/huggingface.co.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=760541dee73285f3eb28c4ced26d9a3c" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/huggingface.co.png" /><a href="https://github.com/moonshine-ai/moonshine" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Moonshine v2 Streaming</a> <span className="uai-ink-muted">(Moonshine AI)</span> — On-device streaming for CPU and phones, but off-benchmark with no managed API.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/BapVfRsLI8g6LXdP/images/icons/48/gladia.io.png?fit=max&auto=format&n=BapVfRsLI8g6LXdP&q=85&s=cc9adc87837e6901260b505f97ed2e00" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/gladia.io.png" /><a href="https://docs.gladia.io/api-reference/v2/live/init" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Gladia Solaria 1 Realtime</a> <span className="uai-ink-muted">(Gladia)</span> — A recognizable API option, but the slowest finalization in the benchmark.</span>
  </span>

  <span className="flex items-baseline gap-2.5">
    <span aria-hidden="true" className="relative -top-0.5 inline-block h-1.5 w-1.5 shrink-0 rounded-full bg-zinc-300 dark:bg-zinc-600" />

    <span><img src="https://mintcdn.com/usefulai/C5xOaAf4Os-Vu41o/images/icons/48/huggingface.co.png?fit=max&auto=format&n=C5xOaAf4Os-Vu41o&q=85&s=760541dee73285f3eb28c4ced26d9a3c" alt="" noZoom className="relative -top-px mr-1 inline h-4 w-4 rounded-sm object-contain" width="48" height="48" data-path="images/icons/48/huggingface.co.png" /><a href="https://docs.rev.ai/api/streaming" target="_blank" rel="noreferrer" className="font-medium text-zinc-950 underline underline-offset-2 dark:text-white">Rev AI Streaming</a> <span className="uai-ink-muted">(Rev AI)</span> — An established, affordable baseline, but the weakest accuracy among current models.</span>
  </span>
</div>

***

## Frequently Asked Questions

<AccordionGroup>
  <Accordion title={"What is the best real-time transcription model right now?"}>
    For pure transcript quality, ElevenLabs Scribe v2 Realtime and Cartesia Ink 2 lead on accuracy. But the model most teams should try first is Soniox v5, which pairs near-top accuracy with among the fastest finals at the lowest price on this list.
  </Accordion>

  <Accordion title={"What is the best real-time transcription model for most people?"}>
    Soniox v5 Real-Time. It is the rare model that is accurate, fast, and cheap at the same time, and there is a first-party app if you want to try it before writing any code. Move to ElevenLabs or Cartesia only when transcript quality has to be the best available.
  </Accordion>

  <Accordion title={"Is Whisper a real-time transcription model?"}>
    Not really. OpenAI's original Whisper is batch-native - it processes fixed audio chunks, so "streaming" wrappers repeatedly recompute overlapping windows, which is slow and jittery. If you want real streaming, use a streaming-native model such as Voxtral Mini Transcribe Realtime, Nemotron 3.5 ASR Streaming, or Kyutai STT.
  </Accordion>

  <Accordion title={"What is the best real-time transcription model you can run locally?"}>
    Voxtral Mini Transcribe Realtime is the strongest open-weight pick, though it needs a capable GPU. Nemotron 3.5 ASR Streaming is smaller but still needs the supported high-end NVIDIA stack. For ordinary-machine or phone deployments, Kyutai STT and Moonshine v2 are the more practical options.
  </Accordion>

  <Accordion title={"What is the best model for voice agents?"}>
    It depends on the hard part. If turn-taking and endpointing are what break your agent, Deepgram Flux fuses transcription with end-of-turn detection and delivers the fastest finals. If you want accuracy plus native endpointing, Cartesia Ink 2 is excellent. For the best overall value, Soniox v5.
  </Accordion>

  <Accordion title={"Is Deepgram Flux better than Nova-3?"}>
    They are built for different jobs. Flux is tuned for conversational turn-taking and the fastest possible finals, which is what voice agents need. Nova-3 is the general-purpose streaming workhorse and scores higher on final-transcript accuracy in our benchmark. Choose Flux for responsiveness, Nova-3 for broader transcription.
  </Accordion>

  <Accordion title={"Do these benchmark scores match real-world use?"}>
    Treat them as a strong starting point, not a guarantee. The benchmark covers English-language audio and does not directly measure 8kHz telephony, multilingual quality, diarization, or full voice-agent latency, so your own workload can reorder the results. Always test the shortlist on your own audio before committing.
  </Accordion>
</AccordionGroup>
