Die Preise von Deepgram beginnen bei 0,0048 $ pro Minute für Nova-3 Monolingual Streaming, mit separaten Raten für mehrsprachige Transkription, Batch-Verarbeitung, Text-to-Speech und Voice Agents. Doch der Minutenpreis ist nur ein Teil der Kosten. Add-ons, LLM-Nutzung, TTS, Telefonie und Entwicklungsaufwand können Ihre Gesamtausgaben zusätzlich erhöhen.
Für Großunternehmen ist die wichtigere Frage, ob Sie Sprachtechnologie oder den gesamten Workflow darum herum kalkulieren. Deepgram ist eine Komponente eines Voice-Stacks, während Plattformen wie HappyRobot KI-Mitarbeitende, Orchestrierung, Integrationen und weitere Infrastruktur vereinen, um operative Workflows End-to-End auszuführen.
Dieser Leitfaden schlüsselt die aktuellen Preise von Deepgram und die tatsächlichen Kosten auf.
Hinweis: Preise im August 2026 geprüft und Änderungen unterworfen.
So funktioniert die Preisgestaltung von Deepgram
Deepgram setzt auf nutzungsbasierte Preise: Pay As You Go erfordert keine Mindestabnahme, Growth beginnt bei 4.000 $+ pro Jahr mit Prepaid-Guthaben und Rabatten von bis zu 20 %. Preise für Großunternehmen erhalten Sie über den Vertrieb.

Deepgram berechnet Speech-to-Text nach der tatsächlichen Audiodauer, anstatt jede Anfrage auf eine volle Minute aufzurunden. Laut Preisseite kostet eine 14-sekündige Datei genau 14 Sekunden Nutzung.
Das Startguthaben von 200 $ gilt für neue Konten und verfällt nicht, bis es verbraucht ist. Growth-Kunden erhalten Prepaid-Guthaben, während Enterprise-Kunden Konditionen zu Volumen, Bereitstellung, Support und weiteren Anforderungen verhandeln können.
Deepgram Preise pro Minute nach Modell
Die folgende Tabelle zeigt die aktuellen Deepgram-Raten mit Stand August 2026. Als Aktionspreise gekennzeichnete Streaming-Raten können sich ändern, 2026; Raten für aufgezeichnete Audios werden separat berechnet.
| Model | Streaming Rate | Batch / Pre-Recorded Rate | Best Suited For |
|---|---|---|---|
| Nova-3 Monolingual | $0.0048/min PAYG; $0.0042/min Growth (promotional) | $0.0043/min PAYG; $0.0036/min Growth | General-purpose transcription |
| Nova-3 Multilingual | $0.0058/min PAYG; $0.0050/min Growth (promotional) | $0.0052/min PAYG; $0.0043/min Growth | Multilingual transcription and automatic language detection |
| Flux English | $0.0065/min PAYG; $0.0057/min Growth (promotional) | N/A | Real-time English voice agents with built-in turn detection |
| Flux Multilingual | $0.0078/min PAYG; $0.0068/min Growth | N/A | Real-time multilingual voice agents |
| Aura-2 TTS | N/A | $0.030 per 1K characters PAYG; $0.027 per 1K characters Growth | Higher-quality text-to-speech |
| Aura-1 TTS | N/A | $0.015 per 1K characters PAYG; $0.0135 per 1K characters Growth | Lower-cost text-to-speech |
| Voice Agent API — Standard | $0.056/min through Sept. 12; $0.075/min thereafter PAYG | N/A | Managed real-time voice agents |
| Voice Agent API — Standard, BYO TTS | $0.065/min PAYG; $0.051/min Growth | N/A | Voice agents using your own TTS |
| Voice Agent API — Custom, BYO LLM | $0.050/min through Sept. 12; $0.065/min thereafter PAYG; Growth $0.059/min | N/A | Voice agents using your own LLM |
| Voice Agent API — Custom, BYO LLM + TTS | $0.050/min PAYG; $0.041/min Growth | N/A | Maximum control over model components |
| Voice Agent API — Advanced | $0.122/min through Sept. 12; $0.163/min thereafter PAYG; Growth $0.146/min | N/A | Advanced production voice-agent requirements |
| Voice Agent API — Advanced, BYO TTS | $0.122/min PAYG; $0.110/min Growth | N/A | Advanced agents using your own TTS |
Nova-3 ist die STT-Familie von Deepgram für allgemeine Zwecke, während Flux speziell für dialogorientierte Voice Agents entwickelt wurde und eine modellintegrierte Sprecherwechsel-Erkennung enthält. Aura-1 und Aura-2 übernehmen Text-to-Speech und werden nach Zeichen statt nach Audiominuten abgerechnet.
Die Voice Agent API bietet die Tarife Standard und Advanced, sowie einen Custom-Tarif für die Nutzung eines eigenen LLM. BYO-Optionen verändern die Rate deutlich: Deepgram weist separate Preise für BYO TTS und BYO LLM + TTS aus – betrachten Sie den beworbenen Preis der Voice Agent API daher nicht als Preis für jede Konfiguration.
Was die Add-ons von Deepgram kosten
Deepgram berechnet mehrere STT-Funktionen separat, darunter Redaction, Keyterm Prompting, Entity Detection und Speaker Diarization. Smart Formatting ist inbegriffen.

Die genauen Add-on-Raten hängen davon ab, ob Sie Streaming oder aufgezeichnete Audios verwenden. Die aktuell veröffentlichten Raten für die wichtigsten Streaming-Add-ons bei Pay As You Go lauten:
- 0,0020 $/Min. für Redaction
- 0,0013 $/Min. für Keyterm Prompting
- 0,0017 $/Min. für Entity Detection
- 0,0020 $/Min. für Speaker Diarization
Nehmen wir zum Beispiel an, Sie verarbeiten 10.000 Minuten Nova-3 Monolingual Streaming und Sie benötigen Redaction, Keyterm Prompting und Speaker Diarization:
| Cost Component | Rate | 10,000-minute cost |
|---|---|---|
| Nova-3 Monolingual | $0.0048/min | $48.00 |
| Redaction | $0.0020/min | $20.00 |
| Keyterm Prompting | $0.0013/min | $13.00 |
| Speaker Diarization | $0.0020/min | $20.00 |
| Total | $0.0101/min effective | $101.00 |
Damit belaufen sich die effektiven STT-Kosten auf 0,0101 $ pro Minute, also mehr als das Doppelte des Nova-3-Basistarifs. Das gleiche Muster gilt bei größeren Volumina: Ein scheinbar kleines Add-on kann den effektiven Minutenpreis spürbar verändern, wenn es bei jedem Anruf genutzt wird.
Kostenloses Guthaben – und was Sie damit tatsächlich erhalten
Neue Deepgram-Konten erhalten 200 $ Startguthaben. Beim aktuellen Nova-3-Monolingual-Streaming-Tarif von 0,0048 $/Min. entspricht das rund 41.667 Minuten:
200 $ ÷ 0,0048 $ = 41.667 Minuten, also etwa 694 Stunden Transkription.
Beim Tarif von 0,0043 $/Min. für aufgezeichnete Inhalte deckt dasselbe Guthaben rund 46.512 Minuten, also 775 Stunden, ab. Add-ons verringern diese Werte, da sie zusätzliches Nutzungsguthaben verbrauchen.
Deepgram-Preise im Vergleich zu Alternativen
Einen echten Eins-zu-eins-Vergleich der Tarife gibt es bei Speech-APIs nicht, da die Anbieter Funktionen bündeln und unterschiedliche Streaming- und Batch-Produkte anbieten. Die Tabelle bietet einen Vergleich der Preislisten, kein Qualitätsranking.
| Provider | Streaming Rate | Batch Rate | Free Tier | Notable Trade-off |
|---|---|---|---|---|
| Deepgram | From $0.0048/min for Nova-3 Monolingual | From $0.0043/min | $200 credit | Add-ons such as diarization, redaction, and keyterm prompting can increase the effective STT cost. |
| AssemblyAI | $0.0075/min for Universal-3.5 Pro Realtime | $0.0035/min for Universal-3.5 Pro | $50 credit | Streaming and feature pricing differ from async; realtime add-ons are charged only when used. |
| OpenAI Whisper API | N/A | $0.006/min | No dedicated free tier | Whisper is not a streaming STT model |
| Google Cloud Speech-to-Text | From $0.016/min for standard V2 recognition | From $0.003/min for Dynamic Batch | 60 min/month | Cloud billing, tiers, and request-level pricing can complicate comparisons. cloud |
| ElevenLabs Scribe | $0.0065/min for Scribe v2 Realtime | $0.00367/min for Scribe v2 | 10,000 credits | Credits are shared across ElevenLabs products, so TTS or other usage can reduce available STT capacity |
Die oben genannten Tarife sind aus den veröffentlichten Preisen der jeweiligen Anbieter normalisiert und stellen keine Behauptung dar, dass die Produkte identische Funktionen bieten.
- AssemblyAI gibt Universal-3.5 Pro Realtime mit 0,45 $/Stunde und Async mit 0,21 $/Stunde an
- OpenAI listet Whisper mit 0,006 $/Minute
- Google listet die Standard-V2-Erkennung ab 0,016 $/Minute und Dynamic Batch ab 0,003 $/Minute
- ElevenLabs listet Scribe v2 mit 0,22 $/Stunde und Scribe v2 Realtime mit 0,39 $/Stunde.
Diese Tabelle bepreist die API-Ebene. Whisper selbst zu betreiben wirkt günstiger als jeder Tarif darin, weil es kostenlos ist. Das gilt genau so lange, bis Ihr Volumen wächst.
Ab einem bestimmten Punkt besteht die tatsächliche Rechnung aus GPU-Stunden, Entwicklungszeit, Speicher und Redundanz – und nichts davon hat einen Listenpreis. Dieser Vergleich von KI-Transkriptionssoftware zeigt, wo diese Grenze für das jeweilige Tool liegt.
Was eine vollständige Voice-Bereitstellung wirklich kostet
Ein produktiver Voice-Agent kostet mehr als sein STT-Anbieter, denn STT ist nur eine Ebene des Stacks. Ein realistisches Kostenmodell umfasst Spracherkennung, LLM-Inferenz, Text-to-Speech, Telefonie, Orchestrierung und den Entwicklungsaufwand, damit diese Bausteine zuverlässig zusammenspielen.
Stellen Sie sich beispielsweise 10.000 Minuten monatliches Sprachvolumen mit Nova-3 zu 0,0048 $/Min. vor. Die STT-Position beträgt vor Add-ons lediglich 48 $ pro Monat. Mit Redaction, Keyterm Prompting und Diarization steigt die STT-Summe auf 101 $.
Der Rest der Rechnung entfällt auf die übrigen Ebenen:
- LLM-Inferenz: Jede Konversation erfordert Modellverarbeitung, deren Kosten vom Modell, vom Token-Volumen, von der Kontextlänge und vom Antwortmuster abhängen.
- TTS: Generierte Sprachausgabe wird bei Nutzung der Aura-Modelle von Deepgram separat nach Zeichen abgerechnet.
- Telefonie: Telefonnummern, Inbound- und Outbound-Anrufe, Gebühren der Telefonanbieter und Aufzeichnungen können außerhalb der Rechnung für die KI-API anfallen.
- Orchestrierung: Ihre Anwendung muss Status, Tools, Routing, Authentifizierung, Wiederholungsversuche und Integrationen verwalten.
- Engineering: Turn-Erkennung, Umgang mit Unterbrechungen, Failover, Latenzüberwachung, Tests, Evaluierung, Logging und Debugging im Produktivbetrieb erfordern alle Engineering-Zeit.
Deshalb kann der Vergleich von Sprach-Bereitstellungen allein anhand eines STT-Preises pro Minute ein irreführendes Bild ergeben. Die API kann günstig sein – das System, das um sie herum entsteht, ist es nicht zwangsläufig.
Wann Komponenten kaufen und wann eine Plattform?
Bauen Sie direkt mit APIs, wenn Sie bereits ein Voice-Engineering-Team haben, einen relativ eng umrissenen Anwendungsfall verfolgen und die Kontrolle über einzelne Modelle und die Infrastruktur behalten wollen.
Selbst entwickeln ist sinnvoll, wenn Sie:
- Entwickler haben, die den Voice-Stack verantworten können.
- Umfassende Kontrolle über Modelle und Routing benötigen.
- Einen Anwendungsfall haben, der sich selten ändert.
- Die Infrastruktur problemlos selbst betreiben können.
Eine Plattform ist sinnvoller, wenn Sie:
- Produktionsreife Sprachagenten für unterschiedliche Akzente, Audiobedingungen und Workflows benötigen.
- Zuverlässigkeit, Monitoring, Compliance und Integrationen benötigen, ohne jede Ebene selbst zu entwickeln.
- In Wochen statt Monaten vom Pilotprojekt in den Produktivbetrieb wechseln wollen.
- Die Kosten und die operative Komplexität der gesamten Bereitstellung im Blick haben, nicht nur den STT-Posten.
Für Teams, die eine gemanagte Belegschaft wollen statt die einzelnen Komponenten selbst zusammenzusetzen, bietet die Voice AI-Plattform von HappyRobot die umfassendere Bereitstellungsebene rund um Sprachagenten.




