Deepgram Preise erklärt: Tarife, Raten & Kosten für Voice Agents

Was kostet Deepgram? Die Preise starten bei 0,0048 $/Min. für Nova-3-Streaming. Vergleich von STT-, TTS- und Voice Agent API-Tarifen, Guthaben, Add-ons und Kosten.

Gonzalo Ybanez
Gonzalo Ybáñez
Growth Strategist
Aktualisiert am 22. Sept. 20266 Min. Lesezeit
Beitragsbild Deepgram Preise
Zum Abschnitt springen

Die Preise von Deepgram beginnen bei 0,0048 $ pro Minute für Nova-3 Monolingual Streaming, mit separaten Raten für mehrsprachige Transkription, Batch-Verarbeitung, Text-to-Speech und Voice Agents. Doch der Minutenpreis ist nur ein Teil der Kosten. Add-ons, LLM-Nutzung, TTS, Telefonie und Entwicklungsaufwand können Ihre Gesamtausgaben zusätzlich erhöhen.

Für Großunternehmen ist die wichtigere Frage, ob Sie Sprachtechnologie oder den gesamten Workflow darum herum kalkulieren. Deepgram ist eine Komponente eines Voice-Stacks, während Plattformen wie HappyRobot KI-Mitarbeitende, Orchestrierung, Integrationen und weitere Infrastruktur vereinen, um operative Workflows End-to-End auszuführen.

Dieser Leitfaden schlüsselt die aktuellen Preise von Deepgram und die tatsächlichen Kosten auf.

Hinweis: Preise im August 2026 geprüft und Änderungen unterworfen.

So funktioniert die Preisgestaltung von Deepgram

Deepgram setzt auf nutzungsbasierte Preise: Pay As You Go erfordert keine Mindestabnahme, Growth beginnt bei 4.000 $+ pro Jahr mit Prepaid-Guthaben und Rabatten von bis zu 20 %. Preise für Großunternehmen erhalten Sie über den Vertrieb.

Deepgram Preisseite

Deepgram berechnet Speech-to-Text nach der tatsächlichen Audiodauer, anstatt jede Anfrage auf eine volle Minute aufzurunden. Laut Preisseite kostet eine 14-sekündige Datei genau 14 Sekunden Nutzung.

Das Startguthaben von 200 $ gilt für neue Konten und verfällt nicht, bis es verbraucht ist. Growth-Kunden erhalten Prepaid-Guthaben, während Enterprise-Kunden Konditionen zu Volumen, Bereitstellung, Support und weiteren Anforderungen verhandeln können.

Deepgram Preise pro Minute nach Modell

Die folgende Tabelle zeigt die aktuellen Deepgram-Raten mit Stand August 2026. Als Aktionspreise gekennzeichnete Streaming-Raten können sich ändern, 2026; Raten für aufgezeichnete Audios werden separat berechnet.

ModelStreaming RateBatch / Pre-Recorded RateBest Suited For
Nova-3 Monolingual$0.0048/min PAYG; $0.0042/min Growth (promotional)$0.0043/min PAYG; $0.0036/min GrowthGeneral-purpose transcription
Nova-3 Multilingual$0.0058/min PAYG; $0.0050/min Growth (promotional)$0.0052/min PAYG; $0.0043/min GrowthMultilingual transcription and automatic language detection
Flux English$0.0065/min PAYG; $0.0057/min Growth (promotional)N/AReal-time English voice agents with built-in turn detection
Flux Multilingual$0.0078/min PAYG; $0.0068/min GrowthN/AReal-time multilingual voice agents
Aura-2 TTSN/A$0.030 per 1K characters PAYG; $0.027 per 1K characters GrowthHigher-quality text-to-speech
Aura-1 TTSN/A$0.015 per 1K characters PAYG; $0.0135 per 1K characters GrowthLower-cost text-to-speech
Voice Agent API — Standard$0.056/min through Sept. 12; $0.075/min thereafter PAYGN/AManaged real-time voice agents
Voice Agent API — Standard, BYO TTS$0.065/min PAYG; $0.051/min GrowthN/AVoice agents using your own TTS
Voice Agent API — Custom, BYO LLM$0.050/min through Sept. 12; $0.065/min thereafter PAYG; Growth $0.059/minN/AVoice agents using your own LLM
Voice Agent API — Custom, BYO LLM + TTS$0.050/min PAYG; $0.041/min GrowthN/AMaximum control over model components
Voice Agent API — Advanced$0.122/min through Sept. 12; $0.163/min thereafter PAYG; Growth $0.146/minN/AAdvanced production voice-agent requirements
Voice Agent API — Advanced, BYO TTS$0.122/min PAYG; $0.110/min GrowthN/AAdvanced agents using your own TTS

Nova-3 ist die STT-Familie von Deepgram für allgemeine Zwecke, während Flux speziell für dialogorientierte Voice Agents entwickelt wurde und eine modellintegrierte Sprecherwechsel-Erkennung enthält. Aura-1 und Aura-2 übernehmen Text-to-Speech und werden nach Zeichen statt nach Audiominuten abgerechnet.

Die Voice Agent API bietet die Tarife Standard und Advanced, sowie einen Custom-Tarif für die Nutzung eines eigenen LLM. BYO-Optionen verändern die Rate deutlich: Deepgram weist separate Preise für BYO TTS und BYO LLM + TTS aus – betrachten Sie den beworbenen Preis der Voice Agent API daher nicht als Preis für jede Konfiguration.

Was die Add-ons von Deepgram kosten

Deepgram berechnet mehrere STT-Funktionen separat, darunter Redaction, Keyterm Prompting, Entity Detection und Speaker Diarization. Smart Formatting ist inbegriffen.

Preise der Deepgram-Add-ons, insbesondere Speech-to-Text

Die genauen Add-on-Raten hängen davon ab, ob Sie Streaming oder aufgezeichnete Audios verwenden. Die aktuell veröffentlichten Raten für die wichtigsten Streaming-Add-ons bei Pay As You Go lauten:

  • 0,0020 $/Min. für Redaction
  • 0,0013 $/Min. für Keyterm Prompting
  • 0,0017 $/Min. für Entity Detection
  • 0,0020 $/Min. für Speaker Diarization

Nehmen wir zum Beispiel an, Sie verarbeiten 10.000 Minuten Nova-3 Monolingual Streaming und Sie benötigen Redaction, Keyterm Prompting und Speaker Diarization:

Cost ComponentRate10,000-minute cost
Nova-3 Monolingual$0.0048/min$48.00
Redaction$0.0020/min$20.00
Keyterm Prompting$0.0013/min$13.00
Speaker Diarization$0.0020/min$20.00
Total$0.0101/min effective$101.00

Damit belaufen sich die effektiven STT-Kosten auf 0,0101 $ pro Minute, also mehr als das Doppelte des Nova-3-Basistarifs. Das gleiche Muster gilt bei größeren Volumina: Ein scheinbar kleines Add-on kann den effektiven Minutenpreis spürbar verändern, wenn es bei jedem Anruf genutzt wird.

Kostenloses Guthaben – und was Sie damit tatsächlich erhalten

Neue Deepgram-Konten erhalten 200 $ Startguthaben. Beim aktuellen Nova-3-Monolingual-Streaming-Tarif von 0,0048 $/Min. entspricht das rund 41.667 Minuten:

200 $ ÷ 0,0048 $ = 41.667 Minuten, also etwa 694 Stunden Transkription.

Beim Tarif von 0,0043 $/Min. für aufgezeichnete Inhalte deckt dasselbe Guthaben rund 46.512 Minuten, also 775 Stunden, ab. Add-ons verringern diese Werte, da sie zusätzliches Nutzungsguthaben verbrauchen.

Deepgram-Preise im Vergleich zu Alternativen

Einen echten Eins-zu-eins-Vergleich der Tarife gibt es bei Speech-APIs nicht, da die Anbieter Funktionen bündeln und unterschiedliche Streaming- und Batch-Produkte anbieten. Die Tabelle bietet einen Vergleich der Preislisten, kein Qualitätsranking.

ProviderStreaming RateBatch RateFree TierNotable Trade-off
DeepgramFrom $0.0048/min for Nova-3 MonolingualFrom $0.0043/min$200 creditAdd-ons such as diarization, redaction, and keyterm prompting can increase the effective STT cost.
AssemblyAI$0.0075/min for Universal-3.5 Pro Realtime$0.0035/min for Universal-3.5 Pro$50 creditStreaming and feature pricing differ from async; realtime add-ons are charged only when used. 
OpenAI Whisper APIN/A$0.006/minNo dedicated free tierWhisper is not a streaming STT model
Google Cloud Speech-to-TextFrom $0.016/min for standard V2 recognitionFrom $0.003/min for Dynamic Batch60 min/monthCloud billing, tiers, and request-level pricing can complicate comparisons. cloud
ElevenLabs Scribe$0.0065/min for Scribe v2 Realtime$0.00367/min for Scribe v210,000 creditsCredits are shared across ElevenLabs products, so TTS or other usage can reduce available STT capacity

Die oben genannten Tarife sind aus den veröffentlichten Preisen der jeweiligen Anbieter normalisiert und stellen keine Behauptung dar, dass die Produkte identische Funktionen bieten.

  • AssemblyAI gibt Universal-3.5 Pro Realtime mit 0,45 $/Stunde und Async mit 0,21 $/Stunde an
  • OpenAI listet Whisper mit 0,006 $/Minute
  • Google listet die Standard-V2-Erkennung ab 0,016 $/Minute und Dynamic Batch ab 0,003 $/Minute
  • ElevenLabs listet Scribe v2 mit 0,22 $/Stunde und Scribe v2 Realtime mit 0,39 $/Stunde.

Diese Tabelle bepreist die API-Ebene. Whisper selbst zu betreiben wirkt günstiger als jeder Tarif darin, weil es kostenlos ist. Das gilt genau so lange, bis Ihr Volumen wächst.

Ab einem bestimmten Punkt besteht die tatsächliche Rechnung aus GPU-Stunden, Entwicklungszeit, Speicher und Redundanz – und nichts davon hat einen Listenpreis. Dieser Vergleich von KI-Transkriptionssoftware zeigt, wo diese Grenze für das jeweilige Tool liegt.


Was eine vollständige Voice-Bereitstellung wirklich kostet

Ein produktiver Voice-Agent kostet mehr als sein STT-Anbieter, denn STT ist nur eine Ebene des Stacks. Ein realistisches Kostenmodell umfasst Spracherkennung, LLM-Inferenz, Text-to-Speech, Telefonie, Orchestrierung und den Entwicklungsaufwand, damit diese Bausteine zuverlässig zusammenspielen.

Stellen Sie sich beispielsweise 10.000 Minuten monatliches Sprachvolumen mit Nova-3 zu 0,0048 $/Min. vor. Die STT-Position beträgt vor Add-ons lediglich 48 $ pro Monat. Mit Redaction, Keyterm Prompting und Diarization steigt die STT-Summe auf 101 $.

Der Rest der Rechnung entfällt auf die übrigen Ebenen:

  • LLM-Inferenz: Jede Konversation erfordert Modellverarbeitung, deren Kosten vom Modell, vom Token-Volumen, von der Kontextlänge und vom Antwortmuster abhängen.
  • TTS: Generierte Sprachausgabe wird bei Nutzung der Aura-Modelle von Deepgram separat nach Zeichen abgerechnet.
  • Telefonie: Telefonnummern, Inbound- und Outbound-Anrufe, Gebühren der Telefonanbieter und Aufzeichnungen können außerhalb der Rechnung für die KI-API anfallen.
  • Orchestrierung: Ihre Anwendung muss Status, Tools, Routing, Authentifizierung, Wiederholungsversuche und Integrationen verwalten.
  • Engineering: Turn-Erkennung, Umgang mit Unterbrechungen, Failover, Latenzüberwachung, Tests, Evaluierung, Logging und Debugging im Produktivbetrieb erfordern alle Engineering-Zeit.

Deshalb kann der Vergleich von Sprach-Bereitstellungen allein anhand eines STT-Preises pro Minute ein irreführendes Bild ergeben. Die API kann günstig sein – das System, das um sie herum entsteht, ist es nicht zwangsläufig.

Wann Komponenten kaufen und wann eine Plattform?

Bauen Sie direkt mit APIs, wenn Sie bereits ein Voice-Engineering-Team haben, einen relativ eng umrissenen Anwendungsfall verfolgen und die Kontrolle über einzelne Modelle und die Infrastruktur behalten wollen.

Selbst entwickeln ist sinnvoll, wenn Sie:

  • Entwickler haben, die den Voice-Stack verantworten können.
  • Umfassende Kontrolle über Modelle und Routing benötigen.
  • Einen Anwendungsfall haben, der sich selten ändert.
  • Die Infrastruktur problemlos selbst betreiben können.

Eine Plattform ist sinnvoller, wenn Sie:

  • Produktionsreife Sprachagenten für unterschiedliche Akzente, Audiobedingungen und Workflows benötigen.
  • Zuverlässigkeit, Monitoring, Compliance und Integrationen benötigen, ohne jede Ebene selbst zu entwickeln.
  • In Wochen statt Monaten vom Pilotprojekt in den Produktivbetrieb wechseln wollen.
  • Die Kosten und die operative Komplexität der gesamten Bereitstellung im Blick haben, nicht nur den STT-Posten.

Für Teams, die eine gemanagte Belegschaft wollen statt die einzelnen Komponenten selbst zusammenzusetzen, bietet die Voice AI-Plattform von HappyRobot die umfassendere Bereitstellungsebene rund um Sprachagenten.


Häufig gestellte Fragen

  • Wie viel kostet Deepgram pro Minute?
    Der aktuelle Streaming-Tarif für Nova-3 Monolingual von Deepgram liegt bei 0,0048 $ pro Minute im Pay-As-You-Go-Modell, Nova-3 Multilingual bei 0,0058 $/Min. Nova-3 für vorab aufgezeichnete Inhalte beginnt bei 0,0043 $/Min. Aktionspreise für Streaming können sich ändern.
  • Was umfasst das kostenlose Guthaben von Deepgram?
    Neue Deepgram-Konten erhalten ein kostenloses Guthaben von 200 $. Beim aktuellen Streaming-Tarif für Nova-3 Monolingual von 0,0048 $/Min. entspricht das rund 41.667 Minuten, sofern keine Add-ons oder anderen Services das Guthaben verbrauchen.
  • Was ist der Unterschied zwischen der Preisgestaltung von Nova-3 und Flux?
    Nova-3 ist das Allzweckmodell von Deepgram für Spracherkennung, während Flux für dialogorientierte Sprachagenten mit integrierter Turn-Erkennung entwickelt wurde. Die aktuellen Pay-As-You-Go-Streaming-Tarife beginnen bei 0,0048 $/Min. für Nova-3 und 0,0065 $/Min. für Flux English.
  • Sind LLM- und TTS-Kosten in der Voice Agent API von Deepgram enthalten?
    Ja. Die Voice Agent API ist als einheitliche Ebene für STT, LLM-Orchestrierung und TTS konzipiert, mit separaten Tarifen für die Konfigurationen Standard, Custom und Advanced. Für die Optionen BYO LLM und BYO TTS gelten eigene veröffentlichte Tarife.