Les tarifs Deepgram démarrent à 0,0048 $ la minute pour le streaming Nova-3 Monolingual, avec des prix distincts pour la transcription multilingue, le traitement par lots, la synthèse vocale et les agents vocaux. Mais le tarif à la minute ne représente qu'une partie du coût. Les options supplémentaires, l'usage des LLM, la TTS, la téléphonie et l'ingénierie peuvent tous augmenter votre dépense totale.
Pour les entreprises, la vraie question est de savoir si vous évaluez le prix d'une technologie vocale ou celui du workflow complet qui l'entoure. Deepgram n'est qu'un composant d'une stack vocale, tandis que des plateformes comme HappyRobot combinent IA worker, orchestration, intégrations et autres briques d'infrastructure pour exécuter des workflows opérationnels de bout en bout.
Ce guide détaille les tarifs actuels de Deepgram et les coûts réels.
NB : tarifs vérifiés en août 2026 et susceptibles d'évoluer.
Comment fonctionne la tarification Deepgram
Deepgram applique une tarification à l'usage : l'offre Pay As You Go n'exige aucun engagement minimum et l'offre Growth démarre à plus de 4 000 $ par an avec des crédits prépayés et des remises allant jusqu'à 20 %. La tarification Enterprise est disponible auprès du service commercial.

Deepgram facture la reconnaissance vocale selon la durée réelle de l'audio, plutôt que d'arrondir chaque requête à la minute entière. Sa page tarifaire indique qu'un fichier de 14 secondes est facturé 14 secondes d'utilisation.
Le crédit de bienvenue de 200 $ s'applique aux nouveaux comptes et n'expire pas tant qu'il n'est pas utilisé. Les clients Growth reçoivent des crédits prépayés, tandis que les clients Enterprise peuvent négocier les conditions relatives au volume, au déploiement, au support et à d'autres exigences.
Tarifs Deepgram à la minute par modèle
Le tableau ci-dessous présente les tarifs Deepgram en vigueur en août 2026. Les tarifs de streaming signalés comme promotionnels sont susceptibles d'évoluer, 2026 ; les tarifs pour l'audio préenregistré sont distincts.
| Model | Streaming Rate | Batch / Pre-Recorded Rate | Best Suited For |
|---|---|---|---|
| Nova-3 Monolingual | $0.0048/min PAYG; $0.0042/min Growth (promotional) | $0.0043/min PAYG; $0.0036/min Growth | General-purpose transcription |
| Nova-3 Multilingual | $0.0058/min PAYG; $0.0050/min Growth (promotional) | $0.0052/min PAYG; $0.0043/min Growth | Multilingual transcription and automatic language detection |
| Flux English | $0.0065/min PAYG; $0.0057/min Growth (promotional) | N/A | Real-time English voice agents with built-in turn detection |
| Flux Multilingual | $0.0078/min PAYG; $0.0068/min Growth | N/A | Real-time multilingual voice agents |
| Aura-2 TTS | N/A | $0.030 per 1K characters PAYG; $0.027 per 1K characters Growth | Higher-quality text-to-speech |
| Aura-1 TTS | N/A | $0.015 per 1K characters PAYG; $0.0135 per 1K characters Growth | Lower-cost text-to-speech |
| Voice Agent API — Standard | $0.056/min through Sept. 12; $0.075/min thereafter PAYG | N/A | Managed real-time voice agents |
| Voice Agent API — Standard, BYO TTS | $0.065/min PAYG; $0.051/min Growth | N/A | Voice agents using your own TTS |
| Voice Agent API — Custom, BYO LLM | $0.050/min through Sept. 12; $0.065/min thereafter PAYG; Growth $0.059/min | N/A | Voice agents using your own LLM |
| Voice Agent API — Custom, BYO LLM + TTS | $0.050/min PAYG; $0.041/min Growth | N/A | Maximum control over model components |
| Voice Agent API — Advanced | $0.122/min through Sept. 12; $0.163/min thereafter PAYG; Growth $0.146/min | N/A | Advanced production voice-agent requirements |
| Voice Agent API — Advanced, BYO TTS | $0.122/min PAYG; $0.110/min Growth | N/A | Advanced agents using your own TTS |
Nova-3 est la famille STT généraliste de Deepgram, tandis que Flux est conçu spécifiquement pour les agents vocaux conversationnels et intègre la détection des tours de parole au modèle. Aura-1 et Aura-2 assurent la synthèse vocale et sont facturés au caractère plutôt qu'à la minute d'audio.
L'API Voice Agent propose des niveaux Standard et Advanced, ainsi qu'un niveau Custom pour utiliser votre propre LLM. Les options BYO modifient sensiblement le tarif : Deepgram publie des prix distincts pour BYO TTS et BYO LLM + TTS ; ne considérez donc pas le tarif affiché de l'API Voice Agent comme valable pour toutes les configurations.
Le coût des options Deepgram
Deepgram facture séparément plusieurs fonctionnalités STT, dont la rédaction, le keyterm prompting, la détection d'entités et la diarisation des locuteurs. Le Smart Formatting est inclus.

Les tarifs exacts de ces options dépendent de l'utilisation d'audio en streaming ou préenregistré, mais les tarifs actuellement publiés pour les principales options de streaming en Pay As You Go sont les suivants :
- 0,0020 $/min pour la rédaction
- 0,0013 $/min pour le keyterm prompting
- 0,0017 $/min pour la détection d'entités
- 0,0020 $/min pour la diarisation des locuteurs
Par exemple, supposons que vous traitiez 10 000 minutes de streaming Nova-3 Monolingual et que vous avez besoin de la rédaction, du keyterm prompting et de la diarisation des locuteurs :
| Cost Component | Rate | 10,000-minute cost |
|---|---|---|
| Nova-3 Monolingual | $0.0048/min | $48.00 |
| Redaction | $0.0020/min | $20.00 |
| Keyterm Prompting | $0.0013/min | $13.00 |
| Speaker Diarization | $0.0020/min | $20.00 |
| Total | $0.0101/min effective | $101.00 |
Le coût STT effectif passe alors à 0,0101 $ par minute, soit plus du double du tarif Nova-3 de base. Le même schéma s'applique à des volumes plus importants : une option en apparence modeste peut modifier sensiblement le prix effectif par minute lorsqu'elle est utilisée sur chaque appel.
Les crédits gratuits et ce qu'ils vous apportent réellement
Les nouveaux comptes Deepgram reçoivent 200 $ de crédits gratuits. Au tarif actuel de 0,0048 $/min pour le streaming Nova-3 Monolingual, cela équivaut à environ 41 667 minutes :
200 $ ÷ 0,0048 $ = 41 667 minutes, soit environ 694 heures de transcription.
Au tarif préenregistré de 0,0043 $/min, le même crédit couvre environ 46 512 minutes, soit 775 heures. Les options réduisent ces totaux car elles consomment du crédit d'usage supplémentaire.
Les tarifs de Deepgram comparés aux alternatives
Il n'existe pas de tarif directement comparable entre les API de reconnaissance vocale, car les fournisseurs regroupent les fonctionnalités différemment et proposent des produits de streaming et de traitement par lots distincts. Le tableau fournit une comparaison de grilles tarifaires, et non un classement qualitatif.
| Provider | Streaming Rate | Batch Rate | Free Tier | Notable Trade-off |
|---|---|---|---|---|
| Deepgram | From $0.0048/min for Nova-3 Monolingual | From $0.0043/min | $200 credit | Add-ons such as diarization, redaction, and keyterm prompting can increase the effective STT cost. |
| AssemblyAI | $0.0075/min for Universal-3.5 Pro Realtime | $0.0035/min for Universal-3.5 Pro | $50 credit | Streaming and feature pricing differ from async; realtime add-ons are charged only when used. |
| OpenAI Whisper API | N/A | $0.006/min | No dedicated free tier | Whisper is not a streaming STT model |
| Google Cloud Speech-to-Text | From $0.016/min for standard V2 recognition | From $0.003/min for Dynamic Batch | 60 min/month | Cloud billing, tiers, and request-level pricing can complicate comparisons. cloud |
| ElevenLabs Scribe | $0.0065/min for Scribe v2 Realtime | $0.00367/min for Scribe v2 | 10,000 credits | Credits are shared across ElevenLabs products, so TTS or other usage can reduce available STT capacity |
Les tarifs ci-dessus sont normalisés à partir des prix publiés par chaque fournisseur et ne prétendent pas que les produits offrent des fonctionnalités identiques.
- AssemblyAI affiche Universal-3.5 Pro Realtime à 0,45 $/heure et l'asynchrone à 0,21 $/heure
- OpenAI affiche Whisper à 0,006 $/minute
- Google affiche la reconnaissance standard V2 à partir de 0,016 $/minute et le traitement par lots dynamique à partir de 0,003 $/minute
- ElevenLabs affiche Scribe v2 à 0,22 $/heure et Scribe v2 Realtime à 0,39 $/heure.
Ce tableau ne chiffre que la couche API. Héberger Whisper vous-même paraît moins cher que tous les tarifs qui y figurent, puisque c'est gratuit. Cela reste vrai jusqu'à ce que votre volume augmente.
Au-delà d'un certain seuil, la facture réelle se compose d'heures GPU, de temps d'ingénieur, de stockage et de redondance, et rien de tout cela n'a de prix affiché. Cette comparaison des logiciels de transcription IA détaille où se situe cette limite pour chaque outil.
Ce que coûte réellement un déploiement vocal complet
Un agent vocal en production coûte plus cher que son fournisseur STT, car le STT n'est qu'une couche de la stack. Un modèle de coût réaliste inclut la reconnaissance vocale, l'inférence LLM, la synthèse vocale, la téléphonie, l'orchestration et le travail d'ingénierie nécessaire pour faire fonctionner ces éléments ensemble de façon fiable.
Par exemple, imaginons 10 000 minutes de trafic vocal mensuel avec Nova-3 à 0,0048 $/min. La ligne STT ne représente que 48 $ par mois avant options. Si vous ajoutez la rédaction, le keyterm prompting et la diarisation, le total STT monte à 101 $.
Le reste de la facture provient des autres couches :
- Inférence LLM : Chaque conversation nécessite un traitement par le modèle, dont le coût dépend du modèle, du volume de tokens, de la longueur du contexte et du schéma de réponse.
- TTS : La synthèse vocale générée est facturée séparément au caractère lorsque vous utilisez les modèles Aura de Deepgram.
- Téléphonie : Les numéros de téléphone, les appels entrants et sortants, les frais des opérateurs et l'enregistrement peuvent se situer en dehors de la facture de l'API IA.
- Orchestration : Votre application doit gérer l'état, les outils, le routage, l'authentification, les nouvelles tentatives et les intégrations.
- Ingénierie : La détection de tour de parole, la gestion des interruptions, le basculement, la surveillance de la latence, les tests, l'évaluation, la journalisation et le débogage en production demandent tous du temps d'ingénierie.
C'est pourquoi comparer des déploiements vocaux uniquement à partir d'un prix STT à la minute peut donner une image trompeuse. L'API peut être peu coûteuse alors que le système construit autour ne l'est pas.
Quand acheter les composants et quand acheter la plateforme
Développez directement avec les API lorsque vous disposez déjà d'une équipe d'ingénierie vocale, que votre cas d'usage est relativement circonscrit et que vous souhaitez contrôler chaque modèle et l'infrastructure.
Développer a du sens lorsque vous :
- Disposez d'ingénieurs capables de prendre en charge la stack vocale.
- Avez besoin d'un contrôle poussé sur les modèles et le routage.
- Avez un cas d'usage qui évolue peu.
- Êtes à l'aise avec l'exploitation de l'infrastructure en interne.
Une plateforme est plus pertinente lorsque vous :
- Avez besoin d'agents vocaux en production couvrant différents accents, conditions audio et workflows.
- Avez besoin de fiabilité, de supervision, de conformité et d'intégrations sans construire chaque couche vous-même.
- Souhaitez passer du pilote à la production en quelques semaines plutôt qu'en quelques mois.
- Vous préoccupez du coût et de la complexité opérationnelle de l'ensemble du déploiement, et pas seulement de la ligne STT.
Pour les équipes qui veulent une workforce managée plutôt que d'assembler les composants un à un, la plateforme d'IA vocale de HappyRobot fournit la couche de déploiement élargie autour des agents vocaux.




