Crédits et facturation
Tchavi utilise un système de facturation basé sur les crédits — chaque requête API consomme des crédits selon le modèle utilisé et le nombre de tokens traités.
Tchavi utilise un système de facturation basé sur les crédits. Chaque requête API consomme des crédits selon le modèle utilisé et le nombre de tokens traités.
Comment les crédits sont calculés
-
Modèles de chat : L'entrée et la sortie sont facturées au token, chacune à son taux, et le total est arrondi une seule fois au millième de crédit supérieur :
textcrédits = ceil( (tokens_entrée × taux_entrée + tokens_sortie × taux_sortie) / 1000 , 0,001 )Pas de minimum par requête, pas d'arrondi par côté : une question de 40 tokens à 1 crédit par millier coûte 0,04 crédit, pas 1. Les crédits portent trois décimales partout : solde, en-tête
X-Credits-Used, journaux d'usage. -
Entrée mise en cache : lorsqu'un fournisseur sert une partie de votre prompt depuis son cache, ces tokens sont facturés à leur propre taux, pas au taux d'entrée. Voir Mise en cache des prompts plus bas.
-
Modèles d'image : Coût en crédits forfaitaire par image. GPT Image facture selon
quality(low / medium / high), Nano Banana selonresolution(0.5K à 4K), FLUX.2 et Seedream à un tarif unique. Les formats rectangulaires portent un supplément de 1,5×, appliqué exactement. -
TTS (synthèse vocale) : Crédits par tranche de 1K caractères de texte en entrée, facturés au caractère (1 234 caractères à 32 crédits/1K coûtent 39,488 crédits)
-
Transcription (Whisper) : Crédits par minute d'audio, arrondie à la minute supérieure (l'unité de facturation du fournisseur)
-
Modèles vidéo : Crédits par seconde de vidéo, variable selon la résolution (certains modèles ajoutent un supplément lorsque de l'audio est généré). Les modèles motion-control, dont la durée de sortie suit une vidéo de référence (ex.
kling-v3-motion-control), réservent les crédits à la durée maximale possible puis remboursent automatiquement la partie inutilisée une fois la durée réelle connue.
En-têtes de réponse
Chaque réponse API inclut des en-têtes de métadonnées :
| En-tête | Description |
|---|---|
X-Credits-Used | Crédits consommés par cette requête |
X-Credits-Remaining | Votre solde de crédits actuel |
X-RateLimit-RPM-Limit | Votre limite de requêtes par minute |
X-RateLimit-RPM-Remaining | Requêtes restantes dans la minute en cours |
X-RateLimit-TPM-Limit | Votre limite de tokens par minute |
X-RateLimit-TPM-Remaining | Budget de tokens restant dans la minute en cours |
X-Request-Id | ID unique de la requête pour le support/débogage |
Retry-After | Secondes à attendre avant de réessayer (sur les réponses 429) |
Exemple de calcul de crédits. Une requête avec 500 tokens en entrée + 200 tokens en sortie sur un modèle tarifé 1 cr/1K en entrée et 2 cr/1K en sortie (taux à titre d'exemple) coûte :
500 × 1 / 1000 = 0,500 crédit (entrée)
200 × 2 / 1000 = 0,400 crédit (sortie)
─────────────
0,900 créditCette requête coûte 0,9 crédit, exactement son prorata. Un message dix fois plus court coûte dix fois moins : il n'y a aucune pénalité à envoyer beaucoup de petites requêtes. Seuls le nombre de tokens et le modèle font varier la facture.
L'en-tête X-Credits-Used de chaque réponse indique le coût exact d'un appel : vous n'avez jamais à le calculer vous-même. Le taux exact de chaque modèle est indiqué dans le tableau des modèles.
Mise en cache des prompts
Les agents et les applications de chat renvoient la même conversation à chaque tour. Les fournisseurs conservent le préfixe répété dans un cache et facturent une fraction du prix normal pour le relire. Tchavi répercute cette remise telle quelle : un token d'entrée servi depuis le cache coûte un dixième du taux d'entrée.
| Classe de token | Taux | Quand elle s'applique |
|---|---|---|
| Entrée | le taux d'entrée du modèle | tokens traités à neuf par le modèle |
| Entrée en cache | 0,1 × le taux d'entrée | tokens servis depuis le cache du fournisseur |
| Écriture en cache | 1,25 × le taux d'entrée | tokens écrits dans le cache, chez les fournisseurs qui la facturent |
| Sortie | le taux de sortie du modèle | tokens générés |
Sur les modèles OpenAI, c'est automatique : les prompts de plus d'un millier de tokens environ sont mis en cache par le fournisseur sans rien changer à votre code, et les appels répétés coûtent simplement moins cher. Les modèles Anthropic ne transmettent pas encore les marqueurs de cache : une conversation Claude est donc actuellement facturée entièrement au taux d'entrée.
L'écart est important pour un agent qui tourne longtemps. Un tour qui envoie 120 000 tokens de contexte, dont 110 000 sont une répétition, coûte le quart de ce qu'il coûterait au taux d'entrée uniforme.
Votre journal d'usage enregistre les trois classes d'entrée séparément : vous pouvez donc voir quelle part d'une requête a été servie depuis le cache.
Les taux de cache ne sont appliqués qu'aux modèles dont la tarification de cache a été vérifiée auprès du fournisseur. Partout ailleurs, un token mis en cache est facturé au taux d'entrée ordinaire — ce que Tchavi faisait pour tous les modèles avant l'existence de cette remise, et jamais plus que le taux affiché dans le tableau des modèles.
Recharge
Achetez des crédits depuis votre tableau de bord de facturation en mobile money. La liste complète des opérateurs et pays pris en charge est publiée en temps réel sur /api/payments/providers. Les recharges commencent à 1 000 FCFA, les crédits sont ajoutés instantanément après le paiement et n'expirent jamais. Il n'y a pas de bonus à l'inscription : votre première recharge offre +300 crédits bonus, et elle fait aussi passer votre compte du niveau Free à Builder (voir Limites de débit).
Voir aussi Limites de débit et Gestion des erreurs.