Crédits et facturation

Tchavi utilise un système de facturation basé sur les crédits — chaque requête API consomme des crédits selon le modèle utilisé et le nombre de tokens traités.

Tchavi utilise un système de facturation basé sur les crédits. Chaque requête API consomme des crédits selon le modèle utilisé et le nombre de tokens traités.

Comment les crédits sont calculés

  • Modèles de chat : L'entrée et la sortie sont facturées au token, chacune à son taux, et le total est arrondi une seule fois au millième de crédit supérieur :

    text
    crédits = ceil( (tokens_entrée × taux_entrée + tokens_sortie × taux_sortie) / 1000 , 0,001 )

    Pas de minimum par requête, pas d'arrondi par côté : une question de 40 tokens à 1 crédit par millier coûte 0,04 crédit, pas 1. Les crédits portent trois décimales partout : solde, en-tête X-Credits-Used, journaux d'usage.

  • Entrée mise en cache : lorsqu'un fournisseur sert une partie de votre prompt depuis son cache, ces tokens sont facturés à leur propre taux, pas au taux d'entrée. Voir Mise en cache des prompts plus bas.

  • Modèles d'image : Coût en crédits forfaitaire par image. GPT Image facture selon quality (low / medium / high), Nano Banana selon resolution (0.5K à 4K), FLUX.2 et Seedream à un tarif unique. Les formats rectangulaires portent un supplément de 1,5×, appliqué exactement.

  • TTS (synthèse vocale) : Crédits par tranche de 1K caractères de texte en entrée, facturés au caractère (1 234 caractères à 32 crédits/1K coûtent 39,488 crédits)

  • Transcription (Whisper) : Crédits par minute d'audio, arrondie à la minute supérieure (l'unité de facturation du fournisseur)

  • Modèles vidéo : Crédits par seconde de vidéo, variable selon la résolution (certains modèles ajoutent un supplément lorsque de l'audio est généré). Les modèles motion-control, dont la durée de sortie suit une vidéo de référence (ex. kling-v3-motion-control), réservent les crédits à la durée maximale possible puis remboursent automatiquement la partie inutilisée une fois la durée réelle connue.

En-têtes de réponse

Chaque réponse API inclut des en-têtes de métadonnées :

En-têteDescription
X-Credits-UsedCrédits consommés par cette requête
X-Credits-RemainingVotre solde de crédits actuel
X-RateLimit-RPM-LimitVotre limite de requêtes par minute
X-RateLimit-RPM-RemainingRequêtes restantes dans la minute en cours
X-RateLimit-TPM-LimitVotre limite de tokens par minute
X-RateLimit-TPM-RemainingBudget de tokens restant dans la minute en cours
X-Request-IdID unique de la requête pour le support/débogage
Retry-AfterSecondes à attendre avant de réessayer (sur les réponses 429)

Exemple de calcul de crédits. Une requête avec 500 tokens en entrée + 200 tokens en sortie sur un modèle tarifé 1 cr/1K en entrée et 2 cr/1K en sortie (taux à titre d'exemple) coûte :

text
500 × 1 / 1000  =  0,500 crédit   (entrée)
200 × 2 / 1000  =  0,400 crédit   (sortie)
                   ─────────────
                   0,900 crédit

Cette requête coûte 0,9 crédit, exactement son prorata. Un message dix fois plus court coûte dix fois moins : il n'y a aucune pénalité à envoyer beaucoup de petites requêtes. Seuls le nombre de tokens et le modèle font varier la facture.

L'en-tête X-Credits-Used de chaque réponse indique le coût exact d'un appel : vous n'avez jamais à le calculer vous-même. Le taux exact de chaque modèle est indiqué dans le tableau des modèles.

Mise en cache des prompts

Les agents et les applications de chat renvoient la même conversation à chaque tour. Les fournisseurs conservent le préfixe répété dans un cache et facturent une fraction du prix normal pour le relire. Tchavi répercute cette remise telle quelle : un token d'entrée servi depuis le cache coûte un dixième du taux d'entrée.

Classe de tokenTauxQuand elle s'applique
Entréele taux d'entrée du modèletokens traités à neuf par le modèle
Entrée en cache0,1 × le taux d'entréetokens servis depuis le cache du fournisseur
Écriture en cache1,25 × le taux d'entréetokens écrits dans le cache, chez les fournisseurs qui la facturent
Sortiele taux de sortie du modèletokens générés

Sur les modèles OpenAI, c'est automatique : les prompts de plus d'un millier de tokens environ sont mis en cache par le fournisseur sans rien changer à votre code, et les appels répétés coûtent simplement moins cher. Les modèles Anthropic ne transmettent pas encore les marqueurs de cache : une conversation Claude est donc actuellement facturée entièrement au taux d'entrée.

L'écart est important pour un agent qui tourne longtemps. Un tour qui envoie 120 000 tokens de contexte, dont 110 000 sont une répétition, coûte le quart de ce qu'il coûterait au taux d'entrée uniforme.

Votre journal d'usage enregistre les trois classes d'entrée séparément : vous pouvez donc voir quelle part d'une requête a été servie depuis le cache.

Les taux de cache ne sont appliqués qu'aux modèles dont la tarification de cache a été vérifiée auprès du fournisseur. Partout ailleurs, un token mis en cache est facturé au taux d'entrée ordinaire — ce que Tchavi faisait pour tous les modèles avant l'existence de cette remise, et jamais plus que le taux affiché dans le tableau des modèles.

Recharge

Achetez des crédits depuis votre tableau de bord de facturation en mobile money. La liste complète des opérateurs et pays pris en charge est publiée en temps réel sur /api/payments/providers. Les recharges commencent à 1 000 FCFA, les crédits sont ajoutés instantanément après le paiement et n'expirent jamais. Il n'y a pas de bonus à l'inscription : votre première recharge offre +300 crédits bonus, et elle fait aussi passer votre compte du niveau Free à Builder (voir Limites de débit).

Voir aussi Limites de débit et Gestion des erreurs.

Sur cette page