Première requête en cinq minutes
Insérez votre clé API Kimi dans n'importe quel client compatible OpenAI et commencez à générer du texte sans censure. Ce guide vous montre exactement comment configurer votre SDK et comprendre le prix réel des tokens.
Installer le SDK OpenAI Python/Node
Commencez par installer la bibliothèque cliente OpenAI standard. Cela fonctionne car notre API suit la même interface compatible OpenAI. Vous n'avez pas besoin d'un SDK fournisseur spécial. Exécutez simplement pip install openai pour Python ou npm install openai pour Node.js. La bibliothèque gère automatiquement la sérialisation JSON et les requêtes HTTP.
Configurer l'URL de base et la clé API
Pointez votre client vers notre endpoint. Définissez l'URL de base sur https://api.kimiapi.top/v1 et fournissez votre clé API depuis le tableau de bord. Cette clé authentifie votre crédit prépayé. Vous pouvez générer une nouvelle clé instantanément via Google ou e-mail sur la page d'inscription. Aucune carte bancaire n'est requise pour commencer.
curl https://api.kimiapi.top/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Envoyer votre première complétion de chat
Envoyez un message simple au modèle uncensored. Ce modèle est ajusté pour répondre sans refus pour une utilisation adulte légale. Il prend en charge une fenêtre de contexte de 100 000 tokens, bien que la sortie maximale soit de 32 000 tokens. La réponse renvoie du texte directement. Les erreurs et refus ne consomment pas votre crédit.
from openai import OpenAI
client = OpenAI(base_url="https://api.kimiapi.top/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Activer le streaming avec SSE
Pour des réponses en temps réel, activez le streaming. Le SDK diffuse les tokens via Server-Sent Events (SSE). Le dernier chunk contient l'utilisation totale des tokens pour la facturation. Cette approche réduit la latence perçue pour les sorties longues. Vous pouvez traiter chaque token à mesure qu'il arrive dans la logique de votre application.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Utiliser le mode JSON pour une sortie structurée
Assurez-vous d'obtenir une sortie machine lisible en définissant response_format sur {"type": "json_object"}. Cela force le modèle à renvoyer du JSON valide. C'est idéal pour l'extraction de données ou la génération de configuration. Le modèle ne brisera pas la structure, ce qui facilite l'analyse des réponses dans votre code.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.kimiapi.top/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Vérifier l'utilisation et les coûts
Surveillez votre utilisation via le tableau de bord. Les coûts des tokens d'entrée sont de 0,25 $ par million de tokens ; la sortie est de 1,00 $ par million de tokens. Si vous recevez une erreur 401, vérifiez votre clé. Une erreur 402 signifie que vous devez recharger avec USDT ou USDC. Une erreur 429 indique que vous avez atteint la limite de 300 requêtes par minute. Le crédit n'expire jamais, rechargez quand vous le souhaitez.
Caractéristiques techniques
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Base URL | https://api.kimiapi.top/v1 |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Authentification | Authorization: Bearer YOUR_KEY |
| ID du modèle | uncensored |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Mode JSON | response_format: {"type": "json_object"} |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Limite de débit | 300 requêtes par minute et par clé |
| Concurrence | 8 requêtes simultanées par clé |
| Taille | jusqu'à 8 Mo par requête |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Connexion | Google ou e-mail et mot de passe |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
Codes d'erreur
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Comment fonctionne la facturation de l'API Kimi ?
Vous ne payez que pour l'utilisation réelle des tokens. Les tokens d'entrée coûtent 0,25 $ par million, et les tokens de sortie 1,00 $ par million. Les erreurs et refus sont gratuits. Le crédit est prépayé et n'expire jamais.
Quels paiements en crypto sont acceptés ?
Nous acceptons USDT (TRC20) et USDC (Base). Les recharges vont de 10 $ à 500 $. Les paiements sont traités directement sans cartes ni PayPal.
Quelle est la limite de la fenêtre de contexte ?
Le modèle prend en charge une fenêtre de contexte de 100 000 tokens pour le prompt et la génération. Toutefois, la sortie maximale par requête est de 32 000 tokens, sauf si vous spécifiez une limite inférieure.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.