Guide de démarrage pour les utilisateurs de Kimi
Remplacez simplement l'URL de base et la clé API pour router vos appels SDK OpenAI existants vers un LLM sans censure. Ce guide montre les trois lignes exactes nécessaires pour démarrer les conversations, le streaming et l'utilisation des outils avec notre endpoint compatible.
Prérequis : clé API
Avant d'envoyer des requêtes, vous avez besoin d'une clé API. Inscrivez-vous sur la page Obtenir la clé API en utilisant Continuer avec Google ou un e-mail et un mot de passe. Votre clé apparaît immédiatement. Les nouveaux comptes reçoivent 0,50 $ de crédit d'essai gratuit valable 7 jours ; aucune carte n'est requise. Pour une utilisation payante, rechargez avec USDT (TRC20) ou USDC (Base). Les recharges vont de 10 $ à 500 $. Vous recevez un bonus de +5 % pour les recharges de 50 $ ou plus, et un bonus de +10 % pour 100 $ ou plus. Le crédit n'expire jamais et est facturé uniquement pour l'utilisation réelle de tokens. Les erreurs et les refus sont gratuits. Vous pouvez détenir une clé active par compte ; la génération d'une nouvelle clé remplace l'ancienne. Utilisez cette clé dans l'en-têteAuthorization pour toutes les requêtes.
Complétion de chat basique
L'endpointkimi api accepte les requêtes standard de chat-completion OpenAI. Définissez l'URL de base de votre client sur https://api.kimiapi.cc/v1 et fournissez votre clé. Nous proposons un seul modèle sans censure dédié, identifié par l'ID uncensored. Ce modèle à poids ouverts s'exécute sur nos serveurs et n'accepte pas de refus pour les sujets adultes légaux, fictifs ou controversés. Il ne s'agit pas de GPT, Claude, Gemini ou de tout autre modèle d'un autre fournisseur. Vous pouvez envoyer des prompts et recevoir des réponses textuelles. Le modèle prend en charge une fenêtre de contexte de 100 000 tokens (prompt + completion). Le nombre maximum de tokens par requête est de 32 000, ou 2 048 si vous ne définissez pas max_tokens. Aucun vecteur, image ou audio n'est généré.
Réponses en streaming
Utilisez les Server-Sent Events (SSE) pour le streaming. L'API diffuse les tokens au fur et à mesure de leur génération. Les informations d'utilisation des tokens sont incluses dans le dernier fragment du flux. Cela vous permet de surveiller les coûts en temps réel sans attendre la réponse complète. Le streaming est pris en charge par tous les SDK compatibles OpenAI. Définissezstream=true dans votre requête. Le client recevra une série d'objets delta contenant le texte. Vous pouvez concaténer ces deltas pour reconstituer la réponse complète. C'est idéal pour les interfaces de chat où les utilisateurs attendent une réponse immédiate. L'endpoint kimi api garantit une latence prévisible en évitant la surcharge de proxy.
Appel de fonctions (Outils)
L'API prend en charge l'appel de fonctions, également appelé outils. Vous pouvez définir des outils dans votre requête et le modèle retournera des arguments structurés lorsque cela est approprié. Utilisez le paramètretools pour passer une liste de définitions d'outils. Vous pouvez également utiliser tool_choice pour forcer ou sélectionner automatiquement les outils. Le modèle retourne une réponse avec des appels d'outils, que vous pouvez renvoyer à l'API pour poursuivre la conversation. Cela permet de créer des agents ou des workflows automatisés. Les définitions d'outils suivent le format standard OpenAI. Le modèle sans censure gère les définitions d'outils avec précision sans refuser de les utiliser pour des cas d'utilisation valides. Le mode JSON est également disponible pour un formatage de sortie plus strict.
Mode JSON
Pour les applications nécessitant une sortie stricte, utilisez le mode JSON. Définissezresponse_format sur {"type": "json_object"}. Le modèle tentera de retourner un objet JSON valide. Cela est utile pour analyser des données, générer des fichiers de configuration ou alimenter d'autres systèmes avec des données structurées. Le mode JSON fonctionne conjointement avec l'appel de fonctions. Vous pouvez également définir des paramètres comme temperature, top_p, stop, seed, presence_penalty et frequency_penalty pour contrôler la créativité et le déterminisme. Ces paramètres sont standard pour les clients compatibles OpenAI. Ajustez-les pour équilibrer la cohérence et la créativité en fonction de votre cas d'utilisation.
Limites, erreurs et contexte
Chaque clé API est limitée à 300 requêtes par minute et 8 requêtes simultanées. Le corps de la requête ne doit pas dépasser 8 Mo. Si la clé est invalide, vous recevez une erreur 401. Si vous n'avez pas de crédit, vous recevez une erreur 402. Si vous dépassez la limite de débit, vous recevez une erreur 429. Les erreurs et les refus sont gratuits, vous n'êtes pas facturé pour les requêtes échouées. La fenêtre de contexte est de 100 000 tokens au total. Une limite stricte de contenu s'applique : les requêtes impliquant du contenu sexuel avec des mineurs sont toujours refusées. L'API est textuelle uniquement. Aucun vecteur, image ou fine-tuning n'est disponible. Pour les modèles d'autres fournisseurs, consultez leur documentation pour les prix et limites actuels. Ce service est une alternative indépendante, non affiliée à ces fournisseurs.
cURL
curl https://api.kimiapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.kimiapi.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.kimiapi.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Streaming
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Fonctions et limites
Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.
| Élément | Valeur |
|---|---|
| Format | compatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé |
| Base URL | https://api.kimiapi.cc/v1 |
| ID du modèle | uncensored |
| Authentification | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Mode JSON | response_format: {"type": "json_object"} |
| Paramètres | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Fenêtre de contexte | 100 000 tokens (entrée + sortie) |
| Appel de fonctions | oui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool |
| Streaming | oui — server-sent events ; le dernier bloc contient l'usage des tokens |
| Sortie max. | jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct) |
| Taille | jusqu'à 8 Mo par requête |
| Limite de débit | 300 requêtes par minute et par clé |
| En-têtes | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Concurrence | 8 requêtes simultanées par clé |
| Essai gratuit | 0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge |
| Validité | le crédit payé n'expire jamais, sans abonnement |
| Facturation | crédit prépayé selon l'usage réel ; erreurs et refus gratuits |
| Recharge | USDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $ |
| Bonus | +5 % dès 50 $, +10 % dès 100 $ |
| Prix | 0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie |
| Connexion | Google ou e-mail et mot de passe |
| Clés | une clé active par compte ; une nouvelle remplace l'ancienne |
| Contenu | contenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé |
Codes d'erreur
Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.
| Code | Type | Signification |
|---|---|---|
400 | bad_request | JSON invalide, messages vides, mauvais paramètre ou contexte trop long |
401 | missing_key · invalid_key · key_revoked | clé absente, erronée ou remplacée |
402 | no_credit | plus de crédit — rechargez, la reprise est immédiate |
403 | content_blocked | contenu sexuel impliquant des mineurs — refusé, non facturé |
404 | not_found | endpoint inconnu |
413 | request_too_large | corps supérieur à 8 Mo |
429 | rate_limited · concurrency | au-delà de 300/min ou 8 en parallèle — patientez |
503 | upstream_busy | modèle occupé — réessayez dans quelques secondes |
Questions et réponses
Qu'est-ce que la fenêtre de contexte et la limite de sortie ?
La fenêtre de contexte est de 100 000 tokens pour le prompt et la complétion combinés. La sortie maximale par requête est de 32 000 tokens. Si vous ne définissez pas <code>max_tokens</code>, la limite est de 2 048 tokens.
Comment recharger mon crédit ?
Rechargez uniquement avec des cryptomonnaies : USDT (TRC20) ou USDC (Base). Les montants acceptés sont des entiers en dollars, de 10 $ à 500 $. Vous recevez un bonus de +5 % pour les recharges de 50 $ ou plus, et un bonus de +10 % pour 100 $ ou plus. Le crédit n'expire jamais.
S'agit-il de l'API officielle Kimi ?
Non. Il s'agit d'un service indépendant fournissant un endpoint compatible OpenAI. Nous proposons un seul modèle sans censure. Nous ne sommes pas affiliés à Moonshot AI ou à tout autre fournisseur. Consultez la documentation des fournisseurs respectifs pour leurs API officielles.
Votre clé est à un formulaire de vous
Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.