FR ▾
Obtenir une clé API

Guide de démarrage pour les utilisateurs de Kimi

Remplacez simplement l'URL de base et la clé API pour router vos appels SDK OpenAI existants vers un LLM sans censure. Ce guide montre les trois lignes exactes nécessaires pour démarrer les conversations, le streaming et l'utilisation des outils avec notre endpoint compatible.

Prérequis : clé API

Avant d'envoyer des requêtes, vous avez besoin d'une clé API. Inscrivez-vous sur la page Obtenir la clé API en utilisant Continuer avec Google ou un e-mail et un mot de passe. Votre clé apparaît immédiatement. Les nouveaux comptes reçoivent 0,50 $ de crédit d'essai gratuit valable 7 jours ; aucune carte n'est requise. Pour une utilisation payante, rechargez avec USDT (TRC20) ou USDC (Base). Les recharges vont de 10 $ à 500 $. Vous recevez un bonus de +5 % pour les recharges de 50 $ ou plus, et un bonus de +10 % pour 100 $ ou plus. Le crédit n'expire jamais et est facturé uniquement pour l'utilisation réelle de tokens. Les erreurs et les refus sont gratuits. Vous pouvez détenir une clé active par compte ; la génération d'une nouvelle clé remplace l'ancienne. Utilisez cette clé dans l'en-tête Authorization pour toutes les requêtes.

Complétion de chat basique

L'endpoint kimi api accepte les requêtes standard de chat-completion OpenAI. Définissez l'URL de base de votre client sur https://api.kimiapi.cc/v1 et fournissez votre clé. Nous proposons un seul modèle sans censure dédié, identifié par l'ID uncensored. Ce modèle à poids ouverts s'exécute sur nos serveurs et n'accepte pas de refus pour les sujets adultes légaux, fictifs ou controversés. Il ne s'agit pas de GPT, Claude, Gemini ou de tout autre modèle d'un autre fournisseur. Vous pouvez envoyer des prompts et recevoir des réponses textuelles. Le modèle prend en charge une fenêtre de contexte de 100 000 tokens (prompt + completion). Le nombre maximum de tokens par requête est de 32 000, ou 2 048 si vous ne définissez pas max_tokens. Aucun vecteur, image ou audio n'est généré.

Réponses en streaming

Utilisez les Server-Sent Events (SSE) pour le streaming. L'API diffuse les tokens au fur et à mesure de leur génération. Les informations d'utilisation des tokens sont incluses dans le dernier fragment du flux. Cela vous permet de surveiller les coûts en temps réel sans attendre la réponse complète. Le streaming est pris en charge par tous les SDK compatibles OpenAI. Définissez stream=true dans votre requête. Le client recevra une série d'objets delta contenant le texte. Vous pouvez concaténer ces deltas pour reconstituer la réponse complète. C'est idéal pour les interfaces de chat où les utilisateurs attendent une réponse immédiate. L'endpoint kimi api garantit une latence prévisible en évitant la surcharge de proxy.

Appel de fonctions (Outils)

L'API prend en charge l'appel de fonctions, également appelé outils. Vous pouvez définir des outils dans votre requête et le modèle retournera des arguments structurés lorsque cela est approprié. Utilisez le paramètre tools pour passer une liste de définitions d'outils. Vous pouvez également utiliser tool_choice pour forcer ou sélectionner automatiquement les outils. Le modèle retourne une réponse avec des appels d'outils, que vous pouvez renvoyer à l'API pour poursuivre la conversation. Cela permet de créer des agents ou des workflows automatisés. Les définitions d'outils suivent le format standard OpenAI. Le modèle sans censure gère les définitions d'outils avec précision sans refuser de les utiliser pour des cas d'utilisation valides. Le mode JSON est également disponible pour un formatage de sortie plus strict.

Mode JSON

Pour les applications nécessitant une sortie stricte, utilisez le mode JSON. Définissez response_format sur {"type": "json_object"}. Le modèle tentera de retourner un objet JSON valide. Cela est utile pour analyser des données, générer des fichiers de configuration ou alimenter d'autres systèmes avec des données structurées. Le mode JSON fonctionne conjointement avec l'appel de fonctions. Vous pouvez également définir des paramètres comme temperature, top_p, stop, seed, presence_penalty et frequency_penalty pour contrôler la créativité et le déterminisme. Ces paramètres sont standard pour les clients compatibles OpenAI. Ajustez-les pour équilibrer la cohérence et la créativité en fonction de votre cas d'utilisation.

Limites, erreurs et contexte

Chaque clé API est limitée à 300 requêtes par minute et 8 requêtes simultanées. Le corps de la requête ne doit pas dépasser 8 Mo. Si la clé est invalide, vous recevez une erreur 401. Si vous n'avez pas de crédit, vous recevez une erreur 402. Si vous dépassez la limite de débit, vous recevez une erreur 429. Les erreurs et les refus sont gratuits, vous n'êtes pas facturé pour les requêtes échouées. La fenêtre de contexte est de 100 000 tokens au total. Une limite stricte de contenu s'applique : les requêtes impliquant du contenu sexuel avec des mineurs sont toujours refusées. L'API est textuelle uniquement. Aucun vecteur, image ou fine-tuning n'est disponible. Pour les modèles d'autres fournisseurs, consultez leur documentation pour les prix et limites actuels. Ce service est une alternative indépendante, non affiliée à ces fournisseurs.

cURL

curl https://api.kimiapi.cc/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "uncensored",
    "messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
  }'

Python

from openai import OpenAI

client = OpenAI(base_url="https://api.kimiapi.cc/v1", api_key="YOUR_KEY")

resp = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)

Node.js

import OpenAI from "openai";

const client = new OpenAI({ baseURL: "https://api.kimiapi.cc/v1", apiKey: process.env.API_KEY });

const resp = await client.chat.completions.create({
  model: "uncensored",
  messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);

Streaming

stream = client.chat.completions.create(
    model="uncensored",
    messages=[{"role": "user", "content": "Tell the story in second person."}],
    stream=True,
)
for chunk in stream:
    if chunk.choices and chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Fonctions et limites

Toutes les limites et fonctions réelles de l'API au même endroit — vérifiez-les avant de recharger.

ÉlémentValeur
Formatcompatible OpenAI : tout SDK OpenAI fonctionne en changeant la base URL et la clé
Base URLhttps://api.kimiapi.cc/v1
ID du modèleuncensored
AuthentificationAuthorization: Bearer YOUR_KEY
EndpointsPOST /v1/chat/completions · GET /v1/models
Mode JSONresponse_format: {"type": "json_object"}
Paramètrestemperature, top_p, stop, seed, presence_penalty, frequency_penalty
Fenêtre de contexte100 000 tokens (entrée + sortie)
Appel de fonctionsoui — tools, tool_choice ; réponse avec tool_calls, aussi en streaming ; résultats en role: tool
Streamingoui — server-sent events ; le dernier bloc contient l'usage des tokens
Sortie max.jusqu'au reste de la fenêtre de 100 000 tokens ; max_tokens optionnel (pas de plafond distinct)
Taillejusqu'à 8 Mo par requête
Limite de débit300 requêtes par minute et par clé
En-têtesX-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency
Concurrence8 requêtes simultanées par clé
Essai gratuit0,50 $ pendant 7 jours, sans carte · Clé d'essai : 2 requêtes parallèles, 60 par minute ; limites complètes (8 et 300) après la 1re recharge
Validitéle crédit payé n'expire jamais, sans abonnement
Facturationcrédit prépayé selon l'usage réel ; erreurs et refus gratuits
RechargeUSDT (TRC20) ou USDC (Base), tout montant entier de 10 $ à 500 $
Bonus+5 % dès 50 $, +10 % dès 100 $
Prix0,25 $ par million de tokens en entrée · 1,00 $ par million en sortie
ConnexionGoogle ou e-mail et mot de passe
Clésune clé active par compte ; une nouvelle remplace l'ancienne
Contenucontenu adulte autorisé ; tout contenu sexuel impliquant des mineurs est refusé

Codes d'erreur

Les erreurs arrivent en JSON avec un type stable ; les requêtes échouées ou refusées ne sont pas facturées.

CodeTypeSignification
400bad_requestJSON invalide, messages vides, mauvais paramètre ou contexte trop long
401missing_key · invalid_key · key_revokedclé absente, erronée ou remplacée
402no_creditplus de crédit — rechargez, la reprise est immédiate
403content_blockedcontenu sexuel impliquant des mineurs — refusé, non facturé
404not_foundendpoint inconnu
413request_too_largecorps supérieur à 8 Mo
429rate_limited · concurrencyau-delà de 300/min ou 8 en parallèle — patientez
503upstream_busymodèle occupé — réessayez dans quelques secondes

Questions et réponses

Qu'est-ce que la fenêtre de contexte et la limite de sortie ?

La fenêtre de contexte est de 100 000 tokens pour le prompt et la complétion combinés. La sortie maximale par requête est de 32 000 tokens. Si vous ne définissez pas <code>max_tokens</code>, la limite est de 2 048 tokens.

Comment recharger mon crédit ?

Rechargez uniquement avec des cryptomonnaies : USDT (TRC20) ou USDC (Base). Les montants acceptés sont des entiers en dollars, de 10 $ à 500 $. Vous recevez un bonus de +5 % pour les recharges de 50 $ ou plus, et un bonus de +10 % pour 100 $ ou plus. Le crédit n'expire jamais.

S'agit-il de l'API officielle Kimi ?

Non. Il s'agit d'un service indépendant fournissant un endpoint compatible OpenAI. Nous proposons un seul modèle sans censure. Nous ne sommes pas affiliés à Moonshot AI ou à tout autre fournisseur. Consultez la documentation des fournisseurs respectifs pour leurs API officielles.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, modifiez l'URL de base. C'est toute la configuration.

Obtenir une clé API