Guida rapida per gli utenti di Kimi
Inserisci un nuovo URL base e una chiave API per instradare le tue chiamate SDK OpenAI esistenti a un LLM senza censura. Questa guida mostra le tre esatte righe necessarie per iniziare a chattare, fare streaming e usare strumenti con il nostro endpoint compatibile.
Prerequisiti: chiave API
Prima di inviare richieste, hai bisogno di una chiave API. Iscriviti alla pagina Ottieni chiave API usando Continua con Google o con email e password. La tua chiave appare immediatamente. I nuovi account ricevono $0,50 di credito di prova valido per 7 giorni; non è richiesta una carta di credito. Per l'uso a pagamento, ricarica con USDT (TRC20) o USDC (Base). Le ricariche vanno da $10 a $500. Ricevi un bonus del +5% per ricariche di $50 o più, e un bonus del +10% per $100 o più. Il credito non scade mai e viene addebitato solo per l'utilizzo reale di token. Errori e rifiuti sono gratuiti. Puoi avere una chiave attiva per account; la generazione di una nuova chiave sostituisce quella vecchia. Usa questa chiave nell'intestazioneAuthorization per tutte le richieste.
Completamento chat di base
L'endpointkimi api accetta richieste standard di completamento chat OpenAI. Imposta l'URL base del tuo client su https://api.kimiapi.cc/v1 e fornisci la tua chiave. Serviamo un unico modello dedicato senza censura identificato dall'ID uncensored. Questo modello a pesi aperti è eseguito sui nostri server e non rifiuta argomenti adulti leciti, fiction o controversi. Non è GPT, Claude, Gemini o il modello di nessun altro fornitore. Puoi inviare prompt e ricevere risposte testuali. Il modello supporta una finestra di contesto di 100.000 token (prompt + completamento). L'output massimo per richiesta è di 32.000 token, o 2.048 se non imposti max_tokens. Non vengono generati embedding, immagini o audio.
Risposte in streaming
Usa Server-Sent Events (SSE) per lo streaming. L'API trasmette i token man mano che vengono generati. Le informazioni sull'utilizzo dei token sono incluse nell'ultimo chunk dello stream. Questo ti permette di monitorare i costi in tempo reale senza attendere la risposta completa. Lo streaming è supportato da tutti gli SDK compatibili con OpenAI. Impostastream=true nella tua richiesta. Il client riceverà una serie di oggetti delta contenenti il testo. Puoi concatenare questi delta per ricostruire la risposta completa. Questo è ideale per le interfacce chat dove gli utenti si aspettano feedback immediato. L'endpoint kimi api garantisce latenza prevedibile evitando l'overhead del proxy.
Chiamata di funzioni (strumenti)
L'API supporta la chiamata di funzioni, nota anche come strumenti. Puoi definire gli strumenti nella tua richiesta e il modello restituirà argomenti strutturati quando appropriato. Usa il parametrotools per passare un elenco di definizioni di strumenti. Puoi anche usare tool_choice per forzare o selezionare automaticamente gli strumenti. Il modello restituisce una risposta con chiamate di funzioni, che puoi passare nuovamente all'API per continuare la conversazione. Questo permette di costruire agenti o flussi di lavoro automatizzati. Le definizioni degli strumenti seguono il formato standard OpenAI. Il modello senza censura gestisce le definizioni degli strumenti con precisione senza rifiutarsi di usarle per casi d'uso validi. È disponibile anche la modalità JSON per una formattazione dell'output più rigorosa.
Modalità JSON
Per le applicazioni che richiedono un output rigoroso, usa la modalità JSON. Impostaresponse_format su {"type": "json_object"}. Il modello cercherà di restituire un oggetto JSON valido. Questo è utile per l'analisi dei dati, la generazione di file di configurazione o l'alimentazione di dati strutturati in altri sistemi. La modalità JSON funziona insieme alla chiamata di funzioni. Puoi anche impostare parametri come temperature, top_p, stop, seed, presence_penalty e frequency_penalty per controllare creatività e determinismo. Questi parametri sono standard per i client compatibili con OpenAI. Regolali per bilanciare coerenza e creatività in base al tuo caso d'uso.
Limiti, errori e contesto
Ogni chiave API è limitata a 300 richieste al minuto e 8 richieste parallele. Il corpo della richiesta non deve superare 8 MB. Se la chiave non è valida, ricevi un errore 401. Se non hai credito, ricevi un errore 402. Se superi il limite di richieste, ricevi un errore 429. Errori e rifiuti sono gratuiti, quindi non ti vengono addebitate le richieste fallite. La finestra di contesto è di 100.000 token in totale. Si applica un limite rigido di contenuto: le richieste che coinvolgono contenuti sessuali con minori vengono sempre rifiutate. L'API è solo testuale. Non sono disponibili embedding, immagini o fine-tuning. Per i modelli di altri fornitori, consulta la loro documentazione per i prezzi e i limiti attuali. Questo servizio è un'alternativa indipendente, non affiliata a loro.
cURL
curl https://api.kimiapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.kimiapi.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.kimiapi.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Streaming
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Specifiche tecniche
Tutti i limiti e le funzioni reali dell'API in un unico posto: controllali prima di ricaricare.
| Voce | Valore |
|---|---|
| Formato | compatibile OpenAI: qualsiasi SDK OpenAI funziona cambiando base URL e chiave |
| Base URL | https://api.kimiapi.cc/v1 |
| ID modello | uncensored |
| Autenticazione | Authorization: Bearer YOUR_KEY |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Modalità JSON | response_format: {"type": "json_object"} |
| Parametri | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Finestra di contesto | 100.000 token (input + output) |
| Function calling | sì — tools, tool_choice; risposte con tool_calls anche in streaming; risultati come role: tool |
| Streaming | sì — server-sent events; l'ultimo blocco riporta l'uso dei token |
| Output massimo | fino al resto della finestra di 100.000 token; max_tokens opzionale (nessun limite separato) |
| Dimensione | fino a 8 MB per richiesta |
| Limite di frequenza | 300 richieste al minuto per chiave |
| Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Concorrenza | 8 richieste contemporanee per chiave |
| Prova gratuita | $0,50 per 7 giorni, senza carta · Chiave di prova: 2 richieste parallele, 60 al minuto; limiti completi (8 e 300) dopo la prima ricarica |
| Scadenza | il credito pagato non scade, nessun abbonamento |
| Fatturazione | credito prepagato in base all'uso reale; errori e rifiuti gratuiti |
| Ricarica | USDT (TRC20) o USDC (Base), qualsiasi importo intero da $10 a $500 |
| Bonus | +5% da $50, +10% da $100 |
| Prezzo | $0,25 per 1M token in input · $1,00 per 1M in output |
| Accesso | Google oppure e-mail e password |
| Chiavi | una chiave attiva per account; una nuova sostituisce la precedente |
| Contenuti | contenuti per adulti consentiti; rifiutati i contenuti sessuali con minori |
Codici di errore
Gli errori arrivano in JSON con un type fisso; le richieste fallite o rifiutate non si pagano.
| Codice | Tipo | Significato |
|---|---|---|
400 | bad_request | JSON non valido, messaggi vuoti, parametro errato o contesto troppo lungo |
401 | missing_key · invalid_key · key_revoked | chiave mancante, errata o sostituita |
402 | no_credit | credito esaurito — ricarica e riparti subito |
403 | content_blocked | contenuti sessuali con minori — rifiutato, non addebitato |
404 | not_found | endpoint sconosciuto |
413 | request_too_large | corpo oltre 8 MB |
429 | rate_limited · concurrency | oltre 300/min o 8 in parallelo — attendi e riprova |
503 | upstream_busy | modello occupato — riprova tra pochi secondi |
Domande e risposte
Qual è la finestra di contesto e il limite di output?
La finestra di contesto è di 100.000 token per prompt e completamento combinati. L'output massimo per richiesta è di 32.000 token. Se non imposti <code>max_tokens</code>, il limite è di 2.048 token.
Come ricarico il mio credito?
Ricarica solo con criptovalute: USDT (TRC20) o USDC (Base). Gli importi accettati sono dollari interi da $10 a $500. Ricevi un bonus del +5% per ricariche di $50 o più, e un bonus del +10% per $100 o più. Il credito non scade mai.
Questa è l'API ufficiale di Kimi?
No. Questo è un servizio indipendente che fornisce un endpoint compatibile con OpenAI. Serviamo un unico modello senza censura. Non siamo affiliati a Moonshot AI o ad altri fornitori. Consulta la documentazione dei rispettivi fornitori per le loro API ufficiali.
La tua chiave è a un modulo di distanza
Crea un account, copia la chiave, cambia l'URL base. È tutta qui la configurazione.