Início rápido para usuários do Kimi
Substitua a URL base e a chave de API para rotear suas chamadas existentes do SDK OpenAI para um LLM sem censura. Este guia mostra as três linhas exatas necessárias para iniciar conversas, streaming e uso de ferramentas com nosso endpoint compatível.
Pré-requisitos: Chave de API
Antes de enviar requisições, você precisa de uma chave de API. Cadastre-se na página Obter chave de API usando Continuar com Google ou e-mail e senha. Sua chave aparece imediatamente. Contas novas recebem $0,50 em crédito de teste válido por 7 dias; nenhum cartão é necessário. Para uso pago, recarregue com USDT (TRC20) ou USDC (Base). As recargas variam de $10 a $500. Você recebe um bônus de +5% para recargas de $50 ou mais, e um bônus de +10% para $100 ou mais. O crédito nunca expira e é cobrado apenas pelo uso real de tokens. Erros e recusas são gratuitos. Você pode ter uma chave ativa por conta; gerar uma nova chave substitui a antiga. Use esta chave no cabeçalhoAuthorization para todas as requisições.
Completar Chat Básico
O endpointkimi api aceita solicitações padrão de chat-completion da OpenAI. Defina a URL base do seu cliente para https://api.kimiapi.cc/v1 e forneça sua chave. Oferecemos um único modelo sem censura dedicado, identificado pelo ID uncensored. Este modelo é de pesos abertos, executa em nossos servidores e não recusa tópicos adultos legais, ficcionais ou controversos. Não é GPT, Claude, Gemini ou qualquer outro modelo de fornecedor. Você pode enviar prompts e receber respostas em texto. O modelo suporta uma janela de contexto de 100.000 tokens (prompt + conclusão). A saída máxima por requisição é de 32.000 tokens, ou 2.048 se você não definir max_tokens. Não há geração de embeddings, imagens ou áudio.
Respostas em Streaming
Use Server-Sent Events (SSE) para streaming. A API envia tokens conforme são gerados. Informações de uso de tokens são incluídas no último fragmento do stream. Isso permite que você monitore custos em tempo real sem aguardar a resposta completa. O streaming é compatível com todos os SDKs padrão compatíveis com OpenAI. Definastream=true na sua requisição. O cliente receberá uma série de objetos delta contendo o texto. Você pode concatenar esses deltas para reconstruir a resposta completa. Isso é ideal para interfaces de chat onde os usuários esperam feedback imediato. A kimi api garante latência previsível ao evitar sobrecarga de proxy.
Chamada de Funções (Ferramentas)
A API suporta chamada de funções, também conhecida como ferramentas. Você pode definir ferramentas em sua solicitação e o modelo retornará argumentos estruturados quando apropriado. Use o parâmetrotools para passar uma lista de definições de ferramentas. Você também pode usar tool_choice para forçar ou selecionar automaticamente ferramentas. O modelo retorna uma resposta com chamadas de ferramentas, que você pode passar de volta para a API para continuar a conversa. Isso permite criar agentes ou fluxos de trabalho automatizados. As definições de ferramentas seguem o formato padrão da OpenAI. O modelo sem censura lida com definições de ferramentas com precisão sem recusar seu uso para casos de uso válidos. O modo JSON também está disponível para formatação de saída mais rigorosa.
Modo JSON
Para aplicações que exigem saída rigorosa, use o modo JSON. Definaresponse_format para {"type": "json_object"}. O modelo tentará retornar um objeto JSON válido. Isso é útil para analisar dados, gerar arquivos de configuração ou alimentar dados estruturados em outros sistemas. O modo JSON funciona junto com a chamada de funções. Você também pode definir parâmetros como temperature, top_p, stop, seed, presence_penalty e frequency_penalty para controlar criatividade e determinismo. Esses parâmetros são padrão para clientes compatíveis com OpenAI. Ajuste-os para equilibrar consistência e criatividade com base no seu caso de uso.
Limites, Erros e Contexto
Cada chave de API está limitada a 300 requisições por minuto e 8 requisições simultâneas. O corpo da requisição não deve exceder 8 MB. Se a chave for inválida, você receberá um erro 401. Se você não tiver crédito, receberá um erro 402. Se você exceder o limite de requisições, receberá um erro 429. Erros e recusas são gratuitos, então você não é cobrado por requisições falhas. A janela de contexto é de 100.000 tokens no total. Aplica-se um limite rígido de conteúdo: requisições envolvendo conteúdo sexual com menores são sempre recusadas. A API é apenas de texto. Não há embeddings, imagens ou fine-tuning disponíveis. Para modelos de outros fornecedores, consulte a documentação deles para preços e limites atuais. Este serviço é uma alternativa independente, não afiliada a eles.
cURL
curl https://api.kimiapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.kimiapi.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.kimiapi.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);Streaming
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)Recursos e limites
Todos os limites e recursos reais da API em um só lugar — confira antes de recarregar.
| Item | Valor |
|---|---|
| Formato | compatível com OpenAI: qualquer SDK da OpenAI funciona trocando a base URL e a chave |
| Base URL | https://api.kimiapi.cc/v1 |
| ID do modelo | uncensored |
| Autenticação | Authorization: Bearer YOUR_KEY |
| Endpoints | POST /v1/chat/completions · GET /v1/models |
| Modo JSON | response_format: {"type": "json_object"} |
| Parâmetros | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Janela de contexto | 100.000 tokens (entrada + saída) |
| Chamada de funções | sim — tools, tool_choice; resposta com tool_calls, inclusive em streaming; resultados como role: tool |
| Streaming | sim — server-sent events; o último bloco traz o uso de tokens |
| Saída máxima | até o restante da janela de 100.000 tokens; max_tokens opcional (sem limite separado) |
| Tamanho | até 8 MB por requisição |
| Limite de taxa | 300 requisições por minuto por chave |
| Cabeçalhos | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Concorrência | 8 requisições ao mesmo tempo por chave |
| Teste grátis | $0,50 por 7 dias, sem cartão · Chave de teste: 2 requisições paralelas, 60 por minuto; limites totais (8 e 300) após a primeira recarga |
| Validade | crédito pago não expira, sem assinatura |
| Cobrança | crédito pré-pago pelo uso real; erros e recusas são grátis |
| Recarga | USDT (TRC20) ou USDC (Base), qualquer valor inteiro de $10 a $500 |
| Bônus | +5% a partir de $50, +10% a partir de $100 |
| Preço | $0,25 por 1M tokens de entrada · $1,00 por 1M de saída |
| Login | Google ou e-mail e senha |
| Chaves | uma chave ativa por conta; uma nova substitui a anterior |
| Conteúdo | conteúdo adulto permitido; conteúdo sexual com menores é recusado |
Códigos de erro
Erros chegam em JSON com um type fixo; requisições com falha ou recusadas não são cobradas.
| Código | Tipo | Significado |
|---|---|---|
400 | bad_request | JSON inválido, mensagens vazias, parâmetro errado ou contexto longo demais |
401 | missing_key · invalid_key · key_revoked | chave ausente, errada ou substituída |
402 | no_credit | sem crédito — recarregue e continue na hora |
403 | content_blocked | conteúdo sexual com menores — recusado, sem cobrança |
404 | not_found | endpoint desconhecido |
413 | request_too_large | corpo acima de 8 MB |
429 | rate_limited · concurrency | acima de 300/min ou 8 em paralelo — aguarde e tente de novo |
503 | upstream_busy | modelo ocupado — tente em alguns segundos |
Perguntas e respostas
Qual é a janela de contexto e o limite de saída?
A janela de contexto é de 100.000 tokens para o prompt e a conclusão combinados. A saída máxima por requisição é de 32.000 tokens. Se você não definir <code>max_tokens</code>, o limite é de 2.048 tokens.
Como recarrego meu crédito?
Recarregue apenas com criptomoedas: USDT (TRC20) ou USDC (Base). Os valores aceitos são dólares inteiros de $10 a $500. Você recebe um bônus de +5% para recargas de $50 ou mais, e um bônus de +10% para $100 ou mais. O crédito nunca expira.
Esta é a API oficial do Kimi?
Não. Este é um serviço independente que fornece um endpoint compatível com OpenAI. Oferecemos um único modelo sem censura. Não somos afiliados à Moonshot AI ou a qualquer outro fornecedor. Consulte a documentação oficial dos respectivos fornecedores para suas APIs.
Sua chave está a um formulário de distância
Crie uma conta, copie a chave, altere a URL base. Essa é toda a configuração.