Kimi 사용자를 위한 Quickstart
기존 OpenAI SDK 호출을 무검열 LLM로 라우팅하려면 새로운 base URL과 API 키를 입력하세요. 이 가이드는 채팅, 스트리밍, 도구 사용 시작에 필요한 정확한 세 줄을 보여줍니다.
사전 준비: API 키
요청을 보내기 전에 API 키가 필요합니다. API 키 받기 페이지에서 Google로 계속 또는 이메일과 비밀번호로 가입하세요. 키는 즉시 표시됩니다. 새 계정에는 7일 유효한 $0.50 체험 크레딧이 제공되며, 카드가 필요하지 않습니다. 유료 사용의 경우 USDT (TRC20) 또는 USDC (Base)로 충전하세요. 충전 금액은 $10부터 $500까지입니다. $50 이상 충전 시 +5%, $100 이상 충전 시 +10% 보너스를 받습니다. 크레딧은 만료되지 않으며 실제 토큰 사용량에 대해서만 요금이 부과됩니다. 오류와 거절은 무료입니다. 계정당 활성 키는 하나만 보유할 수 있으며, 새 키를 생성하면 이전 키가 대체됩니다. 모든 요청의Authorization 헤더에 이 키를 사용하세요.
기본 채팅 완료
kimi api 엔드포인트는 표준 OpenAI chat-completion 요청을 받습니다. 클라이언트의 base URL을 https://api.kimiapi.cc/v1로 설정하고 키를 제공하세요. 우리는 ID uncensored로 식별되는 단일 전용 무검열 모델을 제공합니다. 이 모델은 오픈 웨이트 모델이며, 당사 서버에서 실행되며 합법적인 성인, 픽션 또는 논쟁적인 주제를 거부하지 않습니다. 이는 GPT, Claude, Gemini 또는 기타 벤더의 모델이 아닙니다. 프롬프트를 보내고 텍스트 응답을 받을 수 있습니다. 모델은 100,000 토큰 컨텍스트 창(프롬프트 + completion)을 지원합니다. 요청당 최대 출력은 32,000 토큰이며, max_tokens을 설정하지 않으면 2,048 토큰입니다. 임베딩, 이미지 또는 오디오는 생성되지 않습니다.
스트리밍 응답
스트리밍에는 SSE를 사용하세요. API는 생성된 토큰을 스트리밍합니다. 토큰 사용량은 마지막 청크에 포함됩니다. 이를 통해 전체 응답 대기 없이 실시간으로 비용을 모니터링할 수 있습니다. 모든 표준 OpenAI 호환 SDK에서 스트리밍을 지원합니다. 요청에stream=true을 설정하세요. 클라이언트는 텍스트가 포함된 델타 객체 시리즈를 받습니다. 이들을 연결하여 전체 응답을 복원할 수 있습니다. 이는 즉각적인 피드백을 기대하는 채팅 인터페이스에 이상적입니다. kimi api은 프록시 오버헤드를 피하여 예측 가능한 지연 시간을 보장합니다.
함수 호출 (도구)
API는 함수 호출(도구라고도 함)을 지원합니다. 요청에서 도구를 정의하고 모델은 적절한 경우 구조화된 인수를 반환합니다.tools 매개변수를 사용하여 도구 정의 목록을 전달하세요. tool_choice을 사용하여 도구를 강제로 선택하거나 자동 선택할 수도 있습니다. 모델은 도구 호출을 포함한 응답을 반환하며, 이를 API에 다시 전달하여 대화를 계속할 수 있습니다. 이를 통해 에이전트 또는 자동화 워크플로우를 구축할 수 있습니다. 도구 정의는 표준 OpenAI 형식을 따릅니다. 무검열 모델은 유효한 사용 사례에 대해 도구 사용을 거절하지 않고 도구 정의를 정확하게 처리합니다. 더 엄격한 출력 형식을 위해 JSON 모드도 사용할 수 있습니다.
JSON 모드
엄격한 출력이 필요한 애플리케이션의 경우 JSON 모드를 사용하세요.response_format을 {"type": "json_object"}로 설정하세요. 모델은 유효한 JSON 객체를 반환하려고 시도합니다. 이는 데이터 구문 분석, 구성 파일 생성 또는 다른 시스템에 구조화된 데이터를 공급하는 데 유용합니다. JSON 모드는 함수 호출과 함께 작동합니다. temperature, top_p, stop, seed, presence_penalty, frequency_penalty과 같은 매개변수를 설정하여 창의성과 결정론을 제어할 수 있습니다. 이러한 매개변수는 OpenAI 호환 클라이언트에 표준입니다. 사용 사례에 따라 일관성과 창의성의 균형을 맞추기 위해 조정하세요.
제한, 오류 및 컨텍스트
각 API 키는 분당 300개 요청 및 8개의 동시 요청으로 제한됩니다. 요청 본문은 8 MB를 초과할 수 없습니다. 키가 유효하지 않으면 401 오류가 발생합니다. 크레딧이 없으면 402 오류가 발생합니다. 속도 제한을 초과하면 429 오류가 발생합니다. 오류와 거절은 무료이므로 실패한 요청에 대해 요금이 부과되지 않습니다. 컨텍스트 창은 총 100,000 토큰입니다. 하드 콘텐츠 제한이 적용됩니다: 미성년자와 관련된 성적 콘텐츠가 포함된 요청은 항상 거절됩니다. API는 텍스트 전용입니다. 임베딩, 이미지 또는 미세 조정이 사용 가능하지 않습니다. 기타 벤더의 모델에 대해서는 현재 가격과 제한을 위해 해당 문서를 참조하세요. 이 서비스는 독립적인 대안이며 제휴 관계가 아닙니다.
cURL
curl https://api.kimiapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'Python
from openai import OpenAI
client = OpenAI(base_url="https://api.kimiapi.cc/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)Node.js
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.kimiapi.cc/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);스트리밍
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)기술 사양
크레딧을 구매하기 전에 확인할 수 있도록 API의 실제 한도와 기능을 한곳에 정리했습니다.
| 항목 | 내용 |
|---|---|
| 형식 | OpenAI 호환: 어떤 OpenAI SDK든 base URL과 키만 바꾸면 동작 |
| Base URL | https://api.kimiapi.cc/v1 |
| 모델 ID | uncensored |
| 인증 | Authorization: Bearer YOUR_KEY |
| 엔드포인트 | POST /v1/chat/completions · GET /v1/models |
| JSON 모드 | response_format: {"type": "json_object"} |
| 파라미터 | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| 컨텍스트 창 | 100,000 토큰 (입력 + 출력) |
| 함수 호출 | 지원 — tools, tool_choice; 응답에 tool_calls (스트리밍 포함), 결과는 role: tool로 전송 |
| 스트리밍 | 지원 — SSE, 마지막 청크에 토큰 사용량 포함 |
| 최대 출력 | 100,000 토큰 윈도우의 남은 만큼; max_tokens는 선택 사항(별도 상한 없음) |
| 요청 크기 | 최대 8 MB |
| 속도 제한 | 키당 분당 300회 |
| 응답 헤더 | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| 동시 요청 | 키당 동시 8개 |
| 무료 체험 | $0.50, 7일, 카드 불필요 · 체험 키: 동시 요청 2건, 분당 60건. 첫 충전 후 전체 한도(8건, 300건) 적용 |
| 유효기간 | 유료 크레딧은 만료되지 않으며 구독 없음 |
| 과금 | 선불 크레딧에서 실제 사용량만큼 차감, 오류·거부는 무료 |
| 충전 | USDT (TRC20) 또는 USDC (Base), $10~$500 사이 원하는 정수 금액 |
| 보너스 | $50 이상 +5%, $100 이상 +10% |
| 가격 | 입력 100만 토큰당 $0.25 · 출력 100만 토큰당 $1.00 |
| 로그인 | Google 또는 이메일과 비밀번호 |
| 키 | 계정당 활성 키 1개, 새 키를 만들면 이전 키는 무효 |
| 콘텐츠 | 성인 콘텐츠 허용, 미성년자가 관련된 성적 콘텐츠는 거부 |
오류 코드
오류는 고정된 type을 가진 JSON으로 반환되며, 실패하거나 거부된 요청은 과금되지 않습니다.
| 코드 | 유형 | 의미 |
|---|---|---|
400 | bad_request | 잘못된 JSON, 빈 메시지, 잘못된 파라미터 또는 컨텍스트 초과 |
401 | missing_key · invalid_key · key_revoked | 키 없음·잘못됨·새 키로 교체됨 |
402 | no_credit | 잔액 없음 — 충전하면 즉시 재개 |
403 | content_blocked | 미성년자 관련 성적 콘텐츠 — 거부, 과금 없음 |
404 | not_found | 알 수 없는 엔드포인트 |
413 | request_too_large | 본문 8 MB 초과 |
429 | rate_limited · concurrency | 분당 300회 또는 동시 8개 초과 — 잠시 후 재시도 |
503 | upstream_busy | 모델 혼잡 — 몇 초 후 재시도 |
질문과 답변
컨텍스트 창과 출력 제한은 무엇인가요?
프롬프트와 completion을 합친 컨텍스트 창은 100,000 토큰입니다. 요청당 최대 출력은 32,000 토큰입니다. <code>max_tokens</code>을 설정하지 않으면 제한은 2,048 토큰입니다.
크레딧을 어떻게 충전하나요?
암호화폐로만 충전하세요: USDT (TRC20) 또는 USDC (Base). 허용된 금액은 $10부터 $500까지 정수 달러입니다. $50 이상 충전 시 +5%, $100 이상 충전 시 +10% 보너스를 받습니다. 크레딧은 만료되지 않습니다.
이것이 공식 Kimi API인가요?
아닙니다. 이는 OpenAI 호환 엔드포인트를 제공하는 독립 서비스입니다. 우리는 단일 무검열 모델을 제공합니다. Moonshot AI 또는 기타 벤더와 제휴 관계가 아닙니다. 공식 API에 대해서는 각 벤더 문서를 참조하세요.
키는 양식 하나만 작성하면 받을 수 있습니다
계정을 생성하고 키를 복사한 후 base URL을 변경하세요. 설정은 이것뿐입니다.