如何接入 Kimi K3 API:定价、速率限制与设置指南
Kimi K3 API 价格详情
K3 的定价标志着月之暗面(Moonshot AI)的一次重大转向——它比之前的 Kimi 模型贵了不少,已经跻身西方前沿模型的价格梯队,不过按单次任务算,仍然比它们便宜。
按 Token 计价
| Token 类型 | 每百万 Token 价格(美元) | 每百万 Token 价格(人民币) |
|---|---|---|
| 输入(缓存未命中) | $3.00 | ¥20 |
| 输入(缓存命中) | $0.30 | ¥2 |
| 输出 | $15.00 | ¥100 |
与其他模型对比
| 模型 | 输入(缓存未命中) | 输出 |
|---|---|---|
| Kimi K3 | $3.00 | $15.00 |
| GPT-5.6 Sol | $5.00 | $30.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| DeepSeek V4-Pro | ~$0.18 | ~$0.90 |
| Qwen3.7-Max | ~$1.07 | ~$5.36 |
K3 处在一个有趣的位置:它是有史以来中国 AI 公司发布的最贵模型(输出价格大约是 DeepSeek V4-Pro 的 16.7 倍),但按单个 Token 算,仍然比西方顶级闭源模型便宜 50%-70%。
缓存优势
标价不是全部真相。K3 的架构就是为高缓存命中率而生的。月之暗面的 Mooncake 服务架构据称在代码密集的 agent 工作负载中能实现超过 90% 的缓存命中率。这意味着实际使用中,大部分输入 Token 都会按缓存价格 $0.30/M 计费——相当于打了一折。
第三方测试机构 Artificial Analysis 发现,尽管 K3 的单 Token 输出价格高,但其平均单次任务成本(约 $0.94)与 GPT-5.6 Sol(约 $1.04)相当,大约是 Claude Opus 4.8(约 $1.80)的一半。原因是 K3 完成同等任务消耗的总 Token 数更少。在 DeepSWE 基准测试中,K3 每次 rollout 的成本是 $4.65——相比之下,Claude Fable 5 是 $13.41,GPT-5.6 Sol 是 $8.37。
如何接入 Kimi K3 API:定价、速率限制与部署指南
实际成本估算
以下是使用 K3 时典型场景的成本:
| 场景 | 输入Tokens | 输出Tokens | 费用(估算) |
|------|-----------|-----------|------------|
| 单次聊天消息 | ~500 | ~300 | ~$0.006 |
| 代码生成任务 | ~2,000 | ~1,500 | ~$0.029 |
| 全量智能体编码会话(开启缓存) | ~50,000 | ~20,000 | ~$0.45 |
| 大型仓库分析(1M上下文,开启缓存) | ~500,000 | ~5,000 | ~$0.23 |
| 开发者日常高频使用(开启缓存) | ~2M | ~500K | ~$13.50 |
这些只是估算值——你的实际成本取决于缓存命中率、任务复杂度和输出长度。
速率限制与访问限制
Moonshot AI 尚未公布明确的每分钟请求数(RPM)或每分钟Token数(TPM)上限,但已知以下几项访问限制:
消费者订阅暂停
在 K3 于 2026 年 7 月 16 日上线后的 48 小时内,Moonshot 暂停了面向消费者的新订阅。服务器负载已达上限,现有 GPU 集群无法应对指数级增长的调用量。可用的算力优先保障了存量付费用户。截至 2026 年 7 月下旬,随着新增容量逐步到位,这一限制正在逐渐解除。
API 参数限制
上线初期,部分参数被锁定:
- 推理强度(reasoning_effort):仅支持 reasoning_effort="max",无法设置为 low 或 medium 以减少Token消耗。更轻量的模式将在后续版本提供。
- 温度(temperature)、top_p、惩罚参数:全部固定。开发者必须在 API 请求中省略这些参数——包含它们可能导致报错或被静默忽略。
- 公共图片 URL:上线初期 API 不支持。如需图像输入,请使用 base64 编码或文件上传。
吞吐量观测
来自 Vercel 的第三方网关数据显示了两个性能档位:
| 变体 | 吞吐量 | 延迟 |
|---|---|---|
| Kimi K3 (标准) | ~33-35 tokens/秒 | ~5.5-6.3秒 |
| Kimi K3 Fast | ~117 tokens/秒 | ~2.8秒 |
标准档的响应速度明显慢于 GPT-5.6 Sol 和 Claude Fable 5。如果你的场景对延迟敏感,建议使用 Fast 变体或采用流式输出来隐藏等待时间。
Python 环境配置(5分钟以内)
Kimi K3 使用 OpenAI 的 SDK。如果你之前用过 OpenAI API,切换到 K3 只需修改三处参数。
如何调用 Kimi K3 API:价格、速率限制与接入指南
第1步:安装SDK
python -m pip install --upgrade "openai>=1.0"
第2步:获取你的 API Key
访问 platform.moonshot.ai(国际版)或 platform.moonshot.cn(国内版)。登录或注册账号,进入 API Keys 页面,点击 Create 生成一个新密钥(密钥以 sk- 开头)。创建后立即复制密钥——关闭页面后你将无法再次查看。给账户充一点余额(几美元就够起步)。
第3步:配置环境变量
export MOONSHOT_API_KEY="sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"
第4步:编写你的第一次调用
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1", # 国际版端点
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "你是一个乐于助人的编程助手。"},
{"role": "user", "content": "写一个 Python 函数,用于解析 CSV 文件并返回摘要统计信息。"},
],
max_completion_tokens=1200,
)
print(completion.choices[0].message.content)
第5步:添加流式输出
如果需要实时打字机效果:
stream = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "解释 Kimi Delta Attention 机制。"}],
stream=True,
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Node.js 接入
JavaScript/TypeScript 开发者可以这样配置:
npm install openai
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.MOONSHOT_API_KEY,
baseURL: "https://api.moonshot.ai/v1",
});
const completion = await client.chat.completions.create({
model: "kimi-k3",
messages: [
{role: "user", content: "写一个带防抖功能的搜索框 React 组件。"},
],
max_completion_tokens: 1500,
});
console.log(completion.choices[0].message.content);
Node.js 流式输出:
const stream = await client.chat.completions.create({
model: "kimi-k3",
messages: [{role: "user", content: "解释 REST 与 GraphQL 的区别。"}],
stream: true,
});
for await (const chunk of stream) {
if (chunk.choices[0].delta.content) {
process.stdout.write(chunk.choices[0].delta.content);
}
}
(继续翻译后续内容)