如何接入 Kimi K3 API:定价、速率限制与设置指南

Dev.to AI 2026-07-28T11:15:04.825255

Kimi K3 API 价格详情

K3 的定价标志着月之暗面(Moonshot AI)的一次重大转向——它比之前的 Kimi 模型贵了不少,已经跻身西方前沿模型的价格梯队,不过按单次任务算,仍然比它们便宜。

按 Token 计价

Token 类型 每百万 Token 价格(美元) 每百万 Token 价格(人民币)
输入(缓存未命中) $3.00 ¥20
输入(缓存命中) $0.30 ¥2
输出 $15.00 ¥100

与其他模型对比

模型 输入(缓存未命中) 输出
Kimi K3 $3.00 $15.00
GPT-5.6 Sol $5.00 $30.00
Claude Fable 5 $10.00 $50.00
DeepSeek V4-Pro ~$0.18 ~$0.90
Qwen3.7-Max ~$1.07 ~$5.36

K3 处在一个有趣的位置:它是有史以来中国 AI 公司发布的最贵模型(输出价格大约是 DeepSeek V4-Pro 的 16.7 倍),但按单个 Token 算,仍然比西方顶级闭源模型便宜 50%-70%。

缓存优势

标价不是全部真相。K3 的架构就是为高缓存命中率而生的。月之暗面的 Mooncake 服务架构据称在代码密集的 agent 工作负载中能实现超过 90% 的缓存命中率。这意味着实际使用中,大部分输入 Token 都会按缓存价格 $0.30/M 计费——相当于打了一折。

第三方测试机构 Artificial Analysis 发现,尽管 K3 的单 Token 输出价格高,但其平均单次任务成本(约 $0.94)与 GPT-5.6 Sol(约 $1.04)相当,大约是 Claude Opus 4.8(约 $1.80)的一半。原因是 K3 完成同等任务消耗的总 Token 数更少。在 DeepSWE 基准测试中,K3 每次 rollout 的成本是 $4.65——相比之下,Claude Fable 5 是 $13.41,GPT-5.6 Sol 是 $8.37。

如何接入 Kimi K3 API:定价、速率限制与部署指南

实际成本估算

以下是使用 K3 时典型场景的成本:
| 场景 | 输入Tokens | 输出Tokens | 费用(估算) |
|------|-----------|-----------|------------|
| 单次聊天消息 | ~500 | ~300 | ~$0.006 |
| 代码生成任务 | ~2,000 | ~1,500 | ~$0.029 |
| 全量智能体编码会话(开启缓存) | ~50,000 | ~20,000 | ~$0.45 |
| 大型仓库分析(1M上下文,开启缓存) | ~500,000 | ~5,000 | ~$0.23 |
| 开发者日常高频使用(开启缓存) | ~2M | ~500K | ~$13.50 |

这些只是估算值——你的实际成本取决于缓存命中率、任务复杂度和输出长度。

速率限制与访问限制

Moonshot AI 尚未公布明确的每分钟请求数(RPM)或每分钟Token数(TPM)上限,但已知以下几项访问限制:

消费者订阅暂停
在 K3 于 2026 年 7 月 16 日上线后的 48 小时内,Moonshot 暂停了面向消费者的新订阅。服务器负载已达上限,现有 GPU 集群无法应对指数级增长的调用量。可用的算力优先保障了存量付费用户。截至 2026 年 7 月下旬,随着新增容量逐步到位,这一限制正在逐渐解除。

API 参数限制
上线初期,部分参数被锁定:
- 推理强度(reasoning_effort):仅支持 reasoning_effort="max",无法设置为 low 或 medium 以减少Token消耗。更轻量的模式将在后续版本提供。
- 温度(temperature)、top_p、惩罚参数:全部固定。开发者必须在 API 请求中省略这些参数——包含它们可能导致报错或被静默忽略。
- 公共图片 URL:上线初期 API 不支持。如需图像输入,请使用 base64 编码或文件上传。

吞吐量观测
来自 Vercel 的第三方网关数据显示了两个性能档位:

变体 吞吐量 延迟
Kimi K3 (标准) ~33-35 tokens/秒 ~5.5-6.3秒
Kimi K3 Fast ~117 tokens/秒 ~2.8秒

标准档的响应速度明显慢于 GPT-5.6 Sol 和 Claude Fable 5。如果你的场景对延迟敏感,建议使用 Fast 变体或采用流式输出来隐藏等待时间。

Python 环境配置(5分钟以内)

Kimi K3 使用 OpenAI 的 SDK。如果你之前用过 OpenAI API,切换到 K3 只需修改三处参数。

如何调用 Kimi K3 API:价格、速率限制与接入指南

第1步:安装SDK

python -m pip install --upgrade "openai>=1.0"

第2步:获取你的 API Key

访问 platform.moonshot.ai(国际版)或 platform.moonshot.cn(国内版)。登录或注册账号,进入 API Keys 页面,点击 Create 生成一个新密钥(密钥以 sk- 开头)。创建后立即复制密钥——关闭页面后你将无法再次查看。给账户充一点余额(几美元就够起步)。

第3步:配置环境变量

export MOONSHOT_API_KEY="sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx"

第4步:编写你的第一次调用

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",   # 国际版端点
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "你是一个乐于助人的编程助手。"},
        {"role": "user", "content": "写一个 Python 函数,用于解析 CSV 文件并返回摘要统计信息。"},
    ],
    max_completion_tokens=1200,
)

print(completion.choices[0].message.content)

第5步:添加流式输出

如果需要实时打字机效果:

stream = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "解释 Kimi Delta Attention 机制。"}],
    stream=True,
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

Node.js 接入

JavaScript/TypeScript 开发者可以这样配置:

npm install openai
import OpenAI from "openai";

const client = new OpenAI({
    apiKey: process.env.MOONSHOT_API_KEY,
    baseURL: "https://api.moonshot.ai/v1",
});

const completion = await client.chat.completions.create({
    model: "kimi-k3",
    messages: [
        {role: "user", content: "写一个带防抖功能的搜索框 React 组件。"},
    ],
    max_completion_tokens: 1500,
});

console.log(completion.choices[0].message.content);

Node.js 流式输出:

const stream = await client.chat.completions.create({
    model: "kimi-k3",
    messages: [{role: "user", content: "解释 REST 与 GraphQL 的区别。"}],
    stream: true,
});

for await (const chunk of stream) {
    if (chunk.choices[0].delta.content) {
        process.stdout.write(chunk.choices[0].delta.content);
    }
}

(继续翻译后续内容)

查看原文