如果 API 发生高并发 429 限流,应如何处理?
建议在客户端集成指数退避重试 (Exponential Backoff with Jitter)。同时可在控制台联系支持团队升级 Tier 梯队,获取更高的 RPM 与 TPM 配额保障。
在客户端代码中配置 Base URL 为官方接口地址,并将请求头 Authorization 设置为控制台颁发的密钥。
针对重复的系统设定与长文档,接口将自动命中前缀缓存,不仅首字时延骤降,Token 单价更可节省高达 90%。
将业务样例数据集导入 DeepSeek Harness 测试脚本,自动评估模型问答准确度、输出格式契合度与并发吞吐指标。
提供 Python、JavaScript、Go 与 cURL 调用范例。从零开始搭建生产级流式对话与函数调用应用。
涵盖 Ollama、vLLM、LMDeploy 等轻量级部署方案,提供从 1.5B 蒸馏版到 671B 满血版的全栈配置建议。
针对特定垂直领域任务的自动化质量度量。支持长文档检索、代码审查与多智能体工作流验证。
查看充值开票、并发配额梯度 (Tier) 与超量降级方案,清晰透明掌握每一笔推理算力账单。
以下费用以人民币为基准计量,完全支持前缀上下文缓存自动优化,无须开发者手动申请额外缓存配额。
| 模型名称 | 上下文窗口 | 输入价格 (命中缓存) | 输入价格 (未命中缓存) | 输出价格 |
|---|---|---|---|---|
| DeepSeek-V3 (通用旗舰) | 64K Tokens | 0.50 元 / 1M | 2.00 元 / 1M | 8.00 元 / 1M |
| DeepSeek-R1 (深度推理旗舰) | 64K Tokens | 1.00 元 / 1M | 4.00 元 / 1M | 16.00 元 / 1M |
| DeepSeek-R1-Distill (蒸馏系列) | 32K Tokens | 免费开源 | 免费开源 | 支持完全离线部署 |