模型列表
技术规格
详细的技术参数和能力
- 上下文窗口
- 1,000,000 tokens
- 最大输出
- 384,000 tokens
支持的请求模式
对话
能力
对话
支持多轮对话式补全
流式输出
生成过程中逐 token 增量返回
工具调用
可调用请求中定义的函数/工具
深度思考
给出最终答案前先输出一段内部推理过程
提示缓存
以更低价格复用先前处理过的提示前缀
快速集成
一个 API 调用即可开始
quickstart.py
import openai
client = openai.OpenAI(
base_url="https://api.modelsite.ai/v1",
api_key="sk-ms-...",
)
response = client.chat.completions.create(
model="deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello!"}],
)
print(response.choices[0].message.content)
推荐场景
适合交互对话、流式输出、工具调用、思考与缓存应用
按量付费
官方85折
定价
无承诺,仅按使用量付费
完整计价明细
DeepSeek V4.1 Flash 的每个计价维度
Token 计费
- Cache Read$0.0025 每百万 tokens
- Input$0.126 每百万 tokens
- Output$0.505 每百万 tokens
- Thinking$0.505 每百万 tokens
定价仅供参考——最终费用以请求时为准。
分时定价
- 默认时段其余时段$0.126 / $0.505每百万 token
- DeepSeek Peak AM周一–周五 01:00–04:00 UTC$0.252 / $1.01每百万 token
- DeepSeek Peak Late周一–周五 06:00–10:00 UTC$0.252 / $1.01每百万 token
窗口时间以所示时区为准;跨窗口边界的请求按请求时刻所属窗口计费。