Deepseek V4 Flash

Try in Playground
silvamux/deepseek-v4-flash

DeepSeek V4 Flash是一款侧重信息检索/RAG的模型,在文本理解方面也有较好表现。它适合处理企业知识检索、资料问答与检索增强生成,可作为相关业务流程中的理解、推理或生成能力底座。

Supported modalities
text
Input price¥3 / 1M tokensper 1M tokens
Output price¥9 / 1M tokensper 1M tokens
Context1M
Max output384K
Released2026-04-24

Pricing

Tune and Pro share the same prices.

Input contextInputOutputCache readCache write
-¥3 / 1M tokens¥9 / 1M tokens¥0.1 / 1M tokens¥3 / 1M tokens

Capabilities

DeepSeek V4 Flash在本轮能力评测中综合得分79,整体表现良好。其信息检索 / RAG(94%)和文本理解(92%)表现突出,能够从知识库和多来源资料中定位信息、组织证据并生成有依据的回答,并分析文档语义、提取关键信息并处理复杂问答。对企业知识库团队、AI 应用开发者和研究人员而言,它适合用于资料检索、文档问答、信息抽取和检索增强生成场景,解决从大量资料中找到相关信息,并形成可用于后续决策的回答;多语言能力(89%)也为相关任务提供补充。使用时应留意,智能体协同(36%)相对较弱,在需要多步骤自主规划、连续工具调用或跨智能体协作的任务中,建议增加人工复核或专项验证。

Performance

Deepseek V4 Flash Tune

deepseek-v4-flash@tune
延迟
12.48s
吞吐量
1.65Ktokens/min
可用率
98.66%
Availability
98.66%
完成率
97%
缓存命中率
36.2%
累计评测耗时
8793.7s
Token 消耗
241,733tokens
平均请求次数
1.0
TPM
1,649tokens/min
QPM
1.0req/min

Deepseek V4 Flash

deepseek-v4-flash
延迟
8.32s
吞吐量
5.88Ktokens/min
可用率
98.8%
Availability
98.8%
完成率
78%
缓存命中率
动态变化
累计评测耗时
17803.2s
Token 消耗
1,743,969tokens
平均请求次数
5.6
TPM
5,877tokens/min
QPM
0.7req/min

Deepseek V4 Flash example code and API

Tunedeepseek-v4-flash@tune
/api/v0/chat/completions/api/v1/chat/completions/api/anthropic/v1/messages
UnifiedOpenAIAnthropic
Prodeepseek-v4-flash
/api/v0/chat/completions/api/v1/responses/api/anthropic/v1/messages
UnifiedOpenAI ResponsesAnthropic
curl https://www.silvamux.com/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [{"role": "user", "content": "Hello, please introduce yourself"}]
  }'