返回模型列表定位 上下文 缓存 状态 费用 接入
推荐工作流
面向编码、长上下文分析和 Agent 负载的高吞吐文本工作流。01
加载上下文
将完整仓库、长文档或多轮 Agent 轨迹作为输入,利用 1M 上下文窗口。02
高速处理
利用 Flash 快速档的低延迟、低成本完成编码、摘要或批量分析。03
进入生成
将处理结果带入图像或视频工作流,衔接后续创作环节。使用建议延迟敏感或高吞吐场景(自动补全、批量分析、聊天机器人)用 Flash;需要深度推理、复杂调试、架构规划时用 Pro。
模型概览
V4 系列的快速档,兼顾速度、成本与质量。1M Token 上下文
一次调用可吃下完整仓库、长文档或多轮 Agent 轨迹,最大输出 384K tokens。缓存感知定价
自动缓存提示词前缀,命中时输入按基础价 20% 计费——Agent 循环中重复的 system prompt 和工具 schema 大幅省钱。已上线 · Starter
当前可在工作台的文本工作流中使用。每次调用 4 SP
面向高吞吐编码、摘要和 Agent 负载的低成本文本路线。DeepSeek
DeepSeek V4 Pro常见问题
了解 DeepSeek V4 Flash 的能力边界与使用方式。Flash 是 DeepSeek V4 系列的默认快速档,面向高吞吐编码、摘要、Agent 负载,支持可选思考模式和 1M 上下文。
延迟敏感或高吞吐场景(自动补全、批量分析、聊天机器人)用 Flash;需要深度推理、复杂调试、架构规划时用 Pro。
1M tokens(约 1,048,576),最大输出 384K tokens。
Flash 目标是接近 Sonnet 4.7 的编码质量,但每 token 成本仅约十分之一。
相关模型
- Gemini 3.1 Flash Lite文本生成已上线3 SP
- Claude Sonnet 4.5文本生成已上线8 SP
- Claude Sonnet 5文本生成已上线12 SP