DeepSeek V4.1 Flash 模型状态:内测、价格与 API 接入
DeepSeek V4.1 Flash 当前处于内测阶段:临时模型 ID、API 定价、可用性状态,以及开发者接入前需要了解的信息。
发布于 2026-09-08
DeepSeek V4.1 Flash 于 2026 年 9 月 8 日进入限量测试阶段。 其临时模型 ID 为 deepseek-v4.1-flash-expires-on-0910。现有 DeepSeek 开发者可保留原有 base URL,使用新的模型 ID,每个账户最多可发送 20 个并发请求。当前计费标准与 V4 Flash 一致。社区示例显示速度可达 300-507 输出 tokens/s,但这些仅为个人观察结果,并非 APIMaster 的基准测试数据,也不代表服务速度保证。
在 APIMaster,我们更关心新模型能为实际应用带来什么:响应能否更快、多模态任务能否做得更好,以及完成同样任务需要花多少钱。截至 9 月 8 日查询,APIMaster 公开模型列表中已有 V4 Flash、V4 Pro 和 V4 Flash Vision Exp,尚未列出本次 V4.1 Flash 内测型号。 您可以创建 APIMaster 账户,先使用已上线的 DeepSeek 模型,并在模型广场中比较价格和可用渠道。
当前模型状态
| 项目 | 当前状态 |
|---|---|
| 上游状态 | 限量内测 |
| 临时模型 ID | deepseek-v4.1-flash-expires-on-0910 |
| 上游调用方式 | 保持原有 DeepSeek base URL,使用临时模型 ID |
| 并发限制 | 每账户最多 20 个并发请求 |
| APIMaster 状态 | 当前未列出该临时型号 |
| 可立即使用的替代模型 | deepseek-v4-flash、deepseek-v4-pro、deepseek-v4-flash-vision-exp |
| 下一步 | 在模型广场查看实时状态,或使用 DeepSeek API 测试工具测试当前可用模型 |
本页会随着模型的正式发布、API 参数和 APIMaster 接入状态持续更新。
DeepSeek V4.1 Flash 有哪些新特性?
当前公开信息显示,V4.1 Flash 是采用新模型架构的中间版本,具备原生多模态支持、更强的能力、更快的响应速度和更低的成本。这是一个早期测试版本,因此这些特性应在此背景下理解。
对开发者而言,值得关注的组合是在相同公开 API 价格下获得更强的能力。内部模型成本的降低并不自动意味着客户账单的降低:当前预览版按 V4 Flash 费率计费。
当前公开信息未说明上下文窗口、最大输出长度、支持的图片格式、音频或视频接口,也未提供详细的评测分数。原生多模态本身并不能证明支持所有媒体类型。在围绕这些能力设计应用之前,我们建议先检查实际接口并测试代表性输入。
速度有多快?如何理解 507 tokens/s
社区开发者已在 X 上分享初步体验:一位开发者测得峰值输出速度为 507 tokens/s;另一位在生成包含骑自行车鹈鹕 SVG 动画的 HTML 页面时获得 328 tokens/s;还有一位在类似任务上测得平均速度超过 300 tokens/s。
这对于代码生成、长响应和交互式助手来说很有前景。但这还不是受控对比:文章未提供统一的测量方法、完整的请求设置或可重复的结果分布。
在 APIMaster,我们建议同时关注三项指标:
| 指标 | 说明 |
|---|---|
| 首 token 延迟 | 用户等待响应开始的时间 |
| 每秒输出 tokens | 生成开始后答案到达的速度 |
| 总完成时间和正确性 | 整个任务是否快速完成并产生可用结果 |
示例说明,并非基准测试: 一个 1,000 token 的答案在持续 300 tokens/s 的速度下,输出生成约需 3.3 秒。在 507 tokens/s 的速度下约需 2.0 秒。两项计算均不包括排队、初始处理、推理时间或网络延迟。更快的流式输出很有价值,但本身并不能证明整个工作流更快或更准确。
DeepSeek V4.1 Flash API 定价
预览版当前使用与 DeepSeek V4 Flash 相同的价格。以下所有金额均为人民币(CNY/RMB)每百万 tokens,不是美元,也不是 APIMaster 路由价格。
| Token 类型 | 低谷价格(CNY / 1M tokens) | 高峰价格(CNY / 1M tokens) |
|---|---|---|
| 缓存命中输入 | 0.05 | 0.10 |
| 缓存未命中输入 | 1.50 | 3.00 |
| 输出 | 4.50 | 9.00 |
成本示例: 100 万缓存未命中输入 tokens 加上 100 万输出 tokens,按当前预览价格计算,低谷时段为 CNY 6,高峰时段为 CNY 12。该示例不包括其他用量,并假设所有输入均为缓存未命中。
当前公开信息未定义高峰时段的具体时间表或其时区。在安排工作负载之前,请查阅 DeepSeek 当前的计费文档。对于 APIMaster 的使用,请参考市场中显示的实时模型和路由价格;上述上游表格并非我们服务的报价。
如何访问预览版,0910 代表什么?
对于使用 DeepSeek 自有 API 的合格开发者,当前内测调用方式如下:
model = deepseek-v4.1-flash-expires-on-0910
base_url = keep your existing DeepSeek base URL
account concurrency limit = 20
此说明适用于上游 DeepSeek 预览版。它并不保证所有第三方网关均可用,20 个请求的限制也不是已发布的 APIMaster 账户限制。
模型名称暗示有效期至 2026 年 9 月 10 日。当前公开信息未说明确切的截止时间或时区。请将该标识视为临时性的,并在依赖它之前确认当前上游通知。
我们建议将模型名称保持可配置,评估一小批真实任务,并保留一个经过测试的备选方案。预览期结束后,请使用当前受支持的标识符,而不是假设 expires-on-0910 模型会继续可用或自动映射到后续版本。
在 DeepSeek 近期发布中的定位
V4.1 Flash 延续了 DeepSeek 近期快速迭代模型和开发者工具的节奏:
| 2026 年日期 | 更新 |
|---|---|
| 7 月 31 日 | V4 Flash 生产版 API 进入公开测试 |
| 8 月 13 日 | V4 Pro 生产版 API 发布;DeepSeek Harness 开发者预览版 v0.1 进入公开测试并开源 |
| 8 月 19 日 | DeepSeek Harness 更新至 v0.1.0-rc.8 |
| 8 月 21 日 | V4 Flash Vision Exp 在 API 平台上线 |
| 8 月 31 日 | V4 Flash Vision Exp 开源 |
| 9 月 8 日 | V4.1 Flash 中间版本进入限量测试 |

DeepSeek Harness 的 GitHub 仓库页面,并非 V4.1 Flash 测速截图。
从我们的角度来看,实际意义在于开发者现在有多个不同的选项需要评估:面向文本工作负载的 Flash、作为另一种模型选项的 Pro、面向图像相关任务的 Vision Exp,以及用于早期实验的新临时预览版。发布时间线表明开发仍在持续;但并未确认最终 V4.1 版本的发布日期。
通过 APIMaster 开始使用 DeepSeek
看完新模型的消息,下一步就是把它用到自己的项目里。APIMaster 提供统一控制台和 OpenAI 兼容 API,让您通过同一个 API Key 使用 DeepSeek 等多个模型系列,比较不同模型的效果,减少重复接入和账户管理的工作。
我们在 2026 年 9 月 8 日查询公开模型列表,确认其中包含 deepseek-v4-flash、deepseek-v4-pro 和 deepseek-v4-flash-vision-exp,尚未列出临时型号 deepseek-v4.1-flash-expires-on-0910。选择模型前,请在模型广场查看最新上架状态和价格。
开始使用:
- 注册 APIMaster。
- 选择可用的模型并查看其当前价格和受支持的接口。
- 打开控制台,根据需要充值并创建您的 API 密钥。
- 使用 APIMaster base URL 和所选模型 ID 配置您的应用程序。
- 发送一个小请求,检查结果和用量,然后扩展到您的工作负载。
以下是一个使用当前列出的 V4 Flash(而非临时预览版)的文本示例:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["APIMASTER_API_KEY"],
base_url="https://apimaster.ai/v1",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Write a Python function that validates an email address."}
],
)
print(response.choices[0].message.content)
有关设置详情,请阅读我们的 DeepSeek API 指南和 API 密钥指南。您还可以使用我们的 DeepSeek API 测试工具检查连接和响应。连接测试成功本身并不能验证模型身份或建立性能基准。
FAQ
DeepSeek V4.1 Flash 预览版的模型 ID 是什么?
本次内测使用的标识符为 deepseek-v4.1-flash-expires-on-0910。它属于 2026 年 9 月 8 日上线的临时中间测试版本。
V4.1 Flash 比 V4 Flash 更便宜吗?
当前预览版的 API 价格与 V4 Flash 相同。低谷时段缓存未命中输入为每百万 tokens CNY 1.50,输出为 CNY 4.50;高峰价格分别为 CNY 3.00 和 CNY 9.00。这些是上游价格,并非 APIMaster 报价。
DeepSeek V4.1 Flash 能保证 507 tokens/s 吗?
不能。507 tokens/s 是个别社区结果。APIMaster 未在本文章中提供独立的 V4.1 Flash 基准测试,实际性能取决于请求设置、工作负载和服务条件。
V4.1 Flash 预览版在 APIMaster 上可用吗?
在我们 2026 年 9 月 8 日的公开目录检查中未列出。当时列出的是 V4 Flash、V4 Pro 和 V4 Flash Vision Exp。请查阅实时市场了解后续可用性变化。
临时模型何时过期?
名称暗示为 2026 年 9 月 10 日。当前公开信息未提供确切时间或时区。请确认 DeepSeek 当前通知并准备好备选模型。
从关注新模型,到发出第一次 API 请求
V4.1 Flash 内测版展现出的速度潜力和多模态方向值得关注。如果您已经有想做的项目,不必等到下一次模型发布:从当前可用的模型开始,用自己的任务测试效果,再决定适合的方案。
立即注册 APIMaster,查看 DeepSeek 及其他已上线模型,比较 API 价格、创建密钥,发出您的第一次请求。
比较优惠渠道价格,按实际 API 用量付费;具体优惠以所选模型和渠道的实时报价为准。