APIMaster.ai
返回博客
APIMaster 博客

DeepSeek V4.1 Flash 开启内测:速度、价格与 API 接入

DeepSeek V4.1 Flash 开启内测,网友报告输出速度达 300-507 tokens/s,价格与 V4 Flash 相同。APIMaster 解读新模型、临时 API 型号与使用建议。

DeepSeek V4.1 FlashDeepSeek APIAPI 定价多模态 AIAPIMaster

发布于 2026-09-08

快速结论

据智东西报道,DeepSeek V4.1 Flash 于 2026 年 9 月 8 日进入限量测试阶段。 其临时模型 ID 为 deepseek-v4.1-flash-expires-on-0910。报道称,现有 DeepSeek 开发者可以保留原有 base URL,使用新的模型 ID,每个账户最多可发送 20 个并发请求。当前计费标准与 V4 Flash 一致。社区示例显示速度可达 300-507 输出 tokens/s,但这些仅为个人观察结果,并非 APIMaster 的基准测试数据,也不代表服务速度保证。

在 APIMaster,我们更关心新模型能为实际应用带来什么:响应能否更快、多模态任务能否做得更好,以及完成同样任务需要花多少钱。截至 9 月 8 日查询,APIMaster 公开模型列表中已有 V4 Flash、V4 Pro 和 V4 Flash Vision Exp,尚未列出本次 V4.1 Flash 内测型号。 您可以创建 APIMaster 账户,先使用已上线的 DeepSeek 模型,并在模型广场中比较价格和可用渠道。

DeepSeek V4.1 Flash 有哪些新特性?

9 月 8 日的报道描述了一个采用新模型架构的 V4.1 Flash 中间版本,具备原生多模态支持、更强的能力、更快的响应速度和更低的成本。这是一个早期测试版本,因此这些说法应在此背景下理解。

对开发者而言,值得关注的组合是在相同公开 API 价格下获得更强的能力。内部模型成本的降低并不自动意味着客户账单的降低:当前预览版按 V4 Flash 费率计费。

报道未说明上下文窗口、最大输出长度、支持的图片格式、音频或视频接口,也未提供详细的评测分数。原生多模态本身并不能证明支持所有媒体类型。在围绕这些能力设计应用之前,我们建议先检查实际接口并测试代表性输入。

速度有多快?解读 507 tokens/s 的报道

智东西引用了开发者在 X 上分享的体验。一位开发者报告峰值输出速度为 507 tokens/s。另一位开发者在生成一个包含骑自行车鹈鹕 SVG 动画的 HTML 页面时获得了 328 tokens/s 的速度;还有一位开发者报告在类似任务上平均速度超过 300 tokens/s

这对于代码生成、长响应和交互式助手来说很有前景。但这还不是受控对比:文章未提供统一的测量方法、完整的请求设置或可重复的结果分布。

在 APIMaster,我们建议同时关注三项指标:

指标 说明
首 token 延迟 用户等待响应开始的时间
每秒输出 tokens 生成开始后答案到达的速度
总完成时间和正确性 整个任务是否快速完成并产生可用结果

示例说明,并非基准测试: 一个 1,000 token 的答案在持续 300 tokens/s 的速度下,输出生成约需 3.3 秒。在 507 tokens/s 的速度下约需 2.0 秒。两项计算均不包括排队、初始处理、推理时间或网络延迟。更快的流式输出很有价值,但本身并不能证明整个工作流更快或更准确。

DeepSeek V4.1 Flash API 定价

报道称预览版使用与 DeepSeek V4 Flash 相同的价格。以下所有金额均为人民币(CNY/RMB)每百万 tokens,不是美元,也不是 APIMaster 路由价格。

Token 类型 低谷价格(CNY / 1M tokens) 高峰价格(CNY / 1M tokens)
缓存命中输入 0.05 0.10
缓存未命中输入 1.50 3.00
输出 4.50 9.00

成本示例: 100 万缓存未命中输入 tokens 加上 100 万输出 tokens,按报道价格计算,低谷时段为 CNY 6,高峰时段为 CNY 12。该示例不包括其他用量,并假设所有输入均为缓存未命中。

所提供报道未定义高峰时段的具体时间表或其时区。在安排工作负载之前,请查阅 DeepSeek 当前的计费文档。对于 APIMaster 的使用,请参考市场中显示的实时模型和路由价格;上述上游表格并非我们服务的报价。

如何访问预览版,0910 代表什么?

对于使用 DeepSeek 自有 API 的合格开发者,报道中的变更非常简单:

model = deepseek-v4.1-flash-expires-on-0910
base_url = keep your existing DeepSeek base URL
account concurrency limit = 20

此说明适用于上游 DeepSeek 预览版。它并不保证所有第三方网关均可用,20 个请求的限制也不是已发布的 APIMaster 账户限制。

模型名称暗示有效期至 2026 年 9 月 10 日。智东西根据该名称推断关闭日期;所提供文本未说明确切的截止时间或时区。请将该标识视为临时性的,并在依赖它之前确认当前上游通知。

我们建议将模型名称保持可配置,评估一小批真实任务,并保留一个经过测试的备选方案。预览期结束后,请使用当前受支持的标识符,而不是假设 expires-on-0910 模型会继续可用或自动映射到后续版本。

在 DeepSeek 近期发布中的定位

报道将 V4.1 Flash 置于一系列快速迭代的模型和开发者工具更新之中:

2026 年日期 智东西报道的更新
7 月 31 日 V4 Flash 生产版 API 进入公开测试
8 月 13 日 V4 Pro 生产版 API 发布;DeepSeek Harness 开发者预览版 v0.1 进入公开测试并开源
8 月 19 日 DeepSeek Harness 更新至 v0.1.0-rc.8
8 月 21 日 V4 Flash Vision Exp 在 API 平台上线
8 月 31 日 V4 Flash Vision Exp 开源
9 月 8 日 V4.1 Flash 中间版本进入限量测试

DeepSeek Harness 的 GitHub 仓库页面,并非 V4.1 Flash 测速截图。

DeepSeek Harness 的 GitHub 仓库页面,并非 V4.1 Flash 测速截图。

从我们的角度来看,实际意义在于开发者现在有多个不同的选项需要评估:面向文本工作负载的 Flash、作为另一种模型选项的 Pro、面向图像相关任务的 Vision Exp,以及用于早期实验的新临时预览版。发布时间线表明开发仍在持续;但并未确认最终 V4.1 版本的发布日期。

通过 APIMaster 开始使用 DeepSeek

看完新模型的消息,下一步就是把它用到自己的项目里。APIMaster 提供统一控制台和 OpenAI 兼容 API,让您通过同一个 API Key 使用 DeepSeek 等多个模型系列,比较不同模型的效果,减少重复接入和账户管理的工作。

我们在 2026 年 9 月 8 日查询公开模型列表,确认其中包含 deepseek-v4-flashdeepseek-v4-prodeepseek-v4-flash-vision-exp,尚未列出临时型号 deepseek-v4.1-flash-expires-on-0910。选择模型前,请在模型广场查看最新上架状态和价格。

开始使用:

  1. 注册 APIMaster
  2. 选择可用的模型并查看其当前价格和受支持的接口。
  3. 打开控制台,根据需要充值并创建您的 API 密钥。
  4. 使用 APIMaster base URL 和所选模型 ID 配置您的应用程序。
  5. 发送一个小请求,检查结果和用量,然后扩展到您的工作负载。

以下是一个使用当前列出的 V4 Flash(而非临时预览版)的文本示例:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["APIMASTER_API_KEY"],
    base_url="https://apimaster.ai/v1",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Write a Python function that validates an email address."}
    ],
)

print(response.choices[0].message.content)

有关设置详情,请阅读我们的 DeepSeek API 指南API 密钥指南。您还可以使用我们的 DeepSeek API 测试工具检查连接和响应。连接测试成功本身并不能验证模型身份或建立性能基准。

FAQ

DeepSeek V4.1 Flash 预览版的模型 ID 是什么?

报道中的标识符为 deepseek-v4.1-flash-expires-on-0910。它属于 2026 年 9 月 8 日报道中宣布的临时中间测试版本。

V4.1 Flash 比 V4 Flash 更便宜吗?

根据报道,当前预览版的 API 价格与 V4 Flash 相同。低谷时段缓存未命中输入为每百万 tokens CNY 1.50,输出为 CNY 4.50;高峰价格分别为 CNY 3.00 和 CNY 9.00。这些是报道的上游价格,并非 APIMaster 报价。

DeepSeek V4.1 Flash 能保证 507 tokens/s 吗?

不能。507 tokens/s 是智东西引用的个别社区结果。APIMaster 未在本文章中提供独立的 V4.1 Flash 基准测试,实际性能取决于请求设置、工作负载和服务条件。

V4.1 Flash 预览版在 APIMaster 上可用吗?

在我们 2026 年 9 月 8 日的公开目录检查中未列出。当时列出的是 V4 Flash、V4 Pro 和 V4 Flash Vision Exp。请查阅实时市场了解后续可用性变化。

临时模型何时过期?

名称暗示为 2026 年 9 月 10 日。所提供报道根据模型 ID 推断该日期,未提供确切时间或时区。请确认 DeepSeek 当前通知并准备好备选模型。

从关注新模型,到发出第一次 API 请求

V4.1 Flash 内测版展现出的速度潜力和多模态方向值得关注。如果您已经有想做的项目,不必等到下一次模型发布:从当前可用的模型开始,用自己的任务测试效果,再决定适合的方案。

立即注册 APIMaster,查看 DeepSeek 及其他已上线模型,比较 API 价格、创建密钥,发出您的第一次请求。

比较优惠渠道价格,按实际 API 用量付费;具体优惠以所选模型和渠道的实时报价为准。