deepseek-v4.1-flash

deepseek-v4.1-flash

DeepSeek全新一代“越级智商 + 极速高吞吐”开源大模型
2026-09-10
语言大模型
Model capability: thinkingModel capability: function_call
缓存读取:
$0.003/1M tokens
输入:
$0.15/1M tokens
输出:
$0.6/1M tokens
大额采购联系客户经理享专属优惠

API介绍

DeepSeek-V4.1-Flash 是DeepSeek 全新一代面向高并发、复杂长程智能体与工程级代码交付打造的“越级智商 + 极速高吞吐”开源大模型。模型采用 552B 骨干 MoE 架构并融合了 196B Engram 模块(Prefill 仅激活 8B,Decode 激活 16B),实现了推理吞吐量(最高达 400+ TPS)与首字延迟的跨越式跃升。在多项严苛的真实场景测试中,V4.1-Flash 的综合推理质量与复杂工作流完成速度已全面超越上一代模型 V4 Pro,是企业规模化跑 AI 代码助手、智能体集群与高密工作流的绝对性价比杀手。

───────────────────────────────────────────────────────────────────

核心能力

智力越级与全量路由替代: 在内部与外部测试中,V4.1-Flash 的综合性能、生成速度与任务完成度全面超越上代旗舰 V4 Pro。

Engram 架构与极致 KV Cache 压缩: 结合 196B Engram 嵌入模块与全新 QAT 压缩算法,将 1M 超长上下文的 KV Cache 显存占用大幅压缩至 ~900MB,长文本Prefill 与连续追问体验极佳。

极致的高吞吐速度(高达 400+ TPS): 端到端推理速度大幅提升,首字响应极快,非常适合高并发 API 接入与实时交互系统。

1M 超长上下文与自动无感缓存: 原生支持 1,000,000 (1M) Tokens 窗口与最高 384K Tokens 导出,无需手动配置,原生支持磁盘级 Context Caching 自动命中。

───────────────────────────────────────────────────────────────────

相关测评

DeepSeek-V4.1-Flash 实测:552B新架构,原生多模态,正式接棒V4 Pro


Playground

登录后,探索更多精彩功能! 点击登录

API统计

API列表 (3)

API描述接口地址请求方法稳定性参数说明
Chat(深度求索)
POST
稳定
查看详情
Chat(深度求索)
POST
稳定
查看详情
Messages(Claude Code专用)
POST
稳定
查看详情

API价格表

$
模型说明上下文官网原价302.AI价格官网价差

deepseek-chat

闲时价格
1000000

缓存读取$0.003 / 1M tokens
输入$0.15 / 1M tokens
输出$0.6 / 1M tokens

缓存读取$0.003 / 1M tokens
输入$0.15 / 1M tokens
输出$0.6 / 1M tokens

原价

deepseek-chat

高峰期价格 (北京时间:09:00‑12:00,14:00‑18:00)
1000000

缓存读取$0.006 / 1M tokens
输入$0.3 / 1M tokens
输出$1.2 / 1M tokens

缓存读取$0.006 / 1M tokens
输入$0.3 / 1M tokens
输出$1.2 / 1M tokens

原价