Featured image of post DeepSeek-V4 Preview开源上线:百万Token上下文成为官方服务默认能力

DeepSeek-V4 Preview开源上线:百万Token上下文成为官方服务默认能力

新模型主打长上下文、智能体能力与API迁移。

核心发布:开源模型进入百万上下文阶段

核心发布:开源模型进入百万上下文阶段

DeepSeek在2026年4月24日宣布DeepSeek-V4 Preview正式上线并开源,主打“高性价比的100万Token上下文”。这意味着,在DeepSeek官方服务中,1M上下文长度已成为默认能力,用户可在chat.deepseek.com通过Expert Mode和Instant Mode试用,也可从当天起通过API调用新模型。

所谓上下文长度,是指模型一次请求中可读取和处理的文本规模;Token可粗略理解为模型处理文本的基本单位。百万Token上下文的意义在于,模型可以在一次交互中容纳更长文档、代码仓库片段、对话历史或复杂任务资料,从而减少切分、检索和多轮拼接带来的工程负担。

双模型路线:Pro追性能,Flash追效率

双模型路线:Pro追性能,Flash追效率

此次发布包含两个版本:DeepSeek-V4-Pro与DeepSeek-V4-Flash。前者强调综合能力,后者强调速度与成本。官方给出的关键参数为:

  • DeepSeek-V4-Pro:总参数1.6T,激活参数49B;官方称性能可比肩全球顶级闭源模型。
  • DeepSeek-V4-Flash:总参数284B,激活参数13B;定位为快速、高效、经济的选择。
  • 两个模型均支持1M上下文,并支持Thinking与Non-Thinking双模式。

这里的“激活参数”通常与混合专家模型相关,指一次推理中实际参与计算的部分参数;总参数更像模型容量上限,激活参数则更直接影响单次计算成本。DeepSeek并未在公告中展开架构细节,但用这组数据传递出清晰的产品分层:Pro面向高难度推理、复杂代码与知识任务,Flash面向更高吞吐和更低价格敏感场景。

能力重点:推理、代码与智能体任务

能力重点:推理、代码与智能体任务

DeepSeek称V4-Pro在Agentic Coding基准中达到开源SOTA。Agentic Coding可理解为让模型像“代码智能体”一样,围绕需求拆解任务、读写代码、调用工具并推进开发流程。公告还提到,V4-Pro在世界知识方面领先当前开放模型,仅落后于Gemini-3.1-Pro;在数学、STEM与编程推理上超过当前开放模型,并接近顶级闭源模型。

V4-Flash则被定位为轻量高效版本。官方称其推理能力接近V4-Pro,在简单智能体任务上与V4-Pro表现相当,同时参数规模更小、响应更快、API价格更具性价比。对于普通开发者而言,这种组合意味着同一代模型可以按任务难度分配:复杂分析、长代码审查、严肃推理交给Pro;客服、摘要、常规代码辅助、批量处理等任务可优先尝试Flash。

长上下文背后的结构创新与API迁移

长上下文背后的结构创新与API迁移

DeepSeek将V4的长上下文效率归因于新的注意力机制:Token级压缩与DSA(DeepSeek Sparse Attention)。注意力机制是大语言模型判断文本中哪些信息彼此相关的核心组件;稀疏注意力则通过减少不必要的全量关联计算,降低长文本推理时的计算与显存压力。官方称,这使模型在超长上下文场景下显著降低计算和内存成本。

在生态适配方面,DeepSeek表示V4已与Claude Code、OpenClaw、OpenCode等AI智能体集成,并已用于DeepSeek内部的智能体编码流程。API侧,开发者可保持base_url不变,只需将model更新为deepseek-v4-pro或deepseek-v4-flash;接口支持OpenAI ChatCompletions与Anthropic APIs。值得注意的是,deepseek-chat与deepseek-reasoner将在2026年7月24日15:59(UTC)后完全下线且不可访问,目前已分别路由到deepseek-v4-flash的非思考与思考模式。

行业观察:长上下文从卖点走向基础设施

这次V4 Preview的信号不只是“又一个新模型”,而是长上下文能力正在从高端功能变成基础设施。百万Token上下文若能以可承受成本稳定提供,将改变许多应用的默认设计:企业知识库可以减少切片策略依赖,代码智能体可以一次理解更大范围工程,研究与法务场景也能把更多原始材料直接交给模型处理。

但长上下文并不等于自动更可靠。模型能“读得更多”,还需要在检索、引用、推理链路和工具调用中保持稳定。DeepSeek选择同时推出Pro与Flash,并强调API兼容和智能体集成,说明竞争已从单次问答能力转向“模型、成本、上下文和开发者生态”的综合较量。接下来,开放模型阵营的关键看点将是:百万上下文能否在真实业务中保持速度、价格和准确性的平衡。