Featured image of post DeepSeek-V3.1发布:一个模型切换“思考”与“非思考”,面向智能体场景加速

DeepSeek-V3.1发布:一个模型切换“思考”与“非思考”,面向智能体场景加速

V3.1强化推理、工具调用与长上下文。

一次面向智能体的版本更新

一次面向智能体的版本更新

DeepSeek在2025年8月21日发布DeepSeek-V3.1,将其定位为“迈向智能体时代的第一步”。这次更新的核心不是单一能力提升,而是把同一个模型拆出两种使用形态:Think与Non-Think混合推理模式。用户在DeepSeek网页端可通过“DeepThink”按钮切换;开发者侧则通过不同API入口调用,deepseek-chat对应非思考模式,deepseek-reasoner对应思考模式。

所谓“推理模式”,可以理解为模型在回答前投入更多中间思考步骤,以换取更稳健的复杂问题处理能力;非思考模式则更偏向快速响应和常规对话。DeepSeek称,V3.1-Think相较DeepSeek-R1-0528能用更少时间得到答案,同时在后训练阶段加强了工具使用和多步骤智能体任务能力。

API与开发者体验同步调整

API与开发者体验同步调整

面向API用户,V3.1带来几项直接影响集成方式的变化。官方信息显示,deepseek-chat与deepseek-reasoner均支持128K上下文。上下文窗口指模型一次处理输入与输出相关文本的容量,窗口越大,越适合长文档、代码库片段、多轮任务记录等场景。

关键更新包括:

  • deepseek-chat:对应Non-Think非思考模式;
  • deepseek-reasoner:对应Think思考模式;
  • 两种模式均支持128K上下文;
  • 支持Anthropic API格式;
  • Beta API支持Strict Function Calling。

其中,Function Calling是让模型按开发者定义的函数或工具格式输出调用请求的机制,常用于查询数据库、调用搜索、执行代码或触发企业内部流程。“Strict”意味着接口更强调结构化约束,有助于减少工具调用时的格式偏差。对已经围绕Anthropic接口搭建应用的团队来说,API格式兼容也可能降低迁移和多模型适配成本。

工具与智能体能力成为重点

工具与智能体能力成为重点

DeepSeek此次把“Tools & Agents Upgrades”单列为更新方向,显示V3.1并不只服务于聊天问答。官方提到,新版本在SWE和Terminal-Bench上取得更好结果,并增强复杂搜索任务中的多步骤推理,同时提升思考效率。

SWE通常指向软件工程类任务评测,关注模型理解、修改、调试代码的能力;Terminal-Bench则更贴近终端环境中的任务执行能力。对于智能体应用而言,模型不仅要回答“是什么”,还要能把任务拆解为多个步骤,决定何时使用工具、如何根据工具返回结果继续行动。这类能力的提升,正是搜索代理、代码代理、数据分析助手等产品能否稳定落地的关键。

需要注意的是,官方并未在这篇发布中给出具体榜单分数或对比数字,因此外界仍需结合后续评测、开源权重实测和真实业务环境验证其改进幅度。

模型底座、开源权重与价格节点

模型底座、开源权重与价格节点

在模型层面,DeepSeek表示V3.1 Base是在V3基础上继续进行840B tokens预训练,用于长上下文扩展。tokens可粗略理解为模型处理文本时的基本单位,可能是字、词或词片段;持续预训练则是在已有模型基础上继续用大量数据训练,以增强特定能力或适配新目标。

同时,V3.1更新了Tokenizer和聊天模板,并提供新的tokenizer_config.json。Tokenizer负责把文本切分为模型可处理的token,配置变化会影响输入编码方式,因此对本地部署、微调、评测复现和应用兼容都有现实意义。官方还在Hugging Face开放DeepSeek-V3.1-Base与DeepSeek-V3.1权重,延续其面向开发者和研究社区的开放路线。

价格方面,DeepSeek宣布新价格将在2025年9月5日16:00(UTC)开始,同时结束离峰折扣;在此之前,API沿用当前价格。对于高调用量团队,这一时间点意味着需要重新核算推理成本,并评估Think与Non-Think两种模式在成本、速度和效果之间的分工。

行业观察:从“会回答”走向“会办事”

V3.1释放的信号很清晰:大模型竞争正在从通用对话,转向可控推理、长上下文、工具调用和多步骤执行。混合推理模式的意义在于,把“快”和“深”放进同一个模型体系中,让用户或开发者按任务难度选择推理强度,而不是为不同任务维护多套模型。

短期看,V3.1的价值会体现在代码、搜索、办公自动化等工具密集场景;长期看,智能体能否普及,关键仍在稳定性、可观测性、成本和接口生态。DeepSeek通过128K上下文、API兼容、严格函数调用和开源权重同时推进,说明其目标不只是发布一个聊天模型,而是争取成为智能体应用开发栈中的基础模型选项。