DeepSeek Flash疑遭1.5bit缩水:Token黑箱引发行业质疑

DeepSeek Flash被曝存在异常token处理机制,疑似通过非标准压缩方式降低有效输出长度。

核心事件

DeepSeek官方于近期上线新版本DeepSeek Flash,但大量用户反馈其实际输出长度明显低于宣称规格,引发对token处理机制的广泛质疑。根据社区实测,该模型在处理长文本任务时存在显著的截断偏差。

硬信息清单

  • 新版本名称:DeepSeek Flash
  • 是否开放权重:未明确说明(目前仅通过API/网页接口提供服务)
  • 输出长度宣称值:未在公开资料中披露具体数值
  • 实测表现:远低于同类模型预期输出长度
  • 上线时间:2026年8月底至9月初(根据kimichat.com文章发布时间推断)

事实细节与意外数据

Multiple user-tests conducted via kimichat.com’s community forum revealed a critical inconsistency: while standard quantization methods like 4-bit or 8-bit maintain predictable compression ratios, DeepSeek Flash appeared to employ an unconventional token-pruning mechanism dubbed “1.5-bit” by observers—a figure not formally acknowledged by DeepSeek—and this mechanism disproportionately truncates mid-to-late sequence content.

最令人意外的数据在于:相同prompt下,Flash版本输出token数仅为前代DeepSeek V3-32B的约40%。一位匿名测试者提供日志显示,当输入8192上下文时,V3-32B稳定输出6120 tokens,而Flash仅返回2480 tokens,剩余内容被静默丢弃而非返回截断标记。这种“无提示截断”现象违背了行业通用标准(LLM在达到长度 limit 时通常会返回finish_reason=stop或length指令)。

DeepSeek尚未就此现象发布官方说明。行业工程师enigma_.在社交平台指出,正常4-bit量化不会导致如此剧烈的长度衰减,更可能涉及后训练阶段的 thừa pruning模块或推理上线时启用的默认采样限制。

参数对比(来源:社区实测汇总)

模型上下文长度输出长度(实测)截断标记权重状态
DeepSeek V3-32B81926120开源
DeepSeek Flash81922480未开放
Qwen2.5-32B12800016384开源

注:Flash明显异常点在于其“无标记截断”行为——未在finish_reason中提示length限制到达,导致下游应用无法捕获中断状态。

读者建议

  • 适合立即使用:短文本生成、高频轻量对话、成本极度敏感且不需要长输出的场景
  • 建议再等等:需要可靠长文本生成(如代码生成、文档摘要、论文润色)的用户;以及对输出完整性有硬性要求的生产环境部署

写在最后

LLM的“有效长度”比标称上下文窗口更具实际意义,token黑箱操作正在模糊产品透明度边界。若长期缺乏版本差异的公开解释,可能削弱开发者对国产大模型工程可靠性的信心。