Featured image of post Meta发布Muse Spark 1.3:5个月迭代4版,成本低至10美分建游戏

Meta发布Muse Spark 1.3:5个月迭代4版,成本低至10美分建游戏

Meta发布新一代旗舰大模型,性能紧随Claude双雄,定价低于DeepSeek峰值价格。

Meta发布Muse Spark 1.3:密集迭代下的价格与性能重构

Meta发布Muse Spark 1.3:密集迭代下的价格与性能重构
Meta发布Muse Spark 1.3:密集迭代下的价格与性能重构|新闻截图

Meta于9月3日发布新一代旗舰模型Muse Spark 1.3。该模型目前已在Muse Code与Meta Model API中逐步上线,推理模式已开放,max-reasoning(极致推理模式)将在完成额外安全测试后开放。

开发布局 agility:

  • 发布时间:2026年9月3日
  • 新版本:Muse Spark 1.3(5个月内第4版:4月首发、7月1.1、8月1.2、9月1.3)
  • 价格:输入token(缓存未命中)$1.25/百万、(缓存命中)$0.15/百万;输出token $4.25/百万
  • 权重开放:尚未开放开源权重版本(Meta称未来将发布)
  • 已可用:推理模式已上线,Muse Code已逐步推送

性能表现:三项第一,Agent能力成短板

性能表现:三项第一,Agent能力成短板
性能表现:三项第一,Agent能力成短板|新闻截图

据Artificial Analysis的AI分析指数榜,Muse Spark 1.3得分为62分,仅次于Claude Fable 5.1(66分)与Claude Opus 5(63分),反超谷歌Gemini 3.8 Flash(59分),后者在4小时前刚刚发布。基准测试显示,Muse Spark 1.3在5项测试中拔得头筹,在代码与场外推理大部分测试中优于GPT-5.6 Sol与Claude Opus 5,仅在Terminal-Bench终端操作Agent测试中与GPT-5.6 Sol打平。

其相对薄弱环节在于Agent能力:在联网搜索类Agent与通用知识任务GDPVal-AA v2中分数较低。Meta内部强调,该模型优化方向聚焦于长周期任务支持与编程效率,在单条长对话中可并行处理多条工作流,识别自身能力边界,并在多步骤任务中更好保留细节约束。

价格对比与开发者实测:成本优势显著,生成质量待提升

价格对比与开发者实测:成本优势显著,生成质量待提升
价格对比与开发者实测:成本优势显著,生成质量待提升|新闻截图

据开发者实测,Muse Spark 1.3具备显著成本优势。有用户使用其制作《我的世界》游戏,总成本仅10美分;另一开发者开启Ultra超高算力模式运行2小时,自迭代20轮共执行60次以上智能体任务,成本不足1美元。但也有用户指出,长时间自我迭代可能反映任务完成度未达预期。

开源基准测试MineBench显示,Gemini 3.8 Flash总成本$1.18、平均耗时1分51秒、Elo评分1888分;Muse Spark 1.3总成本$6.57、平均耗时5分36秒、Elo评分1787分。这揭示了一组反差数据:Muse Spark 1.3虽成本更低、速度更快,但单次推理质量尚未达到Gemini 3.8 Flash水平

▲ 部分大模型价格对比(单位:美元/百万token)

模型输入(缓存未命中)输入(缓存命中)输出
Muse Spark 1.31.250.154.25
Gemini 3.8 Flash未公布未公布未公布
DeepSeek-V4-Pro(高峰期)未公布未公布高于Muse Spark 1.3

综合多位开发者反馈:Muse Spark 1.3在成本与速度上可媲美Qwen 3.8 Max(后者完成任务耗时约1.5小时,Muse Spark约2分钟),但输出完成度与质量稍逊;GLM 5.3在性能、成本、速度、token使用量四维综合表现最佳。

落地建议:适合谁用,谁该再等等

落地建议:适合谁用,谁该再等等
落地建议:适合谁用,谁该再等等|新闻截图

适合即刻试用

  • 专注于长上下文、多步骤工作流的开发团队(如Agent编排、自动化流程)
  • 对推理成本极度敏感、需高频调用API的轻量级应用
  • 需要快速原型验证、低门槛调试的初创项目

建议再等等

  • 对单次输出质量与任务完成率有硬性门槛的生产环境
  • 依赖强Agent联网搜索与知识检索能力的应用场景
  • 追求SOTA生成效果、希望一次调用即达终态的交互设计管线

写在最后

Meta连续5个月发布4个大模型版本,折射出其研发节奏从保守试探转向快速迭代。其不贪全场、聚焦“长上下文+编程+任务保持”的取舍,预示行业正从“全能型大模型”迈向“专精型调度时代”——企业将更倾向按任务类型混合使用不同优势模型,而不再孤注一掷押注单一模型。