Featured image of post 蚂蚁百灵开源多模态与金融模型:AGI需走向真实世界,智效比成新标尺

蚂蚁百灵开源多模态与金融模型:AGI需走向真实世界,智效比成新标尺

百灵开源Ling-3.0-flash-VL与Ling-3.0-flash-Fin,团队强调AGI不止coding路径,智效比与专业性为模型核心指标。

蚂蚁百灵开源双模型,定义AGI新路径

蚂蚁百灵开源双模型,定义AGI新路径
蚂蚁百灵开源双模型,定义AGI新路径|新闻截图

在2026 Inclusion·外滩大会期间,蚂蚁百灵开源其首个原生多模态大模型Ling-3.0-flash-VL及首个金融增强模型Ling-3.0-flash-Fin。两个模型均基于Fla sh架构,强调高智效比与场景落地能力。

  • Ling-3.0-flash-VL:首个原生多模态模型,支持图像、音视频等多模态输入与输出,面向金融文档、医疗影像等真实场景
  • Ling-3.0-flash-Fin:专注金融投研领域,在多项相关能力测评中超越前沿通用模型
  • 技术路线:采用MoE稀疏架构、混合线性机制(KDA+MLA)及Token Efficient设计,压缩大模型智能至小尺寸
  • 开源策略:基准开源+生态共建,支持私有数据微调与行业定制

核心理念是"智效比"——即在合理成本、更快响应速度下端到端解决问题,而非仅追求生成效率。

支撑国民级应用:1.5亿用户的背后技术逻辑

支撑国民级应用:1.5亿用户的背后技术逻辑
支撑国民级应用:1.5亿用户的背后技术逻辑|新闻截图

百灵基座模型已支撑多个国民级AI应用:

  • 阿福:健康AI App用户突破1.5亿,日咨询量2000万,或成全球第一大健康AI App
  • 阿宝:AI版支付宝,持续增长中
  • 灵光:AI原生助手,亦处于上升通道

支撑如此高量级交互,团队面临三大挑战:推理成本、响应速度、数据隐私。阿福技术负责人进捷指出,C端应用必须控制在5秒内响应,否则用户流失;ToB/ToP场景则更重安全与可解释性。

一个关键反差是:当用户量级突破千万级,用最大最好的模型进行推理已不可持续。百灵转向"小模型超水位线"策略,通过Tiny模型在内部大量场景实现推理效率提升,同时保持专业能力。

金融医疗如何反哺基座模型

金融医疗如何反哺基座模型
金融医疗如何反哺基座模型|新闻截图

百灵团队认为,领域模型与基座模型是双向奔赴关系:

金融方向(负责人月引)

  • 选择高难度领域(行研),因行研中分析、估值建模等部分可校验,而推断可交给模型
  • 优势在于一二级市场十年以上专家共建数据,并将知识深度融入Pre-train而非仅Post-train
  • 金融知识沉淀回基座模型后,可反哺ToC服务,例如为1.5亿阿福用户提供专业理财建议

医疗方向(负责人西亭、进捷)

  • 三线以下城市用户缺头部医疗资源,一线用户则面临健康与情绪压力
  • 皮肤科为首选切入,因其问诊量大、适合线上;未来方向是帮医生构建AI团队,提升接诊与患者管理效率

模型架构负责人零幺强调:行业应用产生高质量负样本(拒答/不会),可训练模型认知边界,这对严肃场景至关重要。

模型评估标准:三个核心指标

模型评估标准:三个核心指标
模型评估标准:三个核心指标|新闻截图

西亭提出模型进入真实世界的三个关键指标:

指标内容说明
智效比计算/参数/Token效率统一权衡MoE稀疏架构使模型越稀疏(未达临界点前)智能反提升
专业性在特定领域达到可用水平金融需应对真实决策场景,非 benchmark 多口径回答
开放性COT可解释、反馈可闭环如医疗报告PPT换行错误需可见可纠,河模型可靠

拒答机制设计是专业性落地的关键。月引举例:真实金融用户无法接受85条决策建议,只愿看2-3条;因此RL训练中对幻觉惩罚更重," “宁可说不知道,也不要给很多口径让用户猜"。

落地建议与行业观察

  • 适合立即尝试的用户:金融从业者(投研、理财师)、医疗从业者、开发者(愿参与开源共建);开源模型支持私有数据微调,适合对数据隐私敏感场景
  • 建议再等等的用户:仅追求通用聊天/内容生成的普通消费者;当前版本优先面向专业任务与ToB/ToP场景优化,通用娱乐场景可能等待后续迭代
  • 开发者建议:关注其Benchmark设计——不只看输出准确率,更重"知道自己不知道"的能力,此为未来严肃场景标配

写在最后:百灵的实践表明,国内大模型突围路径已从"追赶Coding能力"转向"解决真实问题”。当MoE+小尺寸+场景反哺组合成新范式,AGI或将绕开单一Coding路径,走向更广义的 Scaling——用智效比丈量智能,以真实世界检验价值。