蚂蚁百灵开源双模型,定义AGI新路径
在2026 Inclusion·外滩大会期间,蚂蚁百灵开源其首个原生多模态大模型Ling-3.0-flash-VL及首个金融增强模型Ling-3.0-flash-Fin。两个模型均基于Fla sh架构,强调高智效比与场景落地能力。
- Ling-3.0-flash-VL:首个原生多模态模型,支持图像、音视频等多模态输入与输出,面向金融文档、医疗影像等真实场景
- Ling-3.0-flash-Fin:专注金融投研领域,在多项相关能力测评中超越前沿通用模型
- 技术路线:采用MoE稀疏架构、混合线性机制(KDA+MLA)及Token Efficient设计,压缩大模型智能至小尺寸
- 开源策略:基准开源+生态共建,支持私有数据微调与行业定制
核心理念是"智效比"——即在合理成本、更快响应速度下端到端解决问题,而非仅追求生成效率。
支撑国民级应用:1.5亿用户的背后技术逻辑
百灵基座模型已支撑多个国民级AI应用:
- 阿福:健康AI App用户突破1.5亿,日咨询量2000万,或成全球第一大健康AI App
- 阿宝:AI版支付宝,持续增长中
- 灵光:AI原生助手,亦处于上升通道
支撑如此高量级交互,团队面临三大挑战:推理成本、响应速度、数据隐私。阿福技术负责人进捷指出,C端应用必须控制在5秒内响应,否则用户流失;ToB/ToP场景则更重安全与可解释性。
一个关键反差是:当用户量级突破千万级,用最大最好的模型进行推理已不可持续。百灵转向"小模型超水位线"策略,通过Tiny模型在内部大量场景实现推理效率提升,同时保持专业能力。
金融医疗如何反哺基座模型
百灵团队认为,领域模型与基座模型是双向奔赴关系:
金融方向(负责人月引):
- 选择高难度领域(行研),因行研中分析、估值建模等部分可校验,而推断可交给模型
- 优势在于一二级市场十年以上专家共建数据,并将知识深度融入Pre-train而非仅Post-train
- 金融知识沉淀回基座模型后,可反哺ToC服务,例如为1.5亿阿福用户提供专业理财建议
医疗方向(负责人西亭、进捷):
- 三线以下城市用户缺头部医疗资源,一线用户则面临健康与情绪压力
- 皮肤科为首选切入,因其问诊量大、适合线上;未来方向是帮医生构建AI团队,提升接诊与患者管理效率
模型架构负责人零幺强调:行业应用产生高质量负样本(拒答/不会),可训练模型认知边界,这对严肃场景至关重要。
模型评估标准:三个核心指标
西亭提出模型进入真实世界的三个关键指标:
| 指标 | 内容 | 说明 |
|---|---|---|
| 智效比 | 计算/参数/Token效率统一权衡 | MoE稀疏架构使模型越稀疏(未达临界点前)智能反提升 |
| 专业性 | 在特定领域达到可用水平 | 金融需应对真实决策场景,非 benchmark 多口径回答 |
| 开放性 | COT可解释、反馈可闭环 | 如医疗报告PPT换行错误需可见可纠,河模型可靠 |
拒答机制设计是专业性落地的关键。月引举例:真实金融用户无法接受85条决策建议,只愿看2-3条;因此RL训练中对幻觉惩罚更重," “宁可说不知道,也不要给很多口径让用户猜"。
落地建议与行业观察
- 适合立即尝试的用户:金融从业者(投研、理财师)、医疗从业者、开发者(愿参与开源共建);开源模型支持私有数据微调,适合对数据隐私敏感场景
- 建议再等等的用户:仅追求通用聊天/内容生成的普通消费者;当前版本优先面向专业任务与ToB/ToP场景优化,通用娱乐场景可能等待后续迭代
- 开发者建议:关注其Benchmark设计——不只看输出准确率,更重"知道自己不知道"的能力,此为未来严肃场景标配
写在最后:百灵的实践表明,国内大模型突围路径已从"追赶Coding能力"转向"解决真实问题”。当MoE+小尺寸+场景反哺组合成新范式,AGI或将绕开单一Coding路径,走向更广义的 Scaling——用智效比丈量智能,以真实世界检验价值。




