8月7日,蚂蚁集团旗下百灵大模型官方宣布,新一代原生混合推理模型Ling-3.0-flash正式开源。该模型采用124B总参数、5.1B激活参数的MoE架构,同步提供基础版本及FP8、FP4、INT4等多个版本。
部署方面,Ling-3.0-flash提供三种落地选择:开发者可通过云端API直接调用;面向数据不能出域的企业和团队,MXFP4与INT4版本可在单台NVIDIA DGX Spark上完成端到端推理;面向时延敏感的高性能服务,指定GPU配置下平均输出速率突破1100 tokens/s。
性能数据上,在Artificial Analysis榜单中,Ling-3.0-flash输出速度达353 tokens/s;在AA Intelligence Index榜单中,每项任务加权平均调用成本约0.04美元,加权平均解码时间约1.4分钟,并进入“智能水平—任务成本”和“智能水平—任务耗时”优势区域。
官方表示,2026年8月7日00:00至8月31日24:00,Ling-3.0-flash在Ling Studio限时享受2.5折优惠,9月1日起恢复原价。
