📖 内容分析
根据IT之家8月8日报道,蚂蚁集团旗下百灵大模型官方宣布,新一代原生混合推理模型Ling-3.0-flash正式开源。该模型采用MoE(混合专家)架构,总参数规模达124B,但每次推理仅激活5.1B参数,大幅降低了计算资源需求。官方同步提供基础版本以及FP8、FP4、INT4等多个量化版本,以适应不同硬件和部署场景。具体落地方式有三种:一是通过云端API直接调用,面向希望快速接入、无需自建推理服务的开发者;二是单机私有化部署,MXFP4与INT4版本可在单台NVIDIA DGX Spark(基于Grace Hopper架构)上完成端到端推理,面向数据不能出域的企业和团队;三是高性能部署,面向单请求时延敏感的高性能服务,在指定GPU测试配置下,平均输出速率突破1100 tokens/s,满足实时性要求高的应用。Ling-3.0-flash的发布,展示了蚂蚁集团在高效推理模型方面的技术积累,同时通过开源策略加速产业生态建设。该模型在保持较强推理能力的同时,大幅降低了部署成本,有望推动AI在金融、医疗、教育等垂直行业的规模化应用。此外,MoE架构和低比特量化技术的结合,也为国内AI芯片和服务器厂商提供了更优的适配目标,促进软硬件协同发展。