在AI大模型推理开始规模化落地的关键阶段,F5中国推出了基于词元(Token)的负载均衡方案(TBLB),专门解决异构GPU集群在推理场景中的算力调度与资源利用难题。该创新技术实现了异构算力并发提升75%,助力行业提升AI推理效率和稳定性。
中国团队原创,推动全球算力调度新理念
F5北亚区总裁黄彦文表示,TBLB方案源自中国团队对本地AI推理需求的深刻理解和创新实践。传统基于连接或请求数的负载均衡难以精准反映推理任务的真实算力消耗,而TBLB以Token数量为核心指标,动态调度GPU资源,实现对不同性能节点的精准分配。该理念已逐步向全球推广,推动AI基础设施从“以连接为中心”过渡到“以Token为中心”的算力调度新共识。
区别传统方案,实现算力感知智能调度
F5中国区产品及解决方案总经理陈亮介绍,传统负载均衡基于连接数或请求数分发,适合互联网固定资源消耗场景,但大模型推理中一个请求的计算量却因Token数量和上下文复杂度差异巨大。尤其在中国企业普遍采用异构GPU部署的环境,传统方案难以准确反映实时算力状态,易导致部分节点过载而另一些节点空闲。
TBLB利用Token规模、GPU负载、KV Cache和队列长度等多维指标,实时调整任务分配,将复杂度不同的推理请求匹配到最合适算力节点,避免算力浪费与瓶颈,使调度更智能高效。
多行业应用验证,显著提升Token处理效率
- 汽车行业客户使用包含NVIDIA A40与L20的混合GPU集群,Token生成速度提升30.3%,端到端响应加快48%。
- 运营商环境中采用华为Ascend 910B算力,用户并发数提升至少75%,Token速度提升99%。
- 金融行业应用阿里平头哥PPU与NVIDIA H20混合算力,Token生成速率提升42%。
这些数据表明,TBLB方案不依赖额外算力投入即可大幅释放现有GPU潜能。黄彦文指出,随着GPU迭代周期缩短,资产折旧压力加大,提高GPU利用率成为企业核心诉求。TBLB支持跨品牌、跨代际GPU统一调度,实测GPU利用率提升达60%。
“创新中国,链接全球”的战略布局
F5中国从“创新中国,服务中国”升级为“创新中国,链接全球”,成立AI应用工程部,发挥中国团队在AI推理技术上的领先优势。战略聚焦本地AI能力建设与支持企业全球布局,尤其面向新能源汽车、高端制造等产业链,提供多地域多云的应用交付与安全解决方案。
黄彦文总结称,AI竞争已从模型能力扩展至推理调度能力,企业未来重点在于低成本、高效稳定地完成复杂异构算力环境下的Token计算。此次推出的TBLB方案正是应对此挑战的关键创新。
文章来源:https://tech.sina.com.cn/roll/2026-06-05/doc-iniaiqks2907766.shtml
所属栏目:{typename type="name"/}








