为优化大规模模型推理体验,AWS向Amazon EKS用户推送Kubernetes原生推理网关插件。该组件可实时监测集群内各GPU节点的负载状态,并通过智能算法将高频请求精准路由至最优计算单元。实测数据显示,在高并发多模型共存场景下,该网关可将首字延迟最高缩减82,无需修改现有模型服务架构即可平滑接入。 关键要点Kubernetes原生插件实时监测GPU负载智能路由分发请求最高降低首字延迟82无需修改客户端架构即可平滑接入生产环境 返回列表 上一篇 下一篇