描述
Cortex 是一个专为大规模机器学习设计的云基础设施平台,使用户能够在生产环境中高效地部署、管理和扩展 ML 模型。该平台支持多种工作负载类型,包括基于请求量自动扩展的无服务器实时响应、基于队列自动扩展的异步处理以及容错的批量处理作业。
关键功能包括具有 CPU 和 GPU 实例弹性自动扩展的自动化集群管理,以及在带自动备份的竞价实例上运行工作负载的能力。Cortex 允许创建具有不同配置的多个集群,从而实现灵活的开发和部署。它与 CI/CD 流水线无缝集成,并提供强大的可观测性功能,将指标发送到监控工具,并将日志流式传输到管理平台。
Cortex 基于 AWS EKS 构建,可确保 ML 工作负载的可靠且经济高效的扩展。它支持在您的 AWS 账户内进行 VPC 部署以保护数据隐私,并与 IAM 集成以实现安全身份验证和授权。该平台非常适合一系列 ML 应用,从模型服务和 MLOps 到微服务以及图像、视频和音频的大规模数据处理。
Cortex 特别有利于希望简化机器学习运营、降低基础设施复杂性并加速 AI 模型部署的组织。它处理大量 API 调用和促进快速开发的能力,使其成为满足苛刻客户需求的团队的宝贵工具。该平台使用户能够扩展计算密集型微服务,而不会遇到超时或资源限制,并能高效地处理大型数据集。
Cortex Machine Learning Platform的核心功能
支持带自动扩展的无服务器实时工作负载处理
支持带队列自动扩展的异步请求处理
分布式且容错的批量处理作业
支持带 CPU 和 GPU 实例自动扩展的自动化集群管理
支持带自动按需备份的竞价实例
支持创建用于多种集群配置的环境
CI/CD 和可观测性集成
声明式配置和 Terraform 提供商支持
指标流式传输到监控工具和 Grafana 仪表板
日志流式传输到日志管理工具和 CloudWatch 集成
基于 AWS EKS 构建,支持可扩展且经济高效的工作负载
VPC 部署以保护数据隐私
IAM 集成,用于身份验证和授权
用于实时推理的模型服务
支持持续模型再训练和评估的 MLOps
如何使用 Cortex Machine Learning Platform?
配置:使用声明式配置或 Terraform 提供商配置集群。
部署:将机器学习模型部署为实时工作负载或批量作业。
扩展:根据请求量、队列长度或数据处理需求自动扩展集群和工作负载。
监控:将指标流式传输到您首选的监控工具,并将日志流式传输到管理平台。
集成:与 CI/CD 流水线连接,并利用可观测性工具实现无缝操作。
Cortex Machine Learning Platform的使用案例
- 模型服务
- MLOps 自动化
- 微服务扩展
- 数据处理
- 实时分析
- 批量推理






