描述
Cortex 是一个开源框架,旨在简化生产环境中机器学习模型的部署和管理。它提供了强大的基础设施,可高效扩展 ML 工作负载,满足从实时预测到大规模批量处理的各种操作需求。
该平台支持无服务器工作负载,可实现基于传入请求量自动伸缩的实时响应。对于异步任务,Cortex 可以在后台处理请求并根据队列长度进行自动伸缩。它还支持批量处理,能够按需运行分布式、容错性强的作业。
自动集群管理是其核心功能,为使用 CPU 和 GPU 实例的集群提供弹性自动伸缩。它支持在竞价实例上运行工作负载并进行自动备份,并允许创建具有不同配置的多个集群。配置可以通过声明式配置或 Terraform 提供程序进行管理,并与 CI/CD 流水线无缝集成。
Cortex 强调可观测性,允许将指标发送到任何监控工具或利用预构建的 Grafana 仪表板。日志流支持任何日志管理工具,并提供与 AWS CloudWatch 的预构建集成。该框架专为 AWS EKS 构建,确保工作负载的可靠且经济高效的扩展。它与 VPC 集成以实现数据隐私,并与 IAM 集成以实现身份验证和授权工作流。
尽管该项目已被其原始作者标记为不再积极维护,但其架构和功能为希望在 AWS 基础设施上大规模实现机器学习的组织提供了全面的解决方案。该项目在 GitHub 上的历史记录显示了持续的开发和社区贡献,反映了其在 MLOps 领域的实用性。
Cortex的核心功能
大规模机器学习的生产基础设施
部署、管理和扩展机器学习模型
无服务器、实时、异步和批量工作负载
带自动伸缩的自动集群管理
支持带按需备份的竞价实例
CI/CD 和可观测性集成
通过声明式配置或 Terraform 提供程序进行配置
指标和日志流功能
基于 AWS EKS 构建,实现可靠扩展
VPC 集成以实现数据隐私
IAM 集成以实现身份验证和授权
Cortex入门
安装 Cortex CLI
配置您的 AWS 环境
定义您的 ML 模型部署配置
将您的模型部署到 Cortex 集群
监控模型性能和日志
根据需要扩展您的集群
Cortex的使用案例
- 实时 ML 推理
- 异步 ML 处理
- 批量 ML 作业执行
- 大规模 ML 模型管理
- 成本优化的 ML 部署
- MLOps 流水线集成







