描述
通用计算是一个专注于速度的推理提供商。它在专门构建的ASIC基础设施上部署AI模型,而不是使用GPU,并通过与OpenAI兼容的API进行公开,以便团队可以通过更改基本URL和API密钥而无需重写代码进行切换。它宣传的首次令牌时间低于毫秒级,具有高吞吐量,最高可达每秒1,000个令牌,并与在通用计算上运行的相同模型与GPU基线进行基准比较。
该平台提供三种运行方式:基于使用量的自助API,专门为需要保证容量和生产支持的团队提供的专用容量,以及在通用计算基础设施上运行私有权重的自带模型服务。所有方式共享相同的与OpenAI兼容的接口,包括工具调用、JSON模式、推理准备模型和流式语义,因此现有的编排器可以继续工作。生产流量目前在美国地区运行,企业部署可提供专用区域。
通用计算将自己定位为一个需求驱动、资产密集型的提供商,购买、部署和运营专用硅(如SambaNova和Etched Sohu),使客户能够在他们不会自己架设的芯片上运行,并将结果作为推理出售。新账户开始时会获得免费信用,按需付费计划继承最佳努力的可靠性,而企业级别则增加合同服务水平协议、升级路径和专用容量。
通用计算的核心功能
与OpenAI兼容的推理API,支持基本URL迁移
专门构建的ASIC基础设施以实现高速推理
低的首次令牌时间和高吞吐量
工具调用、JSON模式、推理模型和流式处理
自助API、专用部署和自带模型服务
新账户获得免费信用
企业级别提供合同服务水平协议和专用容量
如何使用 通用计算?
获取密钥:注册并获得带有免费信用的API密钥。
更换基本URL:将现有的与OpenAI兼容的SDK指向通用计算。
运行推理:发送请求并像往常一样使用工具调用、JSON模式和流式处理。
扩展:在需要保证容量时,转向专用容量或自带模型。
通用计算的使用案例
- 编码代理
- 实时语音和互动AI
- 高吞吐量推理
- 私有模型服务







