跳转到主要内容
ToolPotion

通用计算

一个高速AI推理提供商,通过专门构建的ASIC基础设施提供模型,采用与OpenAI兼容的API,针对编码代理和实时语音等对延迟敏感的工作负载,提供低的首次令牌时间和高吞吐量。

访问URL
通用计算 screenshot

描述

通用计算是一个专注于速度的推理提供商。它在专门构建的ASIC基础设施上部署AI模型,而不是使用GPU,并通过与OpenAI兼容的API进行公开,以便团队可以通过更改基本URL和API密钥而无需重写代码进行切换。它宣传的首次令牌时间低于毫秒级,具有高吞吐量,最高可达每秒1,000个令牌,并与在通用计算上运行的相同模型与GPU基线进行基准比较。

该平台提供三种运行方式:基于使用量的自助API,专门为需要保证容量和生产支持的团队提供的专用容量,以及在通用计算基础设施上运行私有权重的自带模型服务。所有方式共享相同的与OpenAI兼容的接口,包括工具调用、JSON模式、推理准备模型和流式语义,因此现有的编排器可以继续工作。生产流量目前在美国地区运行,企业部署可提供专用区域。

通用计算将自己定位为一个需求驱动、资产密集型的提供商,购买、部署和运营专用硅(如SambaNova和Etched Sohu),使客户能够在他们不会自己架设的芯片上运行,并将结果作为推理出售。新账户开始时会获得免费信用,按需付费计划继承最佳努力的可靠性,而企业级别则增加合同服务水平协议、升级路径和专用容量。

通用计算的核心功能

  • 与OpenAI兼容的推理API,支持基本URL迁移

  • 专门构建的ASIC基础设施以实现高速推理

  • 低的首次令牌时间和高吞吐量

  • 工具调用、JSON模式、推理模型和流式处理

  • 自助API、专用部署和自带模型服务

  • 新账户获得免费信用

  • 企业级别提供合同服务水平协议和专用容量

如何使用 通用计算?

  1. 获取密钥:注册并获得带有免费信用的API密钥。

  2. 更换基本URL:将现有的与OpenAI兼容的SDK指向通用计算。

  3. 运行推理:发送请求并像往常一样使用工具调用、JSON模式和流式处理。

  4. 扩展:在需要保证容量时,转向专用容量或自带模型。

通用计算的使用案例

  • 编码代理
  • 实时语音和互动AI
  • 高吞吐量推理
  • 私有模型服务

通用计算的常见问题

通用计算 评价

加载中...

与 通用计算 类似的热门AI工具

一个专注于AI推理和集成的提供商,通过一个兼容OpenAI的API托管开放、专有和定制模型,提供按需付费定价、更高的速率限制和无代码仪表板。

MLOps 与模型部署

AI 应用

ZETIC Melange 自动化任何模型在任何设备上的设备端 AI 部署。由前高通工程师打造,它可优化 NPU 加速,在 200 多种设备上进行基准测试,并只需三行代码即可在数小时内完成部署,从而降低成本和延迟。

MLOps 与模型部署

AI 应用

Runware 是一个生成性 AI 推理平台,提供统一的 API 用于图像、视频、音频、3D、LLM 和视觉模型。它提供超过 40 万个模型,管理基础设施,并基于使用量定价,构建在自定义推理引擎之上。

MLOps 与模型部署

AI 平台

一个为开发者提供的AI基础设施平台,通过一个与OpenAI兼容的API,以按需付费的方式部署、微调和运行200多个优化的LLM和多模态模型。

精选MLOps 与模型部署

RunInfra 是一个聊天原生的 AI 模型优化平台,能够基准测试 GPU、优化内核并部署生产 API。它使团队能够高效地构建和部署 AI 应用程序,确保整个技术栈的所有权和透明度。

MLOps 与模型部署

Cloudflare Workers AI 是一个边缘 AI 推理平台,允许用户通过一次 API 调用在全球范围内运行 AI 推理。它提供超过 50 种模型和无服务器定价,使得扩展 AI 工作负载变得简单,无需管理基础设施。

精选MLOps 与模型部署

AI 应用

Deployo 将 AI 模型转化为生产就绪型应用程序,提供直观、云无关且安全的基础设施。它简化了机器学习工作流,使用户能够在几分钟内从训练转变为可扩展的 API,从而降低部署复杂性和时间。

MLOps 与模型部署

AI 应用

vLLM 是一个高吞吐量和内存高效的推理和服务引擎,专为大型语言模型(LLMs)设计。它使得 AI 模型的快速部署成为可能,提供先进的性能,使得 LLM 服务对各行业的用户而言变得简单、快速且具有成本效益。

MLOps 与模型部署