설명
일반 컴퓨트는 속도에 중점을 둔 추론 제공업체입니다. AI 모델을 GPU가 아닌 목적에 맞게 설계된 ASIC 인프라에 배포하고, OpenAI 호환 API를 통해 노출하여 팀이 코드를 다시 작성하지 않고도 기본 URL과 API 키를 변경하여 전환할 수 있도록 합니다. 서브 밀리초의 첫 번째 토큰 시간, 높은 처리량, 초당 최대 1,000 토큰을 광고하며, 일반 컴퓨트에서 실행된 동일한 모델을 GPU 기준선과 비교한 벤치마크를 제공합니다.
이 플랫폼은 세 가지 실행 방법을 제공합니다: 사용 기반 추론을 위한 셀프 서비스 API, 보장된 용량과 생산 지원이 필요한 팀을 위한 전용 용량, 그리고 일반 컴퓨트의 인프라에서 개인 가중치를 실행하는 모델 가져오기 서비스입니다. 모든 방법은 도구 호출, JSON 모드, 추론 준비 모델 및 스트리밍 의미론을 포함한 동일한 OpenAI 호환 인터페이스를 공유하므로 기존 오케스트레이터가 계속 작동합니다. 현재 생산 트래픽은 미국 지역에서 실행되며, 기업 배포를 위한 전용 지역도 제공됩니다.
일반 컴퓨트는 수요 기반의 자산 집약적 제공업체로 자리매김하며, 고객이 직접 랙에 장착하지 않는 특수 실리콘(예: SambaNova 및 Etched Sohu)을 구매, 배포 및 운영하여 고객이 추론으로 결과를 판매할 수 있도록 합니다. 신규 계정은 무료 크레딧으로 시작하며, 사용량 기반 요금제는 최선의 노력 신뢰성을 상속받고, 기업 계층은 계약 SLA, 에스컬레이션 경로 및 전용 용량을 추가합니다.
일반 컴퓨트의 핵심 기능
OpenAI 호환 추론 API 및 기본 URL 마이그레이션
고속 추론을 위한 목적에 맞게 설계된 ASIC 인프라
낮은 첫 번째 토큰 시간과 높은 처리량
도구 호출, JSON 모드, 추론 모델 및 스트리밍
셀프 서비스 API, 전용 배포 및 모델 가져오기 서비스
신규 계정에 대한 무료 크레딧
계약 SLA 및 전용 용량을 갖춘 기업 계층
일반 컴퓨트 사용 방법은?
키 받기: 가입하고 무료 크레딧이 포함된 API 키를 받습니다.
기본 URL 변경: 기존 OpenAI 호환 SDK를 일반 컴퓨트로 포인팅합니다.
추론 실행: 요청을 보내고 도구 호출, JSON 모드 및 스트리밍을 평소처럼 사용합니다.
확장: 보장된 용량이 필요할 때 전용 용량으로 이동하거나 모델을 가져옵니다.
일반 컴퓨트의 사용 사례
- 코딩 에이전트
- 실시간 음성 및 인터랙티브 AI
- 고속 추론
- 개인 모델 서비스







