MLOps 도구 카테고리는 거의 겹치지 않는 두 진영으로 갈라졌습니다. LLM과 에이전트의 동작을 관측하고 평가하는 도구, 그리고 모델을 대규모로 서빙하고 배포하는 도구입니다. 프로덕션 AI 스택에는 양쪽에서 최소 하나씩은 필요합니다. 이 비교는 2026년에 데이터 과학자나 ML 엔지니어가 실제로 평가해 볼 만한 12개의 MLOps 도구를 다루며, 모두 ToolPotion의 추천 세트에서 골라 이번 달에 각 도구의 공식 사이트와 대조해 검증했습니다. 이 분야는 붐비지만 수준은 고르지 않습니다. 관측성 도구는 견실한 몇 가지 선택지로 수렴한 반면, 추론 서빙 쪽은 잘 다듬어진 관리형 API부터 실질적인 인프라 작업이 필요한 순수 오픈소스 프레임워크까지 폭이 넓습니다.
각 도구는 ML 프로덕션 수명 주기의 의미 있는 한 조각, 즉 실험 추적, 모델 레지스트리, 추론 서빙, LLM 트레이싱, 에이전트 평가, 또는 엣지 배포 중 하나를 다룬다는 점에서 선정되었습니다.
선정 방법
후보는 ToolPotion의 추천 MLOps 및 모델 배포 세트에 그 ML 유사도 엔진을 더한 데서 골랐고, 이후 2026년 8월에 각 도구의 공식 사이트와 대조해 검증했습니다. 후원은 없으며, 제휴에 따른 순위 매기기도 없습니다.
빠른 비교
| 도구 | 적합한 용도 | 돋보이는 점 | 가격 |
|---|---|---|---|
| LangSmith | 에이전트 + LLM 관측성 | SmithDB로 서브초 단위 트레이스 쿼리 | 무료 등급, Plus는 좌석당 월 $39 |
| Langfuse | 오픈소스 LLM 트레이싱 | 자체 호스팅 가능, 기능 완전 동등 | Hobby 무료, Core 월 $29, OSS 무료 |
| MLflow | 실험 추적 + 레지스트리 | LLM 트레이싱 + 에이전트 평가를 하나의 OSS 도구로 | 오픈소스 무료, 관리형은 Databricks를 통해 |
| Braintrust | 평가를 앞세운 AI 품질 | LLM을 심판으로 쓰는 내장 채점 | 무료, Pro 월 $249 |
| vLLM | 고처리량 자체 호스팅 서빙 | PagedAttention + 연속 배칭 | 무료(Apache 2.0) |
| BentoML / Bento | 어떤 모델이든, 어떤 클라우드에서든 | 멀티프레임워크, 콜드 스타트 가속 | OSS 무료, 관리형 가격은 문의 |
| Kubeflow | Kubernetes ML 오케스트레이션 | 모듈형 파이프라인 + 학습 + KServe | 무료(CNCF 오픈소스) |
| Replicate | API 우선 모델 호스팅 | API로 제공되는 수천 개의 즉시 사용 모델 | 사용량 기반 과금, $0.000025/초부터 |
| Baseten | 전용 GPU 추론 | 유휴 시간 과금 없음, 빠른 콜드 스타트 | 무료로 시작, GPU는 $0.01052/분부터 |
| DeepInfra | 100개 이상 모델을 아우르는 비용 효율적 API | 배치 작업을 위한 0.8× Flex 등급 | 사용량 기반 과금, Standard/Priority/Flex |
| Cloudflare Workers AI | 엣지 AI 추론 | 하루 1만 뉴런 무료, 200개 이상 도시에 PoP | 하루 1만 뉴런 무료, 이후 1천 뉴런당 $0.011 |
| LM Studio | 로컬 프라이빗 배포 | 완전 오프라인, OpenAI 호환 서버 | 데스크톱 앱 무료, 클라우드 크레딧은 사용량 기반 |
1. LangSmith: 에이전트와 LLM을 위한 프로덕션 관측성
LangSmith는 LangChain 팀이 만든 관측성 및 평가 플랫폼으로, 프로토타입 디버깅부터 프로덕션 모니터링까지 전체 수명 주기를 다룹니다. SDK는 Python, TypeScript, Go, Java용으로 제공되며, LangChain이 아닌 프레임워크를 위한 OpenTelemetry 연동도 있습니다.
적합한 용도: LangChain 기반 에이전트를 운영하는 팀, 또는 트레이스에서 데이터셋, 평가로 이어지는 긴밀한 피드백 루프가 필요한 모든 LLM 앱.
돋보이는 부분은 SmithDB로, 수백만 개의 스팬에 걸쳐 서브초 단위 쿼리를 제공하는 전용 설계 트레이스 저장소입니다. SQL 기반 관측성 스택 대부분은 실제 프로덕션 에이전트가 만들어 내는 트레이스 규모에서 버벅이기 시작합니다. LangSmith는 그 위에 온라인 LLM 심판 평가, 자동 오류 클러스터링, PagerDuty 알림을 얹습니다.
한계: 이 플랫폼은 LangChain을 쓸 때 가장 유용합니다. CrewAI, 순수 API 호출, 또는 자체 오케스트레이션을 쓰는 팀은 Langfuse 같은 프레임워크 비종속 도구를 쓸 때보다 SDK 배선에 더 많은 시간을 씁니다.
가격: Developer 무료(좌석 1개, 월 5천 트레이스), Plus는 좌석당 월 $39, Enterprise는 자체 호스팅 옵션이 포함된 맞춤 가격.
2. Langfuse: 오픈소스 LLM 엔지니어링 플랫폼
Langfuse는 트레이싱, 프롬프트 관리, 평가, 분석을 하나의 오픈소스 워크플로에 묶습니다. 자체 호스팅 경로가 가장 뚜렷한 차별점입니다. Docker Compose나 Kubernetes에서 전체 플랫폼을 무료로 돌리며, 모든 트레이스 데이터는 자사 인프라에 남습니다.
적합한 용도: 프라이버시에 민감한 팀, 규제 산업, 또는 클라우드 요금 없이 데이터를 완전히 통제하고 싶은 사람.
프롬프트 관리는 단순 저장을 넘어섭니다. Langfuse는 프롬프트를 버전 관리하고 비교하고 A/B 테스트하면서, 그 변경을 같은 화면에서 품질 지표와 연관 지을 수 있게 해 줍니다. SOC 2와 ISO 27001 준수는 클라우드 Pro 등급에서 제공됩니다.
한계: 자체 호스팅에서는 업그레이드와 백업이 당신 몫이고, 스케일링도 마찬가지입니다. 무료 클라우드 등급은 좌석 2개와 30일 보존으로 제한되어, 실제 팀 어느 곳에나 빠듯합니다.
가격: Hobby 클라우드 무료, Core 월 $29, Pro 월 $199, Enterprise 월 $2,499. 자체 호스팅 오픈소스는 무료.
3. MLflow: 오픈소스 수명 주기의 중추
MLflow Documentation은 단순 실험 추적기에서 완전한 수명 주기 시스템으로 성장한 플랫폼을 설명합니다. 실험 실행, 모델 레지스트리, LLM 트레이싱, 프롬프트 관리, 에이전트 평가를 하나의 오픈소스 지붕 아래 담고 있습니다.
적합한 용도: 고전 ML을 위한 실험 추적을 LLM 관측성과 함께 필요로 하면서, 두 개의 별도 플랫폼에 비용을 치르고 싶지 않은 팀.
MLflow의 실험 추적 UI는 전통적 ML에서 여전히 가장 널리 채택됩니다. 추가된 LLM 기능(트레이싱, 평가, 프롬프트 관리)은 팀이 별도 스택을 꿰매 붙이는 대신 점진적으로 도입할 수 있게 해 줍니다. Databricks가 관리하는 MLflow는 엔터프라이즈 용도를 위한 거버넌스 계층을 더합니다.
한계: 전용 설계된 LLM 관측성 도구에 비하면 UI는 낡아 보이고, 에이전트 평가는 LangSmith나 Braintrust만큼 성숙하지 않습니다. 오픈소스 버전은 추적 서버를 직접 운영해야 합니다.
가격: 무료이자 오픈소스. 관리형 버전은 Databricks를 통해 엔터프라이즈 가격으로 이용 가능.
4. Braintrust: 평가를 앞세운 AI 품질 플랫폼
Braintrust는 트레이싱보다 평가에서 출발합니다. 팀은 데이터셋을 대상으로 자동 평가(LLM 심판 채점 포함)를 실행하고, 모델 버전 전반에 걸쳐 점수를 추적하며, 품질 지표가 흔들리면 알림을 받습니다.
적합한 용도: 회귀가 주된 위험인, 프롬프트 변경이나 모델 교체를 빠르게 반복하는 제품 팀.
내장 프록시는 x-bt-parent 헤더를 통해 모든 LLM 호출을 기록하여, 최소한의 SDK 오버헤드로 다중 턴 대화 전반에 걸친 분산 트레이싱을 가능하게 합니다. 대시보드는 비용과 지연 시간을 품질 점수와 연관 지어, 더 저렴한 모델이 실제로는 정확도에서 대가를 치르게 하는지 볼 수 있게 해 줍니다.
한계: 무료 Starter 플랜의 14일 보존은 프로덕션 용도에는 짧고, Pro(월 $249)까지의 격차는 초기 단계 팀에게는 가파릅니다.
가격: Starter 무료(월 $0, 모델 크레딧 $10 포함), Pro 월 $249, Enterprise는 맞춤 가격.
5. vLLM: 오픈소스 추론 엔진의 표준
vLLM은 자체 호스팅 LLM 서빙의 레퍼런스 구현이 되었습니다. 그 PagedAttention 메커니즘은 KV 캐시의 메모리 단편화를 없애, 단순한 추론 구성보다 훨씬 높은 처리량을 제공합니다.
적합한 용도: LLM을 고처리량으로 자체 호스팅해야 하며, 자체 서빙 계층을 운영할 GPU 용량과 운영 역량을 갖춘 인프라 팀.
vLLM은 연속 배칭, 프리픽스 캐싱, 추측 디코딩, 그리고 NVIDIA·AMD·Intel GPU, TPU, Apple Silicon에 걸친 FP8/INT4/INT8 양자화를 지원합니다. OpenAI 호환 API 서버 덕분에 호스팅형 추론을 거의 그대로 대체할 수 있습니다.
한계: vLLM은 프레임워크이지 관리형 서비스가 아닙니다. 프로비저닝과 오토스케일링은 당신의 문제이고, 모니터링과 업그레이드도 마찬가지입니다. 운영 면적은 보기보다 넓습니다.
가격: 무료, Apache 2.0 오픈소스. 컴퓨팅 비용은 자사 인프라에서 발생합니다.
6. BentoML / Bento: 어떤 모델이든, 어디서든 자체 호스팅
Bento: Run Inference at Scale은 오픈소스 Python 프레임워크와 관리형 추론 플랫폼을 짝지웁니다. 프레임워크는 어떤 모델(PyTorch, JAX, vLLM, TRT-LLM, ONNX)이든 표준화된 서비스 정의로 감싼 뒤, 오토스케일링과 카나리 배포 도구와 함께 AWS, GCP, Azure 또는 온프레미스 Kubernetes에 배포합니다.
적합한 용도: 멀티프레임워크 유연성이 필요하고, 오픈소스 개발과 관리형 프로덕션 배포를 원하는 ML 팀.
콜드 스타트 가속은 실질적인 차별점입니다. 많은 추론 플랫폼이 유휴 상태와 첫 토큰 사이에 무시하기 어려운 지연 시간 격차를 보입니다. Bento는 또한 배치, 대화형, 비동기 워크로드를 같은 서비스 정의 안에서 네이티브로 다룹니다.
한계: 관리형 Bento 플랫폼의 가격은 공개되어 있지 않습니다. 사전 예산 수치가 필요한 팀은 데모를 예약해야 하는데, Replicate나 Baseten에 비하면 실질적인 마찰 지점입니다.
가격: 오픈소스 BentoML 프레임워크는 무료. 관리형 Bento 플랫폼은 가격 문의.
7. Kubeflow: Kubernetes 네이티브 ML 오케스트레이션
Kubeflow: AI Platform for ML Workflows는 Kubernetes에서 ML을 위한 CNCF 졸업 플랫폼입니다. 조합 가능한 하위 프로젝트들이 노트북, 분산 학습(Training Operator), 하이퍼파라미터 튜닝(Katib), 파이프라인 오케스트레이션, 멀티프레임워크 모델 서빙(KServe)을 아우릅니다.
적합한 용도: 기존 Kubernetes 인프라 위에 내부 AI 플랫폼을 구축하는 플랫폼 엔지니어링 팀, 특히 규제가 있는 온프레미스나 하이브리드 클라우드 환경.
모듈형 설계가 핵심 강점입니다. 오케스트레이션에는 Kubeflow Pipelines만, 모델 서빙에는 KServe만 채택할 수 있어, 전체 스택에 얽매이지 않습니다.
한계: Kubeflow를 제대로 운영하려면 깊은 Kubernetes 전문성이 필요합니다. 릴리스 주기는 상용 MLOps 플랫폼보다 느리고, UI는 완성도 면에서 뒤처집니다.
가격: 무료, 오픈소스. 기반이 되는 Kubernetes 인프라에는 비용을 지불합니다.
8. Replicate: 빠른 프로토타이핑을 위한 API 우선 모델 호스팅
Replicate - Run AI with an API는 수천 개의 오픈소스 모델(이미지 생성, 음성, 음악, 언어)에 대한 클라우드 API를 제공하며, 단일 명령으로 커스텀 파인튜닝 모델을 배포하는 경로도 갖추고 있습니다.
적합한 용도: GPU 인프라를 관리하지 않고도 프로덕션 준비된 모델에 즉시 접근해야 하는 제품 개발자와 인디 빌더.
"Replicate에서는 사용한 만큼만 지불합니다" — 추론량이 예측하기 어려운 팀에게는 진정으로 단순한 제안입니다.
모델의 폭이 매력입니다. Llama 변형, 이미지 생성기, 오디오 모델이 하나의 청구 계정과 동일한 API 패턴에 모여 있습니다. 파인튜닝된 모델은 유휴 인스턴스 시간이 아니라 실제 처리 시간에 대해서만 과금됩니다.
한계: 높고 지속적인 추론 부하에서는 Replicate의 초당 요금이 전용 GPU 구성보다 비싸집니다. 비용 예측성은 전용 인스턴스보다 확보하기 어렵습니다.
가격: 사용량 기반 과금. 시간 기반 과금은 $0.000025/초(CPU)부터 $0.0112/초(8×A100)까지, 출력 기반은 이미지당 $0.04부터이며, 약정 지출에 대한 엔터프라이즈 할인이 있습니다.
9. Baseten: 유휴 과금 없는 전용 GPU 추론
Inference Platform(Baseten)은 예측 가능한 SLA를 갖춘 전용 저지연 추론이 필요하지만 순수 Kubernetes는 관리하고 싶지 않은 팀을 겨냥합니다. 과금 모델이 차별점입니다. 모델이 실제로 컴퓨팅을 사용할 때만 지불하고, 유휴 시간에는 지불하지 않습니다.
적합한 용도: 일관된 추론 부하를 가지며 전용 GPU 용량과 규정 준수 보장(전 플랜에 SOC 2 Type II 및 HIPAA)을 원하는 프로덕션 팀.
Model API 경로는 토큰 단위 가격(백만 토큰당 $0.13부터)을 사용합니다. Dedicated Deployments는 $0.01052/분(T4)부터 $0.16633/분(B200)까지의 분 단위 요금으로 GPU 수준의 제어를 제공합니다.
한계: 설정은 Replicate나 DeepInfra보다 손이 많이 갑니다. 초기 단계 개발자는 무료 기본 등급에서 동작하는 엔드포인트를 얻기 전에 구성 복잡성에 부딪히게 됩니다.
가격: 무료로 시작(사용량 기반 Model API), 전용 GPU는 $0.01052/분(T4)부터 $0.16633/분(B200)까지, 여기에 물량 할인이 있는 Pro와 Enterprise.
10. DeepInfra: 100개 이상 모델을 아우르는 비용 효율적 추론
DeepInfra는 100개 이상 모델에 걸친 사용량 기반 추론 API를 제공하며, 비용 계층화에 의도적으로 초점을 둡니다. Flex 등급(표준의 0.8× 가격)은 엄격한 지연 시간 보장이 필요 없는 배치 작업, 평가 실행, 합성 데이터 생성을 위해 특별히 설계되었습니다.
적합한 용도: 대화형 프로덕션 워크로드와 함께 대규모 오프라인 추론을 돌리는, 비용에 민감한 개발자.
3단 구조(Standard, 1.5×의 Priority, 0.8×의 Flex)는 팀이 전반에 걸쳐 우선순위 요금을 내는 대신, 워크로드 유형별로 지출을 지연 시간 요구에 맞출 수 있게 해 줍니다. OpenAI 호환 API는 마이그레이션 수고가 최소임을 뜻합니다.
한계: 커스텀 또는 파인튜닝 모델 배포는 Replicate나 Baseten보다 덜 지원됩니다. UI는 최소한으로, 이것은 내장 모니터링이 없는 개발자 API입니다.
가격: 사용량 기반 과금, 사전 계약 없음. 요청별로 Standard, Priority(1.5×), Flex(0.8×) 등급.
11. Cloudflare Workers AI: 글로벌 발자국을 갖춘 엣지 추론
Cloudflare Workers AI - Edge AI Inference Platform은 200개 이상 도시에 걸친 Cloudflare 네트워크 엣지에서 AI 추론을 실행하여, 이 목록에서 모델 실행이 지리적으로 최종 사용자에 가까운 곳에서 일어나는 유일한 선택지입니다. 서버리스 API를 통해 100개 이상 모델(LLM, 이미지 생성, 임베딩, Whisper)을 지원합니다.
적합한 용도: 이미 Cloudflare 네트워크에 배포된 앱에 지연 시간에 민감한 AI 기능을 넣는 웹 개발자.
Neurons라는 가격 단위(요청당 GPU 컴퓨팅)는 낯설지만 투명합니다. 1만 개의 무료 Neurons가 매일 초기화되며, 유료 사용은 1,000 Neurons당 $0.011입니다. LLM 요율은 모델에 따라 백만 입력 토큰당 $0.017–$1.40로 산출됩니다.
한계: Cloudflare가 배포한 모델로 제한됩니다. 커스텀 모델 업로드는 지원되지 않아, 독자적인 파인튜닝 가중치를 가진 팀에게는 넘을 수 없는 벽입니다.
가격: 하루 1만 개의 무료 Neurons, 이후 유료 사용은 1,000 Neurons당 $0.011. 일부 고급 모델은 유료 Workers 플랜이 필요합니다.
12. LM Studio: 완전 로컬, 완전 프라이빗 모델 배포
LM Studio - Local AI는 오픈소스 모델을 당신의 기기(Mac, Windows, Linux)에 직접 내려받아 실행하며, 추론 중 네트워크 호출이 전혀 없습니다. Bionic 에이전트 계층은 로컬 모델 위에 문서 편집, 코딩, 음성 전사, 웹 검색을 더합니다.
적합한 용도: 민감한 데이터를 다루며, 토큰당 비용이 없고 데이터가 기기를 벗어나지 않는 프라이빗 AI 추론이 필요한 개발자와 연구자.
LM Studio는 Llama, Qwen, DeepSeek, Gemma, 그리고 수백 개의 다른 Hugging Face 형식 모델을 실행합니다. 그 로컬 서버는 OpenAI API 호환입니다. OpenAI SDK를 쓰는 어떤 도구든 base URL만 바꾸면 로컬 LM Studio 인스턴스를 가리킬 수 있습니다. LM Link는 최대 5대의 로컬 기기로 접근을 확장합니다.
한계: 성능은 로컬 하드웨어에 묶여 있습니다. 7B–30B 모델은 소비자용 GPU에서 잘 돌아갑니다. 70B 이상은 대부분의 개발자 기기가 갖추지 못한 VRAM을 요구합니다. 이것은 개발 환경이지, 외부 사용자를 위한 프로덕션 서빙 솔루션이 아닙니다.
가격: 데스크톱 앱 무료, 클라우드 크레딧은 사용량 기반(작은 모델의 경우 백만 토큰당 $0.13부터). Bionic Pass 구독은 개발 중이며, 가격은 미정.
선택하는 방법
가장 급박한 문제에서 시작하세요. 에이전트가 예측 불가능하게 실패하고 그 이유를 알 수 없다면, 관측성 도구가 먼저입니다. LangChain 기반 팀에게는 LangSmith의 Plus 플랜이 실용적인 선택입니다. 데이터 소재지나 예산이 클라우드 지출을 제약할 때는 Langfuse의 오픈소스 자체 호스팅 빌드가 알맞습니다. 주된 워크플로가 프롬프트 변경에 대해 점수화된 평가를 돌리는 것이라면 Braintrust가 앞섭니다. 전체 세트를 보려면 디렉터리의 MLOps 및 모델 배포 도구 전부를 둘러보세요.
추론 서빙의 경우: 운영 부담 없이 폭넓은 모델 커버리지에 접근하려면 Replicate나 DeepInfra(배치 작업에는 Flex 등급)를 가리킵니다. 규정 준수 요구가 있는 전용 GPU 용량은 Baseten을 가리킵니다. 운영 리소스를 갖춘 고처리량 자체 호스팅은 vLLM을 가리킵니다. 이미 Kubernetes에 있는 팀은 Kubeflow나 BentoML을 평가해야 합니다. Cloudflare 네이티브 앱의 엣지 지연 시간에는 Workers AI가 유일하게 실행 가능한 선택지입니다. 보완적인 선택은 AI 개발 프레임워크와 AI 에이전트 도구에서 찾을 수 있습니다.
MLflow는 고전 ML 실험을 LLM 작업과 함께 돌릴 때의 선택으로, 두 번째 플랫폼 없이 둘 다를 아우르는 유일한 오픈소스 도구입니다. 민감한 데이터를 다루는 로컬 개발에서는, LM Studio의 OpenAI 호환 로컬 서버 덕분에 코드가 로컬 모델을 가리키든 클라우드 제공자를 가리키든 동일하게 동작합니다.
자주 묻는 질문
MLOps 도구와 LLMOps 도구의 차이는 무엇인가요?
MLOps는 프로덕션에서 ML 모델을 배포·모니터링·관리하는 것을 아우릅니다. 즉 실험 추적, 모델 레지스트리, 파이프라인 오케스트레이션, 서빙 인프라입니다. LLMOps는 대규모 언어 모델 특유의 과제에 초점을 둔 부분집합으로, 토큰 비용 추적, 프롬프트 버전 관리, 환각 탐지, 에이전트 트레이스 분석 등입니다. 2026년 대부분의 도구는 둘 다를 다루지만 강조점은 다릅니다. MLflow와 Kubeflow는 고전 MLOps 쪽으로 기웁니다. LangSmith, Langfuse, Braintrust는 주로 LLMOps 플랫폼입니다.
이 도구들을 모두 자체 호스팅할 수 있나요?
MLflow, Langfuse, vLLM, BentoML, Kubeflow, LM Studio는 모두 오픈소스로, 자체 호스팅을 일급 옵션으로 두며 소프트웨어 비용이 없습니다. Braintrust와 LangSmith는 Enterprise 등급에서 온프레미스 배포를 제공합니다. Replicate, DeepInfra, Baseten, Cloudflare Workers AI는 관리형 전용으로, 자체 호스팅 경로가 없습니다.
vLLM과 관리형 추론 API 중 어떻게 선택하나요?
낮은 수준에서 중간 수준의 물량이거나 불규칙한 트래픽에서는, 엔지니어링 시간까지 포함하면 관리형 API가 거의 항상 더 저렴합니다. 지속적으로 높은 처리량(시간당 수천 건의 요청)에서는 예약 GPU 인스턴스에서 자체 호스팅한 vLLM이 대개 비용에서 앞섭니다. 콜드 스타트 민감도도 저울질하세요. 서버리스 관리형 API는 첫 요청에서 무시하기 어려운 지연 시간을 가질 수 있지만, 웜 레플리카를 둔 vLLM은 그렇지 않습니다.
LLM 관측성을 무료로 시작하는 방법이 있나요?
있습니다. LangSmith의 Developer 플랜은 좌석 1개와 월 5,000 트레이스를 무료로 제공합니다. Langfuse의 Hobby 클라우드는 월 50,000 유닛을 무료로 주며(2명, 30일 보존), 또는 무료로 자체 호스팅할 수 있습니다. Braintrust의 Starter는 월 $0입니다. MLflow는 무료이자 오픈소스입니다. 무료 등급은 작은 프로덕션 워크로드를 계측하고, 선택을 확정하기 전에 플랫폼을 비교하기에 충분합니다.
MLOps 도구는 어떤 LLM 제공자와도 동작하나요, 아니면 모델에 묶여 있나요?
관측성 도구는 제공자 비종속입니다. LangSmith, Langfuse, Braintrust, MLflow는 SDK나 OpenTelemetry를 통해 어떤 LLM에서든 트레이스를 수집합니다. 추론 플랫폼은 특정 카탈로그에 결합되어 있습니다. Replicate와 DeepInfra는 특정 모델을 이름으로 호스팅합니다. Workers AI는 Cloudflare가 자사 엣지에 배포한 것만 실행합니다. vLLM과 BentoML은 모델 비종속으로, 당신이 가중치를 제공하면 그것을 서빙합니다.