설명
LiteRT는 널리 사용되는 TensorFlow Lite에서 발전한 Google의 차세대 온디바이스 머신러닝 배포 프레임워크입니다. 이 프레임워크는 광범위한 엣지 플랫폼에서 고성능 ML 및 생성형 AI 배포를 위해 설계되었습니다. 온디바이스 환경의 제약 조건과 요구 사항에 맞춰 모델 변환, 런타임 실행 및 최적화를 위한 효율적인 파이프라인을 제공합니다.
검증된 TensorFlow Lite를 기반으로 구축된 LiteRT는 수십억 개의 디바이스에서 직접 실행되는 애플리케이션에 대해 낮은 지연 시간과 향상된 개인 정보 보호를 제공하는 것을 목표로 합니다. 크로스 플랫폼 호환성은 단순화된 하드웨어 가속 및 다중 프레임워크 지원을 제공하여 생성형 AI를 포함한 정교한 AI 기능의 배포를 간소화합니다. 개발자는 기존 .tflite 모델을 활용하거나 PyTorch, JAX, TensorFlow와 같은 프레임워크의 모델을 변환할 수 있습니다. LiteRT 최적화 툴킷을 사용하면 학습 후 양자화를 통해 모델 효율성을 더욱 개선할 수 있습니다.
LiteRT는 사전 학습된 모델을 애플리케이션에 통합하는 것부터 심층적인 하드웨어별 최적화를 통한 고급 사용자 정의 모델 작성에 이르기까지 다양한 배포 시나리오를 지원합니다. 이 프레임워크는 개발자가 Gemma와 같은 모델을 사용하여 최첨단 AI, 고급 에이전트 기능 및 다단계 계획 기능을 엣지 디바이스에 직접 구현할 수 있도록 지원합니다. 또한 MediaTek 및 Qualcomm NPU에 대한 하드웨어 가속 지원 확장에 중점을 두어 이러한 칩셋에서 생성형 AI 작업의 최고 성능을 발휘합니다.
기존 TensorFlow Lite 사용자의 경우 LiteRT로 전환하면 Android, 데스크톱, 웹과 같은 플랫폼 전반에 걸쳐 향상된 성능과 통합된 API를 얻을 수 있습니다. CompiledModel API의 도입은 하드웨어 선택을 자동화하고 비동기 실행을 가능하게 하여 배포를 더욱 간소화합니다. LiteRT-LM은 특히 웨어러블 및 브라우저 기반 플랫폼에서 언어 모델을 배포할 수 있도록 하여 다양한 엣지 AI 애플리케이션에 대한 다재다능함을 보여줍니다. GitHub 리포지토리를 통해 커뮤니티 기여를 장려하며, 최적화된 오픈 가중치 모델은 Hugging Face Hub를 통해 액세스할 수 있습니다.
LiteRT: 온디바이스 ML 프레임워크의 핵심 기능
고성능 온디바이스 ML 및 GenAI 배포
PyTorch, JAX, TensorFlow에서 효율적인 모델 변환
엣지 플랫폼을 위한 최적화된 런타임
학습 후 양자화 툴킷
크로스 플랫폼 호환성 (Android, 데스크톱, 웹)
단순화된 하드웨어 가속
다중 프레임워크 지원
자동 하드웨어 선택을 위한 CompiledModel API
온디바이스 언어 모델을 위한 LiteRT-LM
향상된 개인 정보 보호 및 낮은 지연 시간
TensorFlow Lite 기반에서 발전
MediaTek 및 Qualcomm 칩셋의 NPU 가속 지원
LiteRT: 온디바이스 ML 프레임워크 시작하기
모델 확보: 기존 .tflite 모델을 사용하거나 PyTorch, JAX 또는 TensorFlow 모델을 변환합니다.
모델 최적화: LiteRT 최적화 툴킷을 사용하여 학습 후 양자화를 수행합니다.
모델 배포: 최적화된 모델을 LiteRT와 통합하고 최적의 가속기를 선택합니다.
모델 실행: 대상 엣지 디바이스에 애플리케이션을 배포합니다.
샘플 탐색: 완전한 엔드투엔드 샘플 앱은 GitHub를 참조하십시오.
모델 액세스: Hugging Face에서 최적화된 오픈 가중치 GenAI 모델을 찾으십시오.
LiteRT: 온디바이스 ML 프레임워크의 사용 사례
- 온디바이스 챗봇
- 엣지 AI 애플리케이션
- 웨어러블 AI
- 브라우저 기반 AI
- 비전 및 오디오 경험
- 에이전트 기능
- 사용자 정의 모델 최적화
- 크로스 플랫폼 배포





