Descrição
LiteRT representa a próxima geração de implantação de machine learning on-device do Google, evoluindo do amplamente adotado TensorFlow Lite. Este framework é projetado para implantação de ML e IA Generativa de alto desempenho em uma vasta gama de plataformas de edge. Ele fornece um pipeline eficiente para conversão de modelos, execução em runtime e otimização, especificamente adaptado às restrições e demandas de ambientes on-device.
Construído sobre a fundação testada em batalha do TensorFlow Lite, o LiteRT visa entregar baixa latência e privacidade aprimorada para aplicações executadas diretamente em bilhões de dispositivos. Sua prontidão multiplataforma simplifica a implantação de capacidades de IA sofisticadas, incluindo IA Generativa, oferecendo aceleração de hardware simplificada e suporte a múltiplos frameworks. Desenvolvedores podem aproveitar modelos .tflite existentes ou converter modelos de frameworks como PyTorch, JAX e TensorFlow. O toolkit de otimização LiteRT permite quantização pós-treinamento, refinando ainda mais a eficiência do modelo.
LiteRT suporta uma variedade de cenários de implantação, desde a integração de modelos pré-treinados em aplicações até a autoria avançada de modelos personalizados com otimizações profundas específicas de hardware. Ele foi projetado para capacitar desenvolvedores a trazer IA de ponta, incluindo habilidades agentivas avançadas e capacidades de planejamento multi-etapa com modelos como Gemma, diretamente para o edge. O framework também foca em expandir o suporte à aceleração de hardware, notavelmente para NPUs MediaTek e Qualcomm, desbloqueando o desempenho máximo para tarefas de IA generativa nesses chipsets.
Para usuários existentes do TensorFlow Lite, a transição para o LiteRT oferece desempenho aprimorado e APIs unificadas em plataformas como Android, Desktop e Web. A introdução da API CompiledModel simplifica ainda mais a implantação automatizando a seleção de hardware e permitindo a execução assíncrona. O LiteRT-LM especificamente permite a implantação de modelos de linguagem em wearables e plataformas baseadas em navegador, demonstrando sua versatilidade para diversas aplicações de IA de edge. Contribuições da comunidade são encorajadas através de seu repositório GitHub, e modelos otimizados de peso aberto são acessíveis via Hugging Face Hub.
Recursos principais de LiteRT: Framework de ML On-Device
Implantação de ML e GenAI on-device de alto desempenho
Conversão eficiente de modelos de PyTorch, JAX, TensorFlow
Runtime otimizado para plataformas de edge
Toolkit de quantização pós-treinamento
Compatibilidade multiplataforma (Android, Desktop, Web)
Aceleração de hardware simplificada
Suporte a múltiplos frameworks
API CompiledModel para seleção automatizada de hardware
LiteRT-LM para modelos de linguagem on-device
Privacidade aprimorada e baixa latência
Evolui da fundação TensorFlow Lite
Suporta aceleração NPU em chipsets MediaTek e Qualcomm
Primeiros passos com LiteRT: Framework de ML On-Device
Obter Modelo: Use modelos .tflite existentes ou converta modelos PyTorch, JAX ou TensorFlow.
Otimizar Modelo: Utilize o toolkit de otimização LiteRT para quantização pós-treinamento.
Implantar Modelo: Integre seu modelo otimizado com LiteRT, selecionando o acelerador ideal.
Executar Modelo: Implante sua aplicação em dispositivos de edge alvo.
Explorar Exemplos: Consulte o GitHub para aplicativos de exemplo completos de ponta a ponta.
Acessar Modelos: Encontre modelos GenAI otimizados de peso aberto no Hugging Face.
Casos de uso de LiteRT: Framework de ML On-Device
- Chatbots On-Device
- Aplicações de IA de Edge
- IA em Wearables
- IA Baseada em Navegador
- Experiências de Visão e Áudio
- Habilidades Agentivas
- Otimização de Modelos Personalizados
- Implantação Multiplataforma





