Toda página de produto de IA parte do princípio de que você já fala o idioma. A tabela de preços cobra por token, o changelog comemora uma janela de contexto maior, o deck de vendas promete agentes fundamentados por RAG — e nada disso te diz o que essas palavras significam para a única pergunta que importa: essa ferramenta vai dar conta do serviço?
Então aqui estão os termos de IA explicados para quem compra, não para pesquisadores. Este não é, de propósito, um dicionário de A a Z. É um vocabulário de trabalho com cerca de duas dúzias de termos, organizado em torno das quatro perguntas que as pessoas realmente fazem ao avaliar uma ferramenta: com o que estou falando, por que ele erra às vezes, o que os números da ficha técnica significam e o que envolve a implantação. Cada verbete tem algumas frases em linguagem simples, além do motivo pelo qual o termo importa na hora da compra.
Leia direto do começo ao fim ou pule para a seção que você precisa. Onde um termo fica mais fácil de entender por meio de um produto real, o exemplo leva à sua página. A ToolPotion acompanha mais de 13.000 ferramentas de IA, atualizadas diariamente, então todo exemplo tem uma página atual por trás dele.
Com o que você está falando: os principais termos de IA explicados
A primeira confusão é a nomenclatura. "Modelo", "LLM", "chatbot", "assistente" e "agente" são usados de forma intercambiável no texto de marketing, e não são a mesma coisa.
Modelo
O sistema treinado em si: uma função estatística enorme que transforma entrada em saída, produzida ao passar quantidades gigantescas de dados por um processo de treinamento. Os produtos são embalagens em torno dos modelos: um app de chat, uma API e uma extensão de navegador podem estar todos sobre o mesmo modelo. Isso importa ao comparar ferramentas, porque o modelo define o teto de qualidade enquanto o produto decide o fluxo de trabalho. Você pode explorar os modelos de IA atuais como uma categoria própria no diretório.
Modelo de linguagem grande (LLM)
Um modelo treinado principalmente em texto para prever o que vem a seguir numa sequência. Acontece que isso é suficiente para rascunhar, resumir, traduzir e escrever código. Claude Opus e Gemini 3.1 Pro são exemplos atuais de fronteira. O diretório também lista LLMs abertos e menores que você mesmo pode rodar. Quando um fornecedor diz "movido a um LLM", a pergunta útil é qual deles e se você pode trocá-lo depois.
Chatbot
Um padrão de interface, não uma tecnologia: uma caixa de mensagens ligada a um modelo, normalmente limitada a uma única tarefa, como responder perguntas de clientes. Os chatbots modernos são construídos sobre LLMs, mas a palavra é anterior a eles, e é por isso que pode descrever qualquer coisa, de um script rígido de FAQ a um sistema de suporte genuinamente capaz.
Assistente (ou copilot)
Um produto de chat de propósito geral voltado para o trabalho diário de uma pessoa: rascunhar, resumir, responder, geralmente vivendo dentro dos apps onde esse trabalho acontece. O ChatGPT é o assistente independente canônico. "Copilot" normalmente sinaliza um assistente embutido em um produto existente. A distinção de compra em relação a um chatbot é o público: assistentes atendem sua equipe, chatbots costumam atender seus clientes.
Agente de IA
Software que recebe um objetivo, planeja etapas, chama ferramentas e confere os próprios resultados: ele age em vez de apenas responder. O Claude Code lê uma base de código, edita arquivos e executa comandos. A Intercom entrega um agente de suporte, o Fin, que trabalha as conversas em vez de apenas responder a elas. A contrapartida é o raio de impacto: um sistema que pode agir pode falhar ao agir, então as permissões e as etapas de revisão importam mais aqui do que em qualquer outro lugar. A categoria agente de IA é a seção que mais se movimenta no diretório.
| Termo | O que faz | Compre quando |
|---|---|---|
| Chatbot | Responde perguntas em um domínio específico | Você precisa de perguntas e respostas voltadas ao cliente em escala |
| Assistente | Ajuda uma pessoa em muitas tarefas | Você quer produtividade da equipe, com baixo risco |
| Agente | Planeja e executa trabalho de várias etapas | Vale a pena automatizar um fluxo de trabalho de ponta a ponta |
Multimodal
Um modelo que lida com mais do que texto: imagens, áudio ou vídeo, como entrada, saída ou ambos. O Gemini 3.1 Pro lê e raciocina sobre mídia mista. Do lado da geração, o Kling 3.0 transforma texto e imagens de referência em vídeo com áudio. Se o seu trabalho envolve capturas de tela, PDFs com gráficos ou gravações, o suporte multimodal é um requisito, não um diferencial desejável.
Por que ele erra às vezes: alucinação, contexto e datas de corte
Estes quatro termos explicam quase todas as saídas decepcionantes de IA que você verá na vida, e são o vocabulário de qualquer conversa séria com fornecedor sobre precisão.
Alucinação
Uma resposta confiante, fluente e errada. O modelo está gerando texto plausível, não consultando um banco de dados de fatos, então pode inventar citações, estatísticas e detalhes de produtos sem qualquer sinal de que está fazendo isso. Para trabalho factual, prefira ferramentas que citem fontes recuperáveis e trate qualquer dado específico sem citação como não verificado até que você confira.
Janela de contexto
Quanto texto, medido em tokens, o modelo consegue considerar de uma vez: a memória de trabalho dele, distinta do seu conhecimento. As janelas cresceram rápido. O Claude Opus anuncia uma janela de um milhão de tokens, suficiente para uma base de código inteira ou vários livros em uma única requisição.
Uma janela de contexto maior eleva o teto do que você pode colar. Ela não garante que o modelo pondere tudo isso.
Na prática, os modelos podem perder o fio de detalhes enterrados no meio de entradas muito longas, então "cabe na janela" e "é bem aproveitado" são afirmações diferentes.
Data de corte do treinamento
A data em que os dados de treinamento do modelo terminam. Qualquer coisa publicada depois disso é invisível para o modelo, a menos que o produto acople busca na web ou recuperação. Por que você deve se importar: se a ferramenta precisa saber preços, leis ou notícias atuais, pergunte ao fornecedor exatamente como as informações recentes entram. "O modelo é inteligente" não é uma resposta.
RAG (geração aumentada por recuperação)
Buscar primeiro, responder depois: o sistema encontra trechos relevantes nos seus documentos e então faz o modelo escrever a resposta usando-os. Isso fundamenta as respostas no seu conteúdo real, reduz (mas não elimina) a alucinação e permanece atualizado no instante em que um documento muda, sem retreinamento. Quando um fornecedor diz "treinado nos seus dados", pergunte se ele quer dizer RAG. Normalmente é isso, e para conhecimento interno, RAG costuma ser o que você quer.
Prompt e prompt de sistema
Um prompt é o que você envia ao modelo. Um prompt de sistema é a folha de instruções permanente que o fornecedor coloca à frente de cada conversa: tom, regras, salvaguardas. Um número surpreendente de produtos de IA de nicho é, em essência, um prompt de sistema sobre o modelo de outra pessoa. Isso ainda pode valer a pena pagar, mas deveria ter preço de embalagem, não de pesquisa.
Lendo a ficha técnica: tokens, parâmetros, inferência
Os números em uma página de preços de IA não são enfeite de marketing. Três deles definem diretamente a sua conta.
Token
A unidade que os modelos leem e emitem: um pedaço de texto, onde uma palavra comum em inglês costuma ser um token. Uma regra prática: 1.000 tokens equivalem a cerca de 750 palavras em inglês. O preço das APIs é cotado por milhão de tokens, com entrada e saída precificadas separadamente, e é por isso que documentos longos na entrada e respostas longas na saída são o que impulsiona o custo.
Parâmetros
Os pesos numéricos internos que um modelo aprendeu durante o treinamento. A contagem de parâmetros é o atalho padrão para o tamanho do modelo. O Muse Glimmer, por exemplo, é um modelo de 30 bilhões de parâmetros feito para executar tarefas de agente em hardware de consumidor. Mais parâmetros geralmente compram capacidade ao preço de velocidade e custo, e um modelo pequeno que dá conta bem da sua tarefa vence um grande pelo qual você paga demais para subaproveitar.
Inferência
Rodar o modelo treinado para produzir uma saída. O treinamento aconteceu uma vez, à custa do fornecedor; a inferência acontece a cada requisição, à sua custa. Latência e custo por requisição são propriedades da inferência, então quando um fornecedor anuncia inferência mais barata ou mais rápida, essa afirmação é sobre a sua conta e o tempo de espera dos seus usuários, não sobre a qualidade da resposta.
Ajuste fino (fine-tuning)
Treinamento adicional com seus próprios exemplos para deslocar o comportamento de um modelo: tom, formato, hábitos de domínio. É bom para estilo consistente e saída estruturada, e uma forma ruim de ensinar fatos que mudam, o que é trabalho do RAG. O custo oculto é a manutenção: cada atualização do modelo base pode significar refazer o trabalho.
Modelo de raciocínio
Um modelo que gasta computação extra trabalhando etapas intermediárias antes de responder, o que ajuda de forma mensurável em matemática, planejamento e código difícil. Alguns são híbridos: o Claude Opus pode responder rapidamente ou pensar por mais tempo conforme a necessidade. A contrapartida é real: as passagens de raciocínio são mais lentas e custam mais tokens, então rotear uma tarefa simples de extração por um deles é pagar por um pensamento de que você não precisa.
Benchmark
Um teste padronizado que produz as pontuações de ranking nos posts de lançamento. Trate-os como sinais aproximados de capacidade, não como previsões sobre a sua carga de trabalho: os fornecedores naturalmente destacam os benchmarks em que vencem. Vinte tarefas reais suas, rodadas contra duas ferramentas candidatas, dizem mais do que qualquer ranking.
Termos de implantação: APIs, pesos abertos e onde ele roda
O último conjunto de termos decide a estrutura de custos, a postura de privacidade e quanta engenharia você está assumindo.
API
Acesso programático: o seu software chama o modelo pela internet e paga por token, em vez de uma pessoa pagar por licença para um app. O mesmo fornecedor costuma vender ambos, e são orçamentos diferentes: as licenças escalam com o número de pessoas, os custos de API escalam com o uso. Saiba qual dos dois você está de fato buscando antes de comparar preços.
Pesos abertos vs. fechados
Modelos de pesos abertos publicam os arquivos do modelo: baixe-os, rode-os no seu próprio hardware, mantenha os dados internamente, não pague nenhuma taxa por token ao criador. O Gemma 4 oferece modelos abertos e leves construídos a partir da mesma tecnologia do Gemini, e a Stability AI publica modelos generativos abertos para imagens, vídeo e áudio. Modelos fechados são alugados por meio dos servidores do fornecedor: menos controle, muito menos carga operacional, e os modelos fechados mais fortes ainda tendem a liderar em capacidade bruta.
No dispositivo vs. na nuvem
Onde a inferência acontece fisicamente. Nuvem significa que as requisições saem da sua rede; no dispositivo ou auto-hospedado significa que elas não saem, e é por isso que equipes com alta exigência de conformidade se importam, e por que existem modelos como o Muse Glimmer que rodam em hardware de consumidor. Espere uma lacuna de capacidade: os maiores modelos não cabem em um laptop.
Embedding
Texto convertido em uma lista de números posicionados de modo que significados parecidos fiquem próximos uns dos outros. Os embeddings são como o software busca por significado em vez de palavras-chave exatas, o motivo pelo qual uma consulta por "regras de reembolso" consegue encontrar um documento intitulado "política de devoluções".
Banco de dados vetorial
Armazenamento feito para guardar embeddings e encontrar as correspondências mais próximas rapidamente. É a metade de recuperação da maioria dos sistemas RAG. O Chroma é um exemplo de código aberto que combina busca vetorial, de texto completo e por metadados. Se um fornecedor diz que faz "RAG sobre os seus documentos", um desses está na stack. Pergunte onde ele roda e o que ele armazena.
Framework
Estrutura de código para conectar modelos, ferramentas e recuperação em uma aplicação: o caminho do faça-você-mesmo, escolhido cedo por equipes que fazem trabalho interno. Explore a categoria framework de IA para ver as opções atuais. Se ninguém na equipe escreve código, construtores visuais como o Microsoft Copilot Studio cobrem os casos comuns, e o diretório mantém uma página completa de tarefas de ferramentas para construir agentes de IA abrangendo as duas abordagens.
Observabilidade e avaliações
Observabilidade é rastrear o que um modelo ou agente de fato fez: cada etapa, chamada de ferramenta, custo de token e atraso. Avaliações são testes com notas da qualidade da saída, rodados repetidamente para que regressões apareçam antes que os clientes as vejam. O Langfuse é uma plataforma de código aberto que cobre rastreamento, gerenciamento de prompts e avaliação. Se você está comprando um agente em vez de construir um, a pergunta equivalente para o fornecedor é simples: quando o agente erra alguma coisa, o que exatamente você vai me mostrar?
Perguntas frequentes
O ChatGPT é um LLM?
Rigorosamente, não: o ChatGPT é uma aplicação construída sobre LLMs da família GPT da OpenAI. A distinção importa porque recursos como memória, upload de arquivos e navegação na web pertencem ao app, não ao modelo, e um produto diferente usando o mesmo modelo pode não ter nenhum deles.
Qual é a diferença entre um agente de IA e um chatbot?
Um chatbot responde; um agente age. Agentes planejam trabalho de várias etapas, chamam outros softwares e mudam coisas em sistemas reais, o que os torna mais úteis e mais arriscados ao mesmo tempo. A pergunta prática de compra são as permissões: o que um agente tem permissão para tocar e o que é revisado antes que ele o faça.
Mais parâmetros significam um modelo de IA melhor?
Não necessariamente para a sua tarefa. Modelos maiores são geralmente mais capazes no abstrato, mas custam mais e respondem mais devagar, e muito trabalho do dia a dia — classificação, extração, rascunho de rotina — roda bem em modelos pequenos. Teste o modelo mais barato que talvez funcione antes de recorrer por padrão ao maior.
Posso rodar um modelo de IA no meu próprio computador?
Sim, se ele tiver pesos abertos e um tamanho modesto: modelos abertos pequenos, como a família Gemma, são feitos para isso, e alguns modelos de 30 bilhões de parâmetros agora miram o hardware de consumidor. Espere resultados mais fracos do que os modelos de fronteira na nuvem, em troca de custo zero por token e dados que nunca saem da sua máquina.