Como reduzir custos com LLMs em uma EdTech
Estratégias práticas de cache, roteamento de modelos e engenharia de prompt para reduzir o custo de LLMs em produtos educacionais com alto volume de uso.
Conteúdo de demonstração. Este artigo simula um estudo de caso para testar o layout de artigos longos do Devnático (com atualização de data) e será substituído por conteúdo definitivo.
Produtos educacionais que usam LLMs para corrigir exercícios, gerar explicações ou dar feedback personalizado costumam ter um padrão de uso previsível: muitas perguntas parecidas, picos em horários de aula e uma tolerância baixa a custo por usuário ativo. Isso cria boas oportunidades de otimização.
1. Cache agressivo de respostas semanticamente parecidas
Perguntas de alunos sobre o mesmo exercício tendem a se repetir com variações pequenas. Um cache exato (por hash da entrada) já ajuda, mas um cache semântico — comparando embeddings da pergunta — captura muito mais reuso.
similar = vector_store.search(embedding(question), top_k=1)
if similar and similar.score > 0.92:
return similar.cached_answer
2. Roteamento entre modelos por complexidade
Nem toda pergunta precisa do modelo mais caro disponível. Classificar a complexidade da pergunta antes de escolher o modelo reduz custo sem piorar a experiência nos casos simples.
- Perguntas objetivas/curtas → modelo menor e mais barato
- Explicações longas ou correção de redação → modelo mais capaz
3. Prompts mais curtos, com contexto sob demanda
Enviar o histórico completo da conversa em todo request infla o custo rapidamente. Buscar apenas o contexto relevante (retrieval) antes de montar o prompt final costuma reduzir tokens sem perda perceptível de qualidade.
Resultado esperado
Combinar essas três frentes normalmente reduz custo de forma composta — cache elimina chamadas repetidas, roteamento evita gasto desnecessário nas chamadas restantes, e prompts menores reduzem o custo unitário de cada uma.