IA medida a cada versão: qualidade, latência e custo
Medimos a qualidade das respostas, a latência e o custo do seu recurso de IA com casos de teste a cada versão e acompanhamos tudo isso em produção.

Para quem é
Para empresas que já têm IA em produção e mudam instruções ou modelos sem saber se o resultado piorou.
O que resolve
- Uma instrução ajustada para um caso quebrou outros, e só o cliente percebeu.
- Saiu uma versão nova do modelo, e ninguém sabe se trocar melhora ou piora.
- A conta de IA subiu, e ninguém sabe dizer que recurso ou cliente consumiu.
- A qualidade é avaliada por impressão, olhando algumas conversas de vez em quando.
- Respostas lentas fazem o usuário desistir, mas ninguém mede o tempo de resposta.
O que fazemos
- Conjunto de casos de teste
- Perguntas e tarefas reais com a resposta esperada, incluindo casos difíceis e pedidos que devem ser recusados.
- Critérios de qualidade
- O que conta como resposta boa, definido com a sua equipe: correção, fonte, formato e tom.
- Avaliação a cada versão
- Mudança de modelo, instrução ou dados só é publicada depois de rodar os testes e comparar com a versão atual.
- Revisão humana por amostra
- Parte das respostas é avaliada por pessoas, porque a avaliação automática também erra.
- Painel de produção
- Qualidade, latência, erros e custo por recurso e por cliente, com alertas.
- Orçamento e limites
- Teto de gasto por recurso, com alerta antes do limite e corte quando ele é atingido.
- Volta à versão anterior
- Se a versão nova piora em produção, a anterior volta por configuração, sem nova publicação.
O que você recebe
- Conjunto de casos de teste versionado no seu repositório
- Avaliação automática ligada ao processo de publicação
- Relatório comparativo de cada versão: qualidade, latência e custo
- Painel de produção com alertas de custo, erro e lentidão
- Roteiro de volta à versão anterior
Como fazemos
Inventário
Que recursos de IA existem, que modelos usam e quanto custam hoje.
Casos e critérios
Montamos com a sua equipe os casos de teste e o que conta como resposta boa.
Linha de base
Medimos a versão atual para ter com o que comparar.
Automação
Os testes passam a rodar em cada mudança, antes da publicação.
Operação
Painel, alertas e revisão periódica dos casos de teste com a sua equipe.
Exemplos de tecnologia
- OpenTelemetry
- Prometheus
- Grafana
- Python
- PostgreSQL
Serviços relacionados
Perguntas frequentes
Dá para medir qualidade de texto de forma objetiva?
Em parte. Formato, presença da fonte e respostas proibidas se medem por regra; correção e tom pedem comparação com respostas esperadas e revisão humana por amostra. Usamos as duas formas juntas.
Funciona com IA que outra equipe construiu?
Funciona. Precisamos de acesso às chamadas ao modelo, às instruções e a exemplos de uso real. Não é preciso reescrever o recurso para começar a medir.
Vale trocar de modelo para economizar?
Às vezes vale. Com os casos de teste, dá para comparar um modelo mais barato com o atual e ver o que se perde em qualidade antes de decidir.
As conversas dos usuários ficam guardadas?
Só o necessário para medir, com acesso restrito e prazo de guarda definido pela sua empresa. Dados pessoais podem ser mascarados antes de entrar nos registros.
Escreva para a Balkan
Falar sobre o seu projeto