A demonstração impressiona, o piloto responde rápido e a proposta promete ganhos em poucas semanas. Mesmo assim, a diretoria ainda não sabe se o fornecedor conseguirá operar com seus dados, regras, integrações, riscos e volume real. Comprar nessa lacuna transforma entusiasmo em dependência antes de a empresa saber o que está aceitando.
Demonstração, piloto, produção e operação não são a mesma evidência
- Demonstração: prova que uma capacidade existe em um cenário selecionado pelo fornecedor.
- Piloto: testa um recorte do caso de uso com dados, usuários e critérios definidos pela empresa.
- Produção: integra a solução aos controles, identidades, sistemas e responsabilidades reais.
- Operação: demonstra estabilidade, suporte, monitoramento, tratamento de incidentes e economia ao longo do tempo.
O NIST AI RMF orienta organizações a mapear contexto, benefício, risco, pessoas afetadas e condições de uso antes de medir e administrar o sistema. As diretrizes britânicas de compras de IA acrescentam integração, suporte, transferência de conhecimento e prevenção de dependência indevida. Juntas, essas referências deslocam a conversa de ‘qual modelo vocês usam?’ para ‘qual decisão a solução melhora e sob quais condições?’.
Um scorecard executivo em oito dimensões
- Aderência ao caso de uso: problema, usuário, decisão, volume, exceções e resultado esperado estão descritos.
- Qualidade e avaliação: existe conjunto de teste representativo, métrica, baseline, limiar de aceite e análise de falhas.
- Dados e privacidade: origem, finalidade, retenção, treinamento, residência, exclusão e suboperadores estão documentados.
- Segurança e controle humano: acessos, registros, revisão, limites de ação, resposta a abuso e rollback são verificáveis.
- Integração e arquitetura: APIs, identidades, latência, disponibilidade, limites, versionamento e observabilidade cabem no ambiente real.
- Operação e suporte: há dono, SLA aplicável, escalonamento, comunicação de incidentes, mudança de modelo e continuidade.
- Economia e custo total: preço variável, implantação, integrações, avaliação, supervisão, retrabalho e contingência entram na conta.
- Portabilidade e saída: dados, prompts, avaliações, logs, configurações e conhecimento podem ser recuperados sem paralisar a operação.
Perguntas que a proposta comercial precisa responder
- Qual parte do resultado foi medida em clientes comparáveis e qual foi apenas demonstrada em ambiente controlado?
- Quais entradas, idiomas, grupos, exceções e tipos de erro fizeram parte da avaliação?
- O que acontece com prompts, arquivos, saídas, feedback e logs? Por quanto tempo e para quais finalidades?
- Quais modelos, nuvens, bibliotecas e terceiros sustentam o serviço, e como mudanças são comunicadas?
- Quais ações a IA pode executar sem aprovação e como a empresa reconstrói uma decisão depois do incidente?
- Quem integra, monitora, corrige e atende quando a qualidade ou a disponibilidade cai?
- Como preço, limite e desempenho mudam com volume, região, modelo, contexto e ferramentas adicionais?
- Como exportar dados, configurações e avaliações se o contrato terminar ou o produto mudar?
Segurança não é um selo anexado ao produto
Certificações e relatórios ajudam a avaliar controles organizacionais, mas não provam que o seu caso de uso é seguro. O OWASP destaca riscos como injeção de prompt, exposição de informação sensível, dependências comprometidas e envenenamento de dados. A avaliação precisa alcançar o fluxo completo: quem envia conteúdo, quais ferramentas o sistema aciona, quais dados retorna e onde uma pessoa consegue interromper a ação.
Preço de API é apenas uma linha do custo total
O custo total inclui descoberta, adequação de dados, integração, segurança, testes, licenças, consumo, observabilidade, revisão humana, suporte, retrabalho e plano de continuidade. Dependência também não é apenas contratual: pode estar em prompts proprietários, formatos, agentes, avaliações, conhecimento operacional ou integrações difíceis de reproduzir.
Sinais de que a venda está adiante da evidência
- ROI universal sem baseline, amostra, período, custo total ou contexto comparável.
- Precisão apresentada como número único, sem conjunto de teste nem distribuição dos erros.
- Afirmação de que supervisão humana é desnecessária antes de mapear impacto e exceções.
- Segurança resumida a ‘nível enterprise’, sem explicar dados, identidade, logs e resposta a incidentes.
- Piloto gratuito condicionado a arquitetura difícil de retirar ou dados que não podem ser exportados.
- Pressão para contratar a plataforma antes de definir processo, dono, métrica e condição de interrupção.
A decisão final deve produzir um contrato de evidência
Ao final da avaliação, a empresa deveria conseguir registrar o caso de uso aprovado, os requisitos eliminatórios, o que foi testado, o que permanece hipótese, quem responde pela operação, quais métricas serão acompanhadas e o que fará o piloto parar. Se essa página não puder ser escrita, ainda existe uma compra em busca de problema — não uma decisão de IA pronta para escalar.