O retorno da IA empresarial é um problema de arquitetura, não de inteligência
Há um número que os CIOs estão memorizando com desconforto: 72% das organizações admitem que seus investimentos em IA estão, na melhor das hipóteses, no ponto de equilíbrio. Na pior, dando prejuízo. O Gartner publicou esse número e não gerou pânico, mas sim algo mais persistente: uma silenciosa incerteza sobre quanto tempo mais se pode sustentar uma aposta sem demonstrar que ela funciona.
A resposta habitual aponta para os modelos. É preciso escolher melhor o fornecedor, ajustar os prompts, esperar que os preços de inferência caiam. Essa resposta é confortável e quase sempre equivocada. O que está falhando não é a inteligência da máquina. O que está falhando é a arquitetura do negócio que a cerca.
O problema tem uma mecânica muito concreta: cada vez que uma empresa lança um novo agente de IA, esse agente começa do zero. Reconecta dados, reconstrói o contexto do negócio, renegocia permissões, redesenha controles, estabelece seus próprios critérios de validação. Se há seis agentes em produção, há seis versões paralelas e independentes dessa infraestrutura. Cada uma com seu próprio custo, sua própria dívida técnica, sua própria opacidade. O resultado não é inteligência artificial em escala. É burocracia digital em escala.
Por que o custo real da IA não aparece na linha de inferência
A armadilha contábil é sofisticada. Quando uma equipe avalia se um projeto de IA faz sentido econômico, normalmente olha para o custo do modelo: quanto custa chamar a API, quantos tokens cada consulta consome, qual fornecedor oferece melhor preço por capacidade. Essa análise não está errada, mas captura apenas uma fração do custo total.
O que não aparece nessa linha é o custo da integração repetida. Cada agente que é implantado sem uma camada compartilhada de contexto empresarial precisa que alguém construa, do zero, suas conexões com os sistemas de registro da empresa, seus mecanismos de autorização, suas regras de negócio, sua lógica de escalonamento. Isso não é custo de modelo. É custo de engenharia, de governança, de operações. E se repete integralmente a cada novo caso de uso.
Uma equipe de serviços financeiros estudada por pesquisadores da Universidade de Hong Kong e da Stellaris AI descobriu que mais de 70% de suas consultas eram rotineiras o suficiente para serem resolvidas com modelos menores e mais baratos. No entanto, tudo rodava sobre a mesma infraestrutura de alto custo porque ninguém havia projetado um mecanismo para discriminar por complexidade. O gasto de inferência superava 200.000 dólares mensais não porque o negócio fosse sofisticado, mas porque a arquitetura não tinha memória de quando sê-lo.
O problema de distribuição de custos tem outro ângulo menos visível: quando os custos estão dispersos entre integrações, equipes e ferramentas, atribuir o valor gerado torna-se matematicamente impossível. Não é que o ROI seja baixo. É que não há como medi-lo porque não existe um registro unificado de quais dados cada agente usou, quais decisões tomou, quanto custou cada etapa e qual resultado produziu. A fragmentação não apenas encarece a implantação. Destrói a rastreabilidade que tornaria possível justificar o investimento.
O que uma camada compartilhada muda na economia da implantação
A solução que começa a ser articulada entre arquitetos de sistemas empresariais não é contratar menos IA nem melhores modelos. É construir uma camada de contexto compartilhada que funcione como a espinha dorsal de todos os agentes e fluxos de trabalho da organização.
A ideia tem uma lógica econômica precisa. Se o conhecimento empresarial, as permissões, as regras de negócio e a lógica de governança são construídos uma única vez e expostos como infraestrutura reutilizável, o custo marginal de implantar o segundo, o quinto e o décimo caso de uso cai de forma significativa. Não porque os modelos sejam mais baratos, mas porque a empresa não paga mais o custo de reconectar seu próprio negócio cada vez que adiciona uma nova aplicação.
Uma empresa multinacional do setor de cosméticos passou por isso. Seus primeiros agentes funcionavam bem em demonstrações, mas colapsavam em produção porque cada uma das seis soluções integradas mantinha seu próprio repositório de conhecimento e suas próprias regras de governança em silos independentes. Cada agente começava a frio. Cada novo projeto exigia reconectar tudo do zero. O custo não era o modelo. Era a repetição.
A centralização do contexto também muda a lógica do roteamento. Quando a infraestrutura sabe que tipo de tarefa está processando, pode direcioná-la ao modelo adequado: um mais potente e custoso para raciocínio complexo, um menor e mais rápido para consultas rotineiras. O gasto de inferência deixa de ser um custo fixo e se converte em uma variável que responde à complexidade do trabalho. Isso não é otimização marginal. É uma reconfiguração do modelo de custos.
De forma complementar, a arquitetura de enxames de agentes especializados produz resultados semelhantes pelo lado da eficiência computacional. Em vez de um superagente que precisa processar o contexto completo de um problema em cada etapa, múltiplos agentes com domínios delimitados operam em paralelo. Cada um trabalha com uma janela de contexto menor, mais precisa, mais barata. A coordenação entre agentes exige governança compartilhada para funcionar sem criar novos riscos operacionais, mas quando essa governança existe, a economia em tokens por tarefa pode ser considerável.
A governança não é o freio. É a condição de escala.
A McKinsey documentou algo que muitas equipes de tecnologia aprenderam da pior maneira: incorporar governança depois que a IA já está em produção gera custos de reengenharia que podem superar o valor que o sistema estava gerando. O Gartner estima que tecnologias de governança bem integradas podem reduzir os gastos regulatórios em até 20%. Esses não são números de conformidade. São números de arquitetura.
O problema com a governança como camada agregada no final é o mesmo que com o contexto como trabalho repetido: reconstrói-se integralmente para cada aplicação. Um fluxo de trabalho de sinistros em seguros precisa de acesso controlado a dados de segurados, rastreabilidade de decisões, limites na autonomia do agente e regras de escalonamento para revisão humana. Se isso é projetado apenas para esse fluxo, há que projetá-lo novamente para o seguinte. Dez agentes independentes significam dez versões da mesma arquitetura de controle, dez vezes o custo de aprovação, dez vezes o risco de inconsistência.
Quando a governança é construída como plataforma, os controles são definidos uma vez como código e aplicados transversalmente. O custo não escala linearmente com o número de agentes porque os controles existem antes que os agentes cheguem. Essa diferença é o que separa as organizações que conseguem escalar a IA daquelas que acumulam dívida técnica e operacional enquanto acreditam que estão escalando.
A rastreabilidade que uma plataforma de governança produz tem um benefício adicional que poucas conversas sobre ROI mencionam explicitamente: converte a IA de caixa-preta em sistema auditável. Cada fluxo de trabalho deixa um registro de quais dados usou, quais ações tomou, qual intervenção humana exigiu, quanto custou e qual resultado produziu. Isso não é apenas controle de risco. É a infraestrutura que torna possível medir o valor econômico com a granularidade que os conselhos de administração e os investidores vão exigir com cada vez mais urgência.
A arquitetura como decisão de distribuição do valor
Há uma dimensão que a análise técnica tende a deixar de fora, mas que tem consequências econômicas diretas: a arquitetura de IA não determina apenas com que eficiência a empresa opera. Determina quem captura o valor que a IA gera.
Uma organização que constrói uma camada de contexto compartilhada, um mecanismo de roteamento inteligente e uma plataforma de governança unificada está construindo ativos internos que reduzem sua dependência de fornecedores externos. Pode trocar o modelo de linguagem subjacente sem reconstruir a lógica de negócio. Pode adicionar novas aplicações sem voltar a pagar o custo completo de integração. Pode auditar o valor de cada fluxo de trabalho porque tem a infraestrutura para fazê-lo.
Uma organização que não constrói isso está, em vez disso, externalizando permanentemente as economias de escala da IA. Cada novo fornecedor, cada novo modelo, cada nova ferramenta captura uma parcela do valor porque a empresa não tem a arquitetura que lhe permitiria internalizar essa captura. O custo de mudança sobe. A capacidade de negociação cai. O valor gerado pela IA vaza para fora em vez de se acumular internamente.
Isso tem implicações sobre como avaliar o gasto em IA. A pergunta que os CIOs deveriam estar respondendo não é quanto custa o modelo, mas que parte desse gasto está construindo capacidade reutilizável e que parte está pagando, mais uma vez, por capacidade que já deveria existir. A resposta a essa pergunta é a diferença entre um investimento em arquitetura e um gasto que se repete sem acumular.
Os 72% de organizações que estão no ponto de equilíbrio ou no prejuízo não têm necessariamente modelos ruins. Têm uma arquitetura que garante que o custo de cada novo caso de uso seja quase tão alto quanto o do primeiro. Isso não é um problema de inteligência. É um problema de design. E os problemas de design têm soluções mais específicas, mais duradouras e mais mensuráveis do que esperar que os preços de inferência caiam o suficiente para que as contas se fechem sozinhas.










