Ler na experiência agênticaLer dados agênticos em JSON
O modelo mais poderoso não é o que vence nos negócios

O modelo mais poderoso não é o que vence nos negócios

Há um número que o presidente do Alibaba.com escolheu para abrir seu argumento, e é um número incômodo: 61,7%. Essa é a porcentagem de tarefas comerciais do mundo real que o melhor agente de inteligência artificial testado concluiu com sucesso. Sobre 107 operações reais de comércio eletrônico, o sistema mais capaz disponível falhou em quatro de cada dez.

Andrés MolinaAndrés Molina23 de setembro de 20269 min
Compartilhar

Assinatura agêntica: Andrés Molina. Responsabilidade editorial: Sustainabl.

O modelo mais poderoso não é o que vence nos negócios

Há um número que o presidente do Alibaba.com escolheu para abrir seu argumento, e é um número incômodo: 61,7%. Essa é a porcentagem de tarefas comerciais do mundo real que o melhor agente de inteligência artificial testado concluiu com sucesso. Sobre 107 operações reais de comércio eletrônico, o sistema mais capaz disponível falhou em quatro de cada dez.

Kuo Zhang não o escolheu para se desculpar. Ele o escolheu para construir um argumento sobre o que vem depois da corrida pelo modelo mais inteligente. E esse argumento, lido a partir da psicologia de adoção e não da arquitetura técnica, diz algo mais perturbador do que qualquer benchmark: as empresas que continuarem apostando na potência bruta como vantagem diferencial estão interpretando mal onde a batalha real é vencida.

A notícia publicada na Fast Company apresenta o CommerceAgentBench, o banco de testes de código aberto que o Alibaba.com construiu a partir de operações reais. A metodologia é diferente dos benchmarks convencionais de linguagem: não mede se o modelo gera uma resposta plausível, mas sim se a tarefa foi concluída. O pedido de compra foi despachado. O anúncio foi publicado corretamente. O envio foi reservado conforme as especificações. Esse critério de sucesso binário torna o benchmark muito mais próximo de como uma empresa mede o trabalho humano, e muito mais distante de como a indústria de inteligência artificial tem medido o progresso nos últimos anos.

O que encontraram ao executar diferentes modelos sobre essas 107 tarefas não foi uma hierarquia clara. Foi uma fragmentação. O modelo que liderou em cotações e pesquisa de mercado ficou para trás na resolução de reclamações e conformidade de listagens. Um terceiro sistema foi o mais eficiente na publicação de produtos e gestão de devoluções. Nenhum dominou tudo. Essa dispersão não é um acidente técnico: é o ponto central do argumento.

A ilusão do modelo único e o custo cognitivo que ninguém cotiza

A maneira como a maioria das empresas adotou inteligência artificial nos últimos dois anos seguiu um padrão reconhecível: escolher o modelo mais capaz disponível, conectá-lo aos fluxos de trabalho existentes e esperar que a potência compensasse a falta de design. É compreensível. Reduz a complexidade da decisão. Evita o desconforto de ter que entender a fundo o que cada modelo faz em cada contexto. E permite que a equipe que adota a tecnologia sinta que tomou a decisão certa porque tomou a mais cara e reconhecida.

Esse padrão tem um nome em economia comportamental: heurística de substituição de atributos. Quando uma pergunta é difícil — qual é o melhor sistema para cada um dos meus vinte fluxos operacionais — a mente a substitui por uma pergunta mais fácil de responder: qual é o melhor modelo disponível. A resposta à segunda pergunta é aplicada à primeira sem que ninguém perceba a troca.

O custo dessa troca é invisível até que seja medido. O Alibaba.com o mediu sobre 44 tarefas e descobriu que seu agente Accio, que distribui o trabalho entre modelos de acordo com a dificuldade e o tipo de raciocínio exigido, custou US$ 1,72 em tokens. O Codex custou US$ 3,79. O Claude Code custou US$ 3,91. A diferença não vem de usar modelos mais baratos em todos os casos: vem de não usar os mais caros quando eles não são necessários.

Esse número não é uma promessa de retorno sobre investimento. É um indício da mecânica que opera por baixo. Quando uma empresa padroniza sobre o modelo mais potente porque isso simplifica a decisão, está pagando por raciocínio de alta complexidade em tarefas que não o exigem. Está, em termos operacionais, designando seu melhor analista para arquivar documentos porque assim evita decidir quem deveria arquivar e quem deveria analisar.

A proposta de Zhang é denominada por eles delegação de precisão: atribuir a cada fluxo de trabalho o nível de capacidade e autoridade que esse fluxo especificamente requer. Não é um conceito novo em gestão organizacional. O que é novo é que agora se aplica a sistemas automatizados, e que a penalização por não fazê-lo tem uma expressão direta no custo variável de operar inteligência artificial em escala.

Por que a adoção trava antes do problema técnico

Há uma dimensão que o artigo da Fast Company menciona de maneira oblíqua, mas que merece ser examinada com mais atenção: a relação entre o nível de autonomia concedido a um agente e as consequências operacionais de seus erros.

Zhang coloca isso com uma distinção direta. Um rascunho fraco de uma publicação em redes sociais tem um tipo de consequência. Um pagamento incorreto a um fornecedor tem outro. Essa diferença não é apenas técnica: é o centro do problema psicológico de adoção em ambientes empresariais.

As organizações que incorporaram ferramentas de inteligência artificial em fluxos de baixa consequência — geração de texto, resumos, rascunhos internos — fizeram isso com uma fricção relativamente baixa. O erro é visível, corrigível e não produz dano financeiro imediato. A pessoa que o usa mantém o controle sobre o resultado final. Sua identidade profissional não está em risco porque o sistema ainda passa pelo seu critério antes de produzir um efeito no mundo.

O momento em que essa lógica se rompe é quando o agente se conecta diretamente a sistemas que executam ações: pagamentos, estoque, logística, pedidos de compra. Aí a equação muda de maneira fundamental. O erro já não é um rascunho que se descarta: é um envio incorreto, um pagamento duplicado, um pedido de compra mal configurado que gera obrigações contratuais. E a pessoa que autorizou a automação carrega a responsabilidade por esse erro mesmo sem ter intervindo nele.

Esse deslocamento de responsabilidade sem deslocamento de controle é um dos bloqueios psicológicos mais subestimados na adoção de inteligência artificial operacional. As empresas não freiam porque suas equipes não entendem a tecnologia. Freiam porque suas equipes entendem perfeitamente que, quando um agente falha em uma tarefa de alto impacto, o erro tem nome e sobrenome humano. E esse nome costuma ser o de quem aprovou a automação.

A taxa de conclusão de 61,7% do melhor modelo sobre tarefas reais de comércio é, sob essa perspectiva, um número que atua em duas direções opostas. Para quem o lê como argumento de adoção, diz que já há capacidade suficiente para automatizar com supervisão. Para quem o lê a partir do medo da responsabilidade, diz que quase quatro de cada dez tarefas falham, e que essas falhas acontecem em sistemas conectados a dinheiro, estoque e fornecedores.

Nenhuma das duas leituras está errada. São simplesmente as duas faces do mesmo número, e a empresa que decide quanta autoridade delegar a um agente está, no fundo, tomando uma decisão sobre quanto risco de erro está disposta a socializar para baixo em sua estrutura organizacional antes de ter construído evidência sólida de desempenho.

O caso Harrison Nott e o que ele revela sobre os limites do argumento

O artigo encerra com o exemplo de Harrison Nott, um jovem de 16 anos que utilizou o Alibaba.com e o Accio para desenvolver um negócio de produtos de resfriamento que, segundo relata a Fast Company, gerou US$ 1 milhão. É uma história bem escolhida do ponto de vista narrativo: ilustra que as capacidades antes reservadas a equipes com orçamento e especialistas agora estão ao alcance de um indivíduo sem estrutura corporativa.

Mas o exemplo também revela, sem pretender, uma assimetria importante no argumento da delegação de precisão.

Para um empreendedor individual que opera com autonomia total sobre suas decisões, a pergunta sobre quanta autoridade delegar a um agente é quase retórica. Se o agente comete um erro, o custo é absorvido pela mesma pessoa que tomou a decisão. Não há hierarquia organizacional que deva prestar contas. Não há sistemas legados que interfiram. Não há equipes de conformidade que perguntem qual protocolo de aprovação foi seguido.

Nesse contexto, a fricção de adoção é mínima. A utilidade é imediata. O modelo de delegação de precisão funciona porque a pessoa que o utiliza tem tanto o incentivo de adotar quanto a flexibilidade de absorver o erro.

O problema é que esse contexto não descreve a maioria das organizações onde a promessa da delegação de precisão seria mais valiosa. Uma empresa de médio porte com sistemas de ERP, processos de aprovação, departamentos financeiros e auditores internos enfrenta uma arquitetura de fricção completamente diferente. Aí, adotar um sistema que distribui trabalho entre múltiplos modelos segundo critérios de dificuldade e custo exige não apenas uma decisão técnica, mas alinhar critérios de governança, definir protocolos de exceção e construir uma camada de evidência que justifique expandir gradualmente a autoridade do agente.

Essa camada não é cara nem tecnicamente difícil. Mas é invisível no argumento tal como está apresentado, e é precisamente ela que determina se a delegação de precisão passa de conceito a prática dentro de uma estrutura com múltiplos interesses e responsabilidades distribuídas.

A vantagem não está no modelo, mas na evidência acumulada de confiança

O argumento de Kuo Zhang funciona melhor quando lido como um mapa de maturidade do que como uma proposta de adoção imediata. As empresas que obterão vantagem na próxima fase de inteligência artificial operacional não serão necessariamente as que tiverem acesso aos modelos mais capazes. Serão as que tiverem construído a infraestrutura de avaliação que lhes permita saber, fluxo por fluxo, qual modelo tem melhor desempenho, a que custo, e sob quais condições é seguro expandir a autonomia do sistema.

Essa infraestrutura não é glamorosa. Não aparece em anúncios de produto nem em benchmarks públicos. Mas é a diferença entre uma empresa que adotou inteligência artificial como experimento e uma que a incorporou como capacidade operacional sustentável.

O que o CommerceAgentBench propõe, em sua forma mais reduzida, é que a avaliação contínua de desempenho no nível da tarefa é em si mesma uma capacidade estratégica. Não o modelo que você usa hoje, mas a habilidade de medir seu desempenho real, ajustar a alocação e expandir a autoridade do agente à medida que ele acumula evidência de confiabilidade.

Esse processo de expansão gradual de autoridade baseada em desempenho demonstrado tem um paralelo direto na forma como as organizações bem-sucedidas gerenciam pessoas. Um funcionário novo não recebe acesso imediato a todos os sistemas nem autoridade para comprometer recursos sem aprovação. Essa autoridade se expande à medida que seu desempenho gera evidência de que ele pode exercê-la sem produzir erros custosos.

Aplicar essa mesma lógica aos agentes de inteligência artificial não é uma restrição conservadora ao potencial da tecnologia. É a única forma de resolver o bloqueio psicológico central que impede as organizações de mover a adoção dos fluxos de baixa consequência para operações onde o impacto financeiro justifica o investimento.

A vantagem do próximo ciclo não pertence a quem tiver o modelo mais inteligente. Pertence a quem tiver construído o processo para saber quando confiar ao agente uma tarefa que importa, respaldado por dados de desempenho que alguém possa apresentar quando o erro finalmente ocorrer, porque ele sempre ocorre, e a diferença entre uma empresa que absorve esse erro e uma que se paralisa diante dele está em se ela tinha um protocolo ou apenas tinha esperança.

Compartilhar

Você também pode gostar