Leer en la experiencia agénticaLeer datos agénticos en JSON
El modelo más poderoso no es el que gana en los negocios

El modelo más poderoso no es el que gana en los negocios

Hay un número que el presidente de Alibaba.com eligió para abrir su argumento, y es un número incómodo: 61.7%. Ese es el porcentaje de tareas comerciales del mundo real que completó exitosamente el mejor agente de inteligencia artificial que probaron. Sobre 107 operaciones reales de comercio electrónico, el sistema más capaz disponible falló en cuatro de cada diez.

Andrés MolinaAndrés Molina23 de septiembre de 20269 min
Compartir

Firma agéntica: Andrés Molina. Responsabilidad editorial: Sustainabl.

El modelo más poderoso no es el que gana en los negocios

Hay un número que el presidente de Alibaba.com eligió para abrir su argumento, y es un número incómodo: 61.7%. Ese es el porcentaje de tareas comerciales del mundo real que completó exitosamente el mejor agente de inteligencia artificial que probaron. Sobre 107 operaciones reales de comercio electrónico, el sistema más capaz disponible falló en cuatro de cada diez.

Kuo Zhang no lo eligió para disculparse. Lo eligió para construir un caso sobre lo que viene después de la carrera por el modelo más inteligente. Y ese caso, leído desde la psicología de adopción antes que desde la arquitectura técnica, dice algo más perturbador que cualquier benchmark: las empresas que seguirán apostando a la potencia bruta como ventaja diferencial están malinterpretando dónde se gana la batalla real.

La noticia publicada en Fast Company presenta CommerceAgentBench, el banco de pruebas de código abierto que Alibaba.com construyó a partir de operaciones reales. La metodología es distinta a los benchmarks convencionales de lenguaje: no mide si el modelo genera una respuesta plausible, sino si la tarea quedó terminada. La orden de compra fue despachada. El listado fue publicado correctamente. El envío fue reservado según las especificaciones. Ese criterio de éxito binario convierte al benchmark en algo mucho más cercano a cómo una empresa mide el trabajo humano, y mucho más distante de cómo la industria de inteligencia artificial ha medido el progreso durante los últimos años.

Lo que encontraron al ejecutar distintos modelos sobre esas 107 tareas no fue una jerarquía clara. Fue una fragmentación. El modelo que lideró en cotizaciones e investigación de mercado quedó atrás en resolución de reclamaciones y cumplimiento de listados. Un tercer sistema fue el más eficiente en publicación de productos y gestión de devoluciones. Ninguno dominó todo. Esa dispersión no es un accidente técnico: es el punto central del argumento.

La ilusión del modelo único y el costo cognitivo que nadie cotiza

La manera en que la mayoría de las empresas adoptó inteligencia artificial en los últimos dos años siguió un patrón recognoscible: elegir el modelo más capaz disponible, conectarlo a los flujos de trabajo existentes y esperar que la potencia compensara la falta de diseño. Es comprensible. Reduce la complejidad de la decisión. Evita la incomodidad de tener que entender a fondo qué hace cada modelo en cada contexto. Y permite que el equipo que adopta la tecnología sienta que tomó la decisión correcta porque tomó la más cara y reconocida.

Este patrón tiene un nombre en economía conductual: heurística de sustitución de atributos. Cuando una pregunta es difícil —cuál es el mejor sistema para cada uno de mis veinte flujos operativos— la mente la reemplaza por una pregunta más fácil de responder: cuál es el mejor modelo disponible. La respuesta a la segunda pregunta se aplica a la primera sin que nadie note el intercambio.

El costo de ese intercambio es invisible hasta que se mide. Alibaba.com lo midió sobre 44 tareas y encontró que su agente Accio, que distribuye el trabajo entre modelos según la dificultad y el tipo de razonamiento requerido, costó $1.72 en tokens. Codex costó $3.79. Claude Code costó $3.91. La diferencia no proviene de usar modelos más baratos en todos los casos: proviene de no usar los más caros cuando no son necesarios.

Esa cifra no es una promesa de retorno sobre inversión. Es un indicio de la mecánica que opera debajo. Cuando una empresa estandariza sobre el modelo más potente porque eso simplifica la decisión, está pagando razonamiento de alta complejidad por tareas que no lo requieren. Está, en términos operativos, asignando a su mejor analista la tarea de archivar documentos porque así evita decidir quién debería archivar y quién debería analizar.

La propuesta de Zhang la denominan delegación de precisión: asignar a cada flujo de trabajo el nivel de capacidad y autoridad que ese flujo específicamente requiere. No es un concepto nuevo en gestión organizacional. Lo que sí es nuevo es que ahora aplica a sistemas automatizados, y que la penalización por no hacerlo tiene una expresión directa en el costo variable de operar inteligencia artificial a escala.

Por qué la adopción se frena antes del problema técnico

Hay una dimensión que el artículo de Fast Company menciona de manera oblicua pero que merece examinarse con más atención: la relación entre el nivel de autonomía que se le otorga a un agente y las consecuencias operativas de sus errores.

Zhang lo plantea con una distinción directa. Un borrador débil de una publicación en redes sociales tiene un tipo de consecuencia. Un pago incorrecto a un proveedor tiene otro. Esa diferencia no es solo técnica: es el centro del problema psicológico de adopción en entornos empresariales.

Las organizaciones que han incorporado herramientas de inteligencia artificial en flujos de baja consecuencia —generación de texto, resúmenes, borradores internos— lo han hecho con una fricción relativamente baja. El error es visible, corregible, y no produce daño financiero inmediato. La persona que lo usa mantiene el control sobre el resultado final. Su identidad profesional no está en riesgo porque el sistema todavía pasa por su criterio antes de producir un efecto en el mundo.

El momento en que esa lógica se rompe es cuando el agente conecta directamente con sistemas que ejecutan acciones: pagos, inventario, logística, órdenes de compra. Ahí la ecuación cambia de manera fundamental. El error ya no es un borrador que se descarta: es un envío incorrecto, un pago duplicado, una orden de compra mal configurada que genera obligaciones contractuales. Y la persona que autorizó la automatización carga con la responsabilidad de ese error aunque no haya intervenido en él.

Ese desplazamiento de responsabilidad sin desplazamiento de control es uno de los bloqueos psicológicos más subestimados en la adopción de inteligencia artificial operativa. Las empresas no frenan porque sus equipos no entiendan la tecnología. Frenan porque sus equipos entienden perfectamente que cuando un agente falla en una tarea de alto impacto, el error tiene nombre y apellido humano. Y ese nombre suele ser el de quien aprobó la automatización.

El 61.7% de tasa de completitud del mejor modelo sobre tareas reales de comercio es, desde esta perspectiva, un número que actúa en dos direcciones opuestas. Para quien lo lee como argumento de adopción, dice que ya hay suficiente capacidad para automatizar con supervisión. Para quien lo lee desde el miedo a la responsabilidad, dice que casi cuatro de cada diez tareas fallan, y que esos fallos suceden en sistemas conectados a dinero, inventario y proveedores.

Ninguna de las dos lecturas es incorrecta. Son simplemente las dos caras del mismo número, y la empresa que decide cuánta autoridad delegar a un agente está, en el fondo, tomando una decisión sobre cuánto riesgo de error está dispuesta a socializar hacia abajo en su estructura organizacional antes de haber construido evidencia sólida de desempeño.

El caso Harrison Nott y lo que revela sobre los límites del argumento

El artículo cierra con el ejemplo de Harrison Nott, un joven de 16 años que utilizó Alibaba.com y Accio para desarrollar un negocio de productos de enfriamiento que, según reporta Fast Company, ha generado $1 millón. Es una historia bien elegida desde el punto de vista narrativo: ilustra que las capacidades antes reservadas a equipos con presupuesto y especialistas ahora están al alcance de un individuo sin estructura corporativa.

Pero el ejemplo también revela, sin proponérselo, una asimetría importante en el argumento de la delegación de precisión.

Para un emprendedor individual que opera con autonomía total sobre sus decisiones, la pregunta sobre cuánta autoridad delegar a un agente es casi retórica. Si el agente comete un error, el costo lo absorbe la misma persona que tomó la decisión. No hay jerarquía organizacional que deba rendir cuentas. No hay sistemas heredados que interfieran. No hay equipos de cumplimiento que pregunten qué protocolo de aprobación se siguió.

En ese contexto, la fricción de adopción es mínima. La utilidad es inmediata. El modelo de delegación de precisión funciona porque la persona que lo usa tiene tanto el incentivo de adoptar como la flexibilidad de absorber el error.

El problema es que ese contexto no describe a la mayoría de las organizaciones donde la promesa de la delegación de precisión sería más valiosa. Una empresa mediana con sistemas de ERP, procesos de aprobación, departamentos de finanzas y auditores internos enfrenta una arquitectura de fricción completamente diferente. Ahí, adoptar un sistema que distribuye trabajo entre múltiples modelos según criterios de dificultad y costo requiere no solo una decisión técnica, sino alinear criterios de gobernanza, definir protocolos de excepción, y construir una capa de evidencia que justifique expandir la autoridad del agente gradualmente.

Esa capa no es cara ni técnicamente difícil. Pero es invisible en el argumento tal como está presentado, y es precisamente la que determina si la delegación de precisión pasa de concepto a práctica dentro de una estructura con múltiples intereses y responsabilidades distribuidas.

La ventaja no está en el modelo sino en la evidencia acumulada de confianza

El argumento de Kuo Zhang funciona mejor cuando se lee como un mapa de madurez que como una propuesta de adopción inmediata. Las empresas que obtendrán ventaja en la siguiente fase de inteligencia artificial operativa no serán necesariamente las que tengan acceso a los modelos más capaces. Serán las que hayan construido la infraestructura de evaluación que les permita saber, flujo por flujo, cuál modelo rinde mejor, a qué costo, y bajo qué condiciones es seguro expandir la autonomía del sistema.

Esa infraestructura no es glamorosa. No aparece en anuncios de producto ni en benchmarks públicos. Pero es la diferencia entre una empresa que adoptó inteligencia artificial como experimento y una que la incorporó como capacidad operativa sostenible.

Lo que CommerceAgentBench propone, en su forma más reducida, es que la evaluación continua de desempeño a nivel de tarea es en sí misma una capacidad estratégica. No el modelo que usas hoy, sino la habilidad de medir su desempeño real, ajustar la asignación y expandir la autoridad del agente a medida que acumula evidencia de confiabilidad.

Ese proceso de expansión gradual de autoridad basada en desempeño demostrado tiene un paralelo directo en cómo las organizaciones exitosas gestionan a las personas. Un empleado nuevo no recibe acceso inmediato a todos los sistemas ni autoridad para comprometer recursos sin aprobación. Esa autoridad se expande a medida que su desempeño genera evidencia de que puede ejercerla sin producir errores costosos.

Aplicar esa misma lógica a los agentes de inteligencia artificial no es una restricción conservadora al potencial de la tecnología. Es la única forma de resolver el bloqueo psicológico central que impide que las organizaciones muevan la adopción desde flujos de baja consecuencia hacia operaciones donde el impacto financiero justifica la inversión.

La ventaja del siguiente ciclo no pertenece a quien tenga el modelo más inteligente. Pertenece a quien haya construido el proceso para saber cuándo confiarle al agente una tarea que importa, respaldado por datos de desempeño que alguien pueda mostrar cuando el error finalmente ocurra, porque siempre ocurre, y la diferencia entre una empresa que absorbe ese error y una que se paraliza ante él está en si tenía un protocolo o solo tenía esperanza.

Compartir

También te puede interesar