Das leistungsstärkste Modell ist nicht das, das im Geschäftsleben gewinnt
Es gibt eine Zahl, die der Präsident von Alibaba.com gewählt hat, um sein Argument zu eröffnen, und es ist eine unbequeme Zahl: 61,7 %. Das ist der Prozentsatz der realen Geschäftsaufgaben, die der beste von ihnen getestete Künstliche-Intelligenz-Agent erfolgreich abschloss. Von 107 tatsächlichen E-Commerce-Vorgängen scheiterte das leistungsfähigste verfügbare System bei vier von zehn.
Kuo Zhang wählte sie nicht als Entschuldigung. Er wählte sie, um einen Fall für das zu konstruieren, was nach dem Wettrüsten um das intelligenteste Modell kommt. Und dieser Fall, gelesen aus der Psychologie der Adoption heraus und nicht aus der technischen Architektur, sagt etwas Beunruhigenderes als jeder Benchmark: Unternehmen, die weiterhin auf rohe Leistungsstärke als differenzierenden Vorteil setzen, missdeuten, wo die eigentliche Schlacht gewonnen wird.
Die in Fast Company veröffentlichte Nachricht stellt CommerceAgentBench vor, den Open-Source-Prüfstand, den Alibaba.com aus realen Vorgängen aufgebaut hat. Die Methodik unterscheidet sich von herkömmlichen Sprachbenchmarks: Sie misst nicht, ob das Modell eine plausible Antwort generiert, sondern ob die Aufgabe abgeschlossen wurde. Die Bestellung wurde versendet. Das Angebot wurde korrekt veröffentlicht. Der Versand wurde gemäß den Spezifikationen gebucht. Dieses binäre Erfolgskriterium macht den Benchmark zu etwas, das viel näher daran ist, wie ein Unternehmen menschliche Arbeit misst, und weit entfernt davon, wie die Künstliche-Intelligenz-Industrie den Fortschritt in den vergangenen Jahren gemessen hat.
Was sie beim Ausführen verschiedener Modelle über diese 107 Aufgaben fanden, war keine klare Hierarchie. Es war eine Fragmentierung. Das Modell, das bei Angeboten und Marktforschung führte, fiel bei der Bearbeitung von Reklamationen und der Einhaltung von Angebotsvorgaben zurück. Ein drittes System war am effizientesten bei der Produktveröffentlichung und der Verwaltung von Rücksendungen. Keines dominierte alles. Diese Streuung ist kein technischer Zufall: Sie ist der zentrale Punkt des Arguments.
Die Illusion des Einzelmodells und die kognitiven Kosten, die niemand kalkuliert
Die Art und Weise, wie die meisten Unternehmen in den vergangenen zwei Jahren Künstliche Intelligenz adoptiert haben, folgte einem wiedererkennbaren Muster: das leistungsfähigste verfügbare Modell auswählen, es mit bestehenden Arbeitsabläufen verbinden und darauf hoffen, dass die Leistungsstärke den fehlenden Designaufwand kompensiert. Das ist verständlich. Es reduziert die Entscheidungskomplexität. Es vermeidet die Unbequemlichkeit, genau verstehen zu müssen, was jedes Modell in jedem Kontext leistet. Und es erlaubt dem Team, das die Technologie adoptiert, das Gefühl zu haben, die richtige Entscheidung getroffen zu haben, weil es die teuerste und bekannteste getroffen hat.
Dieses Muster hat einen Namen in der Verhaltensökonomie: Attribut-Substitutions-Heuristik. Wenn eine Frage schwierig ist – welches System ist für jeden meiner zwanzig operativen Arbeitsabläufe am besten – ersetzt der Verstand sie durch eine leichter zu beantwortende Frage: Welches ist das beste verfügbare Modell? Die Antwort auf die zweite Frage wird auf die erste angewendet, ohne dass jemand den Austausch bemerkt.
Die Kosten dieses Austauschs sind unsichtbar, bis sie gemessen werden. Alibaba.com maß sie über 44 Aufgaben und stellte fest, dass sein Agent Accio, der die Arbeit je nach Schwierigkeitsgrad und gefordertem Denktyp auf verschiedene Modelle verteilt, 1,72 US-Dollar an Token kostete. Codex kostete 3,79 US-Dollar. Claude Code kostete 3,91 US-Dollar. Der Unterschied entsteht nicht dadurch, dass in allen Fällen günstigere Modelle verwendet werden: Er entsteht dadurch, dass die teuersten nicht eingesetzt werden, wenn sie nicht notwendig sind.
Diese Zahl ist kein Versprechen über die Investitionsrendite. Sie ist ein Hinweis auf die Mechanik, die im Hintergrund wirkt. Wenn ein Unternehmen auf das leistungsstärkste Modell standardisiert, weil das die Entscheidung vereinfacht, zahlt es Hochkomplexitäts-Reasoning für Aufgaben, die es nicht benötigen. Es weist in operativen Begriffen seinen besten Analysten der Aufgabe zu, Dokumente zu archivieren, weil es so vermeidet, entscheiden zu müssen, wer archivieren und wer analysieren sollte.
Zhangs Vorschlag bezeichnen sie als Präzisionsdelegation: jedem Arbeitsablauf das Fähigkeits- und Autoritätsniveau zuzuweisen, das genau dieser Ablauf erfordert. Das ist kein neues Konzept im Organisationsmanagement. Was neu ist, ist, dass es nun auf automatisierte Systeme anwendbar ist und dass die Strafe für unterlassenes Handeln einen direkten Ausdruck in den variablen Kosten des Betriebs von Künstlicher Intelligenz in großem Maßstab hat.
Warum die Adoption vor dem technischen Problem zum Stillstand kommt
Es gibt eine Dimension, die der Fast-Company-Artikel nur beiläufig erwähnt, die aber genauere Betrachtung verdient: das Verhältnis zwischen dem Autonomiegrad, der einem Agenten gewährt wird, und den operativen Folgen seiner Fehler.
Zhang formuliert das mit einer direkten Unterscheidung. Ein schwacher Entwurf einer Veröffentlichung in sozialen Netzwerken hat eine Art von Konsequenz. Eine fehlerhafte Zahlung an einen Lieferanten hat eine andere. Dieser Unterschied ist nicht nur technischer Natur: Er ist das Zentrum des psychologischen Adoptionsproblems in Unternehmensumgebungen.
Organisationen, die KI-Werkzeuge in Abläufe mit geringen Konsequenzen eingebunden haben – Textgenerierung, Zusammenfassungen, interne Entwürfe –, haben dies mit relativ geringer Reibung getan. Der Fehler ist sichtbar, korrigierbar und verursacht keinen unmittelbaren finanziellen Schaden. Die Person, die es nutzt, behält die Kontrolle über das Endergebnis. Ihre berufliche Identität ist nicht gefährdet, weil das System noch immer ihr Urteilsvermögen passiert, bevor es eine Wirkung in der Welt entfaltet.
Der Moment, in dem diese Logik bricht, ist dann, wenn der Agent direkt mit Systemen verbunden wird, die Aktionen ausführen: Zahlungen, Inventar, Logistik, Bestellungen. Dort ändert sich die Gleichung grundlegend. Der Fehler ist kein Entwurf mehr, der verworfen wird: Er ist eine falsche Lieferung, eine doppelte Zahlung, eine falsch konfigurierte Bestellung, die vertragliche Verpflichtungen erzeugt. Und die Person, die die Automatisierung genehmigt hat, trägt die Verantwortung für diesen Fehler, obwohl sie nicht daran beteiligt war.
Diese Verlagerung der Verantwortung ohne Verlagerung der Kontrolle ist einer der am meisten unterschätzten psychologischen Blockaden bei der Adoption von operativer Künstlicher Intelligenz. Unternehmen bremsen nicht, weil ihre Teams die Technologie nicht verstehen. Sie bremsen, weil ihre Teams vollkommen verstehen, dass wenn ein Agent bei einer Aufgabe mit hohem Einfluss versagt, der Fehler einen menschlichen Namen und Nachnamen hat. Und dieser Name ist meist der von jemandem, der die Automatisierung genehmigt hat.
Die Abschlussrate von 61,7 % des besten Modells bei realen Handelsaufgaben ist aus dieser Perspektive eine Zahl, die in zwei entgegengesetzte Richtungen wirkt. Für denjenigen, der sie als Adoptionsargument liest, sagt sie, dass bereits genug Kapazität vorhanden ist, um mit Aufsicht zu automatisieren. Für denjenigen, der sie aus der Angst vor Verantwortung liest, sagt sie, dass fast vier von zehn Aufgaben scheitern, und dass diese Fehlschläge in Systemen passieren, die mit Geld, Inventar und Lieferanten verbunden sind.
Keine der beiden Lesarten ist falsch. Sie sind einfach die zwei Seiten derselben Zahl, und das Unternehmen, das entscheidet, wie viel Autorität es an einen Agenten delegiert, trifft im Grunde eine Entscheidung darüber, wie viel Fehlerrisiko es bereit ist, in seiner Organisationsstruktur nach unten zu sozialisieren, bevor es solide Leistungsbelege aufgebaut hat.
Der Fall Harrison Nott und was er über die Grenzen des Arguments enthüllt
Der Artikel schließt mit dem Beispiel von Harrison Nott, einem 16-jährigen, der Alibaba.com und Accio nutzte, um ein Geschäft mit Kühlprodukten aufzubauen, das laut Fast Company 1 Million US-Dollar erwirtschaftet hat. Es ist eine narrativ gut gewählte Geschichte: Sie veranschaulicht, dass Fähigkeiten, die früher Teams mit Budget und Spezialisten vorbehalten waren, nun für eine Einzelperson ohne Unternehmensstruktur zugänglich sind.
Aber das Beispiel enthüllt auch, ohne es zu beabsichtigen, eine wichtige Asymmetrie im Argument der Präzisionsdelegation.
Für einen einzelnen Unternehmer, der mit vollständiger Autonomie über seine Entscheidungen agiert, ist die Frage, wie viel Autorität an einen Agenten delegiert werden soll, fast rhetorisch. Wenn der Agent einen Fehler macht, absorbiert dieselbe Person, die die Entscheidung getroffen hat, die Kosten. Es gibt keine Organisationshierarchie, die Rechenschaft ablegen muss. Es gibt keine übernommenen Systeme, die stören. Es gibt keine Compliance-Teams, die fragen, welchem Genehmigungsprotokoll gefolgt wurde.
In diesem Kontext ist die Adoptionsreibung minimal. Der Nutzen ist unmittelbar. Das Präzisionsdelegationsmodell funktioniert, weil die Person, die es verwendet, sowohl den Anreiz zur Adoption als auch die Flexibilität hat, den Fehler zu absorbieren.
Das Problem ist, dass dieser Kontext die meisten Organisationen nicht beschreibt, in denen das Versprechen der Präzisionsdelegation am wertvollsten wäre. Ein mittleres Unternehmen mit ERP-Systemen, Genehmigungsprozessen, Finanzabteilungen und internen Prüfern sieht sich einer völlig anderen Reibungsarchitektur gegenüber. Dort erfordert die Adoption eines Systems, das Arbeit je nach Schwierigkeits- und Kostkriterien auf mehrere Modelle verteilt, nicht nur eine technische Entscheidung, sondern auch die Angleichung von Governance-Kriterien, die Definition von Ausnahmeprotokollen und den Aufbau einer Evidenzschicht, die die schrittweise Ausweitung der Agentenbefugnis rechtfertigt.
Diese Schicht ist weder teuer noch technisch schwierig. Aber sie ist im Argument, so wie es präsentiert wird, unsichtbar, und sie ist genau das, was bestimmt, ob die Präzisionsdelegation vom Konzept zur Praxis wird – innerhalb einer Struktur mit mehreren Interessen und verteilten Verantwortlichkeiten.
Der Vorteil liegt nicht im Modell, sondern in der akkumulierten Evidenz des Vertrauens
Kuo Zhangs Argument funktioniert besser, wenn man es als Reifekarte liest denn als Vorschlag zur sofortigen Adoption. Die Unternehmen, die in der nächsten Phase operativer Künstlicher Intelligenz Vorteile erzielen werden, sind nicht notwendigerweise diejenigen, die Zugang zu den leistungsfähigsten Modellen haben. Es werden diejenigen sein, die die Evaluierungsinfrastruktur aufgebaut haben, die es ihnen erlaubt, ablauf für ablauf zu wissen, welches Modell am besten abschneidet, zu welchen Kosten und unter welchen Bedingungen es sicher ist, die Autonomie des Systems auszuweiten.
Diese Infrastruktur ist nicht glamourös. Sie erscheint weder in Produktankündigungen noch in öffentlichen Benchmarks. Aber sie ist der Unterschied zwischen einem Unternehmen, das Künstliche Intelligenz als Experiment adoptiert hat, und einem, das sie als nachhaltige operative Fähigkeit eingebunden hat.
Was CommerceAgentBench in seiner reduziertesten Form vorschlägt, ist, dass die kontinuierliche Leistungsevaluierung auf Aufgabenebene selbst eine strategische Fähigkeit ist. Nicht das Modell, das man heute nutzt, sondern die Fähigkeit, seine reale Leistung zu messen, die Zuweisung anzupassen und die Autorität des Agenten zu erweitern, während er Belege für seine Zuverlässigkeit akkumuliert.
Dieser Prozess der schrittweisen Ausweitung von Autorität auf der Grundlage nachgewiesener Leistung hat eine direkte Parallele dazu, wie erfolgreiche Organisationen Menschen führen. Ein neuer Mitarbeiter erhält nicht sofort Zugang zu allen Systemen oder die Befugnis, Ressourcen ohne Genehmigung zu binden. Diese Autorität weitet sich aus, wenn seine Leistung Belege dafür erbringt, dass er sie ausüben kann, ohne kostspielige Fehler zu erzeugen.
Diese Logik auf Agenten der Künstlichen Intelligenz anzuwenden, ist keine konservative Einschränkung des Potenzials der Technologie. Es ist der einzige Weg, die zentrale psychologische Blockade zu lösen, die Organisationen daran hindert, die Adoption von Abläufen mit geringen Konsequenzen hin zu Vorgängen zu verlagern, bei denen der finanzielle Einfluss die Investition rechtfertigt.
Der Vorteil des nächsten Zyklus gehört nicht demjenigen, der das intelligenteste Modell hat. Er gehört demjenigen, der den Prozess aufgebaut hat, um zu wissen, wann man dem Agenten eine wichtige Aufgabe anvertrauen kann – gestützt auf Leistungsdaten, die jemand vorzeigen kann, wenn der Fehler schließlich eintritt, denn er tritt immer ein, und der Unterschied zwischen einem Unternehmen, das diesen Fehler absorbiert, und einem, das angesichts dessen gelähmt ist, liegt darin, ob es ein Protokoll hatte oder nur Hoffnung.










