सबसे शक्तिशाली मॉडल वह नहीं होता जो व्यापार में जीतता है
एक संख्या है जिसे Alibaba.com के अध्यक्ष ने अपना तर्क शुरू करने के लिए चुना, और यह एक असुविधाजनक संख्या है: 61.7%। यह वह प्रतिशत है जितनी वास्तविक व्यावसायिक कार्यों को उस सर्वश्रेष्ठ कृत्रिम बुद्धिमत्ता एजेंट ने सफलतापूर्वक पूरा किया जिसका उन्होंने परीक्षण किया। ई-कॉमर्स के 107 वास्तविक परिचालनों में से, सबसे सक्षम उपलब्ध प्रणाली हर दस में से चार में विफल रही।
Kuo Zhang ने इसे माफी माँगने के लिए नहीं चुना। उन्होंने इसे यह तर्क बनाने के लिए चुना कि सबसे बुद्धिमान मॉडल की दौड़ के बाद क्या आता है। और यह तर्क, तकनीकी आर्किटेक्चर की बजाय अपनाने की मनोविज्ञान के नजरिए से पढ़ा जाए, तो किसी भी बेंचमार्क से अधिक परेशान करने वाली बात कहता है: जो कंपनियाँ कच्ची शक्ति को विभेदक लाभ के रूप में आगे भी दांव लगाती रहेंगी, वे यह गलत समझ रही हैं कि असली लड़ाई कहाँ जीती जाती है।
Fast Company में प्रकाशित खबर CommerceAgentBench प्रस्तुत करती है, जो एक ओपन-सोर्स परीक्षण मंच है जिसे Alibaba.com ने वास्तविक परिचालनों से निर्मित किया। पद्धति भाषा के पारंपरिक बेंचमार्क से अलग है: यह नहीं मापती कि मॉडल एक प्रशंसनीय उत्तर उत्पन्न करता है या नहीं, बल्कि यह मापती है कि कार्य पूरा हुआ या नहीं। खरीद आदेश भेजा गया। लिस्टिंग सही ढंग से प्रकाशित हुई। शिपमेंट विनिर्देशों के अनुसार आरक्षित किया गया। सफलता का यह द्विआधारी मापदंड बेंचमार्क को इस बात के कहीं अधिक करीब बनाता है कि कोई कंपनी मानव कार्य को कैसे मापती है, और इससे बहुत दूर कि कृत्रिम बुद्धिमत्ता उद्योग ने पिछले कुछ वर्षों में प्रगति को कैसे मापा है।
जब उन्होंने उन 107 कार्यों पर विभिन्न मॉडल चलाए तो जो पाया वह कोई स्पष्ट पदानुक्रम नहीं था। वह एक विखंडन था। जो मॉडल कोटेशन और बाजार अनुसंधान में अग्रणी रहा, वह दावों के समाधान और लिस्टिंग अनुपालन में पिछड़ गया। तीसरी प्रणाली उत्पाद प्रकाशन और वापसी प्रबंधन में सबसे कुशल थी। किसी ने भी सब कुछ पर वर्चस्व नहीं किया। यह बिखराव कोई तकनीकी दुर्घटना नहीं है: यह तर्क का केंद्रीय बिंदु है।
एकल मॉडल का भ्रम और संज्ञानात्मक लागत जिसे कोई नहीं आँकता
पिछले दो वर्षों में अधिकांश कंपनियों ने कृत्रिम बुद्धिमत्ता को अपनाने का तरीका एक पहचानने योग्य पैटर्न का अनुसरण करता था: सबसे सक्षम उपलब्ध मॉडल चुनें, उसे मौजूदा वर्कफ़्लो से जोड़ें और उम्मीद करें कि शक्ति डिजाइन की कमी की भरपाई कर देगी। यह समझ में आता है। यह निर्णय की जटिलता को कम करता है। प्रत्येक संदर्भ में प्रत्येक मॉडल क्या करता है, यह गहराई से समझने की असुविधा से बचाता है। और यह उस टीम को अनुमति देता है जो तकनीक अपना रही है, यह महसूस करने की कि उन्होंने सही निर्णय लिया क्योंकि उन्होंने सबसे महंगा और प्रसिद्ध निर्णय लिया।
इस पैटर्न का व्यवहार अर्थशास्त्र में एक नाम है: विशेषता प्रतिस्थापन की अनुमानी। जब एक प्रश्न कठिन होता है — मेरे बीस परिचालन वर्कफ़्लो में से प्रत्येक के लिए सबसे अच्छी प्रणाली कौन सी है — मस्तिष्क उसे उत्तर देने में आसान एक प्रश्न से बदल देता है: कौन सा सबसे अच्छा उपलब्ध मॉडल है। दूसरे प्रश्न का उत्तर पहले पर लागू किया जाता है, बिना किसी के यह देखे कि अदला-बदली हुई।
उस अदला-बदली की कीमत तब तक अदृश्य है जब तक मापी न जाए। Alibaba.com ने इसे 44 कार्यों पर मापा और पाया कि उनका एजेंट Accio, जो कार्य को कठिनाई और आवश्यक तर्क के प्रकार के अनुसार मॉडलों के बीच वितरित करता है, टोकन में $1.72 का खर्च आया। Codex का खर्च $3.79 था। Claude Code का खर्च $3.91 था। यह अंतर सभी मामलों में सस्ते मॉडल उपयोग करने से नहीं आता: यह उन कार्यों के लिए सबसे महंगे मॉडल न उपयोग करने से आता है जहाँ वे आवश्यक नहीं हैं।
यह आँकड़ा निवेश पर प्रतिफल का वादा नहीं है। यह नीचे काम करने वाले यांत्रिकी का संकेत है। जब कोई कंपनी सबसे शक्तिशाली मॉडल पर मानकीकरण करती है क्योंकि इससे निर्णय सरल हो जाता है, तो वह उन कार्यों के लिए उच्च जटिलता वाली तर्क क्षमता के लिए भुगतान कर रही है जिनकी उसे आवश्यकता नहीं है। परिचालन दृष्टि से, वह अपने सर्वोत्तम विश्लेषक को दस्तावेज़ दर्ज करने का काम सौंप रही है क्योंकि इस तरह यह तय करने से बचा जा सकता है कि किसे दर्ज करना चाहिए और किसे विश्लेषण करना चाहिए।
Zhang के प्रस्ताव को वे सटीक प्रत्यायोजन कहते हैं: प्रत्येक वर्कफ़्लो को उस स्तर की क्षमता और प्राधिकरण सौंपना जिसकी उस विशिष्ट प्रवाह को आवश्यकता है। संगठनात्मक प्रबंधन में यह कोई नई अवधारणा नहीं है। जो नया है वह यह है कि अब यह स्वचालित प्रणालियों पर लागू होता है, और यह कि इसे न करने पर जुर्माना बड़े पैमाने पर कृत्रिम बुद्धिमत्ता संचालन की परिवर्तनीय लागत में प्रत्यक्ष अभिव्यक्ति पाता है।
तकनीकी समस्या से पहले ही अपनाना क्यों रुक जाता है
एक आयाम है जिसका Fast Company का लेख परोक्ष रूप से उल्लेख करता है लेकिन जो अधिक ध्यान से जाँच के योग्य है: किसी एजेंट को दी जाने वाली स्वायत्तता के स्तर और उसकी त्रुटियों के परिचालन परिणामों के बीच संबंध।
Zhang इसे एक सीधे अंतर के साथ प्रस्तुत करते हैं। सोशल मीडिया पोस्ट के एक कमजोर मसौदे का एक प्रकार का परिणाम होता है। किसी आपूर्तिकर्ता को गलत भुगतान का दूसरा प्रकार। यह अंतर केवल तकनीकी नहीं है: यह उद्यम परिवेशों में अपनाने की मनोवैज्ञानिक समस्या का केंद्र है।
जिन संगठनों ने कम परिणाम वाले प्रवाहों में कृत्रिम बुद्धिमत्ता उपकरण शामिल किए हैं — पाठ उत्पादन, सारांश, आंतरिक मसौदे — उन्होंने ऐसा अपेक्षाकृत कम घर्षण के साथ किया है। त्रुटि दृश्यमान है, सुधारने योग्य है, और तत्काल वित्तीय क्षति नहीं पहुँचाती। जो इसका उपयोग करता है वह अंतिम परिणाम पर नियंत्रण बनाए रखता है। उसकी पेशेवर पहचान खतरे में नहीं है क्योंकि प्रणाली अभी भी दुनिया में प्रभाव उत्पन्न करने से पहले उसके निर्णय से गुजरती है।
वह क्षण जब यह तर्क टूट जाता है, वह तब होता है जब एजेंट सीधे उन प्रणालियों से जुड़ता है जो क्रियाएँ निष्पादित करती हैं: भुगतान, इन्वेंटरी, लॉजिस्टिक्स, खरीद आदेश। वहाँ समीकरण मौलिक रूप से बदल जाता है। त्रुटि अब वह मसौदा नहीं है जो रद्द किया जाता है: वह एक गलत शिपमेंट है, एक दोहरा भुगतान है, एक गलत कॉन्फ़िगर खरीद आदेश है जो संविदात्मक दायित्व उत्पन्न करता है। और जिस व्यक्ति ने स्वचालन को अधिकृत किया वह उस त्रुटि की जिम्मेदारी वहन करता है, भले ही उसने हस्तक्षेप न किया हो।
नियंत्रण के हस्तांतरण के बिना जिम्मेदारी का यह स्थानांतरण परिचालन कृत्रिम बुद्धिमत्ता को अपनाने में सबसे कम आँकी गई मनोवैज्ञानिक बाधाओं में से एक है। कंपनियाँ इसलिए नहीं रुकतीं कि उनकी टीमें तकनीक नहीं समझतीं। वे इसलिए रुकती हैं क्योंकि उनकी टीमें भली-भाँति समझती हैं कि जब उच्च प्रभाव वाले कार्य में कोई एजेंट विफल होता है, तो त्रुटि का एक मानवीय नाम होता है। और वह नाम आमतौर पर उस व्यक्ति का होता है जिसने स्वचालन को मंजूरी दी।
वास्तविक वाणिज्य कार्यों पर सर्वश्रेष्ठ मॉडल की 61.7% पूर्णता दर इस परिप्रेक्ष्य से एक ऐसी संख्या है जो दो विपरीत दिशाओं में कार्य करती है। जो इसे अपनाने के तर्क के रूप में पढ़ता है, उसके लिए यह कहती है कि पर्यवेक्षण के साथ स्वचालन के लिए पहले से पर्याप्त क्षमता है। जो इसे जिम्मेदारी के डर से पढ़ता है, उसके लिए यह कहती है कि लगभग हर दस में से चार कार्य विफल होते हैं, और वे विफलताएँ धन, इन्वेंटरी और आपूर्तिकर्ताओं से जुड़े सिस्टम में होती हैं।
दोनों में से कोई भी पठन गलत नहीं है। वे बस एक ही संख्या के दो पहलू हैं, और जो कंपनी यह तय करती है कि किसी एजेंट को कितना अधिकार सौंपना है, वह मूल रूप से एक निर्णय ले रही है कि वह ठोस प्रदर्शन साक्ष्य बनाने से पहले अपनी संगठनात्मक संरचना में कितना त्रुटि जोखिम नीचे तक सामाजिक बनाने को तैयार है।
Harrison Nott का मामला और यह तर्क की सीमाओं के बारे में क्या उजागर करता है
लेख Harrison Nott के उदाहरण के साथ समाप्त होता है, जो एक 16 वर्षीय युवक है जिसने Alibaba.com और Accio का उपयोग करके शीतलन उत्पादों का व्यवसाय विकसित किया, जिसने Fast Company के अनुसार $1 मिलियन उत्पन्न किए हैं। यह कथात्मक दृष्टिकोण से अच्छी तरह चुनी गई कहानी है: यह दर्शाती है कि जो क्षमताएँ पहले बजट और विशेषज्ञों वाली टीमों के लिए आरक्षित थीं, वे अब किसी कॉर्पोरेट ढाँचे के बिना एक व्यक्ति की पहुँच में हैं।
लेकिन उदाहरण, बिना इरादे के, सटीक प्रत्यायोजन के तर्क में एक महत्वपूर्ण असमानता भी उजागर करता है।
एक व्यक्तिगत उद्यमी के लिए जो अपने निर्णयों पर पूरी स्वायत्तता के साथ काम करता है, किसी एजेंट को कितना अधिकार सौंपना है, यह प्रश्न लगभग काल्पनिक है। यदि एजेंट कोई गलती करता है, तो उसकी लागत वही व्यक्ति वहन करता है जिसने निर्णय लिया। कोई संगठनात्मक पदानुक्रम नहीं है जिसे जवाब देना हो। कोई विरासत प्रणाली नहीं है जो हस्तक्षेप करे। कोई अनुपालन टीम नहीं है जो पूछे कि किस अनुमोदन प्रोटोकॉल का पालन किया गया।
उस संदर्भ में, अपनाने का घर्षण न्यूनतम है। उपयोगिता तत्काल है। सटीक प्रत्यायोजन का मॉडल काम करता है क्योंकि जो इसका उपयोग करता है उसके पास अपनाने का प्रोत्साहन और त्रुटि को अवशोषित करने का लचीलापन दोनों हैं।
समस्या यह है कि वह संदर्भ अधिकांश उन संगठनों का वर्णन नहीं करता जहाँ सटीक प्रत्यायोजन का वादा सबसे मूल्यवान होता। ERP प्रणालियों, अनुमोदन प्रक्रियाओं, वित्त विभागों और आंतरिक ऑडिटरों वाली एक मध्यम आकार की कंपनी पूरी तरह से अलग घर्षण आर्किटेक्चर का सामना करती है। वहाँ, एक ऐसी प्रणाली अपनाना जो कठिनाई और लागत मानदंडों के अनुसार कई मॉडलों के बीच काम वितरित करती है, केवल एक तकनीकी निर्णय नहीं है, बल्कि इसके लिए शासन मानदंडों को संरेखित करना, अपवाद प्रोटोकॉल परिभाषित करना और साक्ष्य की एक परत बनाना आवश्यक है जो एजेंट के अधिकार को क्रमिक रूप से विस्तारित करने को उचित ठहराए।
यह परत महंगी नहीं है और न ही तकनीकी रूप से कठिन है। लेकिन यह तर्क में जैसा प्रस्तुत किया गया है वैसा अदृश्य है, और यही वह है जो यह निर्धारित करती है कि सटीक प्रत्यायोजन कई हितों और वितरित जिम्मेदारियों वाली संरचना के भीतर अवधारणा से व्यवहार में जाता है या नहीं।
लाभ मॉडल में नहीं बल्कि विश्वास के संचित साक्ष्य में है
Kuo Zhang का तर्क तब सबसे अच्छा काम करता है जब इसे तत्काल अपनाने के प्रस्ताव के रूप में नहीं बल्कि परिपक्वता के मानचित्र के रूप में पढ़ा जाए। परिचालन कृत्रिम बुद्धिमत्ता के अगले चरण में लाभ पाने वाली कंपनियाँ आवश्यक रूप से वे नहीं होंगी जिनके पास सबसे सक्षम मॉडलों तक पहुँच है। वे होंगी जिन्होंने मूल्यांकन की वह आधारभूत संरचना बनाई होगी जो उन्हें प्रवाह-दर-प्रवाह यह जानने की अनुमति देती है कि कौन सा मॉडल सबसे अच्छा प्रदर्शन करता है, किस लागत पर, और किन परिस्थितियों में प्रणाली की स्वायत्तता का विस्तार करना सुरक्षित है।
यह आधारभूत संरचना आकर्षक नहीं है। यह उत्पाद घोषणाओं या सार्वजनिक बेंचमार्क में नहीं दिखती। लेकिन यह एक कंपनी के बीच का अंतर है जिसने कृत्रिम बुद्धिमत्ता को प्रयोग के रूप में अपनाया और एक जिसने इसे टिकाऊ परिचालन क्षमता के रूप में शामिल किया।
CommerceAgentBench जो प्रस्तावित करता है, अपने सबसे संक्षिप्त रूप में, यह है कि कार्य स्तर पर निरंतर प्रदर्शन मूल्यांकन स्वयं में एक रणनीतिक क्षमता है। आज आप जो मॉडल उपयोग करते हैं वह नहीं, बल्कि उसके वास्तविक प्रदर्शन को मापने, असाइनमेंट को समायोजित करने और विश्वसनीयता के साक्ष्य जमा होने पर एजेंट के अधिकार का विस्तार करने की क्षमता।
प्रदर्शित प्रदर्शन के आधार पर प्राधिकरण के इस क्रमिक विस्तार की प्रक्रिया का एक सीधा समानांतर है कि सफल संगठन लोगों का प्रबंधन कैसे करते हैं। एक नए कर्मचारी को सभी प्रणालियों तक तत्काल पहुँच नहीं मिलती और न ही बिना अनुमोदन के संसाधनों को प्रतिबद्ध करने का अधिकार। वह अधिकार तब विस्तारित होता है जब उसका प्रदर्शन यह साक्ष्य उत्पन्न करता है कि वह इसे महंगी त्रुटियाँ उत्पन्न किए बिना प्रयोग कर सकता है।
कृत्रिम बुद्धिमत्ता एजेंटों पर उसी तर्क को लागू करना प्रौद्योगिकी की क्षमता पर रूढ़िवादी प्रतिबंध नहीं है। यह उस केंद्रीय मनोवैज्ञानिक बाधा को हल करने का एकमात्र तरीका है जो संगठनों को कम परिणाम वाले प्रवाहों से उन परिचालनों की ओर अपनाना आगे बढ़ाने से रोकती है जहाँ वित्तीय प्रभाव निवेश को उचित ठहराता है।
अगले चक्र का लाभ उसके पास नहीं है जिसके पास सबसे बुद्धिमान मॉडल है। यह उसके पास है जिसने यह जानने की प्रक्रिया बनाई हो कि कब एजेंट पर किसी महत्वपूर्ण कार्य का भरोसा करना है, प्रदर्शन डेटा द्वारा समर्थित जिसे कोई दिखा सके जब त्रुटि अंततः होती है, क्योंकि यह हमेशा होती है, और एक कंपनी जो उस त्रुटि को अवशोषित करती है और एक जो उसके सामने लकवाग्रस्त हो जाती है, के बीच का अंतर इसमें है कि क्या उसके पास एक प्रोटोकॉल था या केवल उम्मीद।










