測定してスケールする:企業AIを阻む問題
2年前、私が知る経営幹部の大半は、どの言語モデルを選ぶかについて議論していた。今日、すでにその決断を下したにもかかわらず、第2ラウンドの投資を正当化できない人々は、問題がモデルにあったのではないことを理解し始めている。問題は測定にあったのだ。
企業セクターは数年にわたり、急速なペースで人工知能を導入してきた。マッキンゼーによると、組織の88%が少なくとも1つのビジネス機能にAIを組み込んでいる。しかし、一貫性をもってスケールさせ始めたのはそのうちの3分の1に過ぎない。その差——試験導入とスケール化の間——は技術的なものではない。組織的なものであり、ほとんどの経営チームが精確に話し合うことを避けてきた会話に端を発している:これが機能するということが、業務上および財務上の観点から何を意味するのか、ということだ。
Sustainablでは、企業がAIへの投資ケースをどのように構築するかを長期にわたって観察してきた。最も頻繁に目にするのは、技術的な無能さではない。レイヤーの混乱だ——プロバイダーが提供するもの(標準化されたテストのスコア、ラボでの精度、比較ランキング)を測定し、取締役会が本当に確認する必要があるもの——ビジネスで何が変わったのか——を測定することを忘れてしまっているのだ。
ベンチマークの罠と、それがリーダーシップについて明かすもの
経営チームがベンチマークスコアを比較することでAIモデルを評価するとき、彼らは1990年代にテクノロジー業界がすでにサーバーで犯した間違いを繰り返している:結果ではなく仕様を購入するというものだ。問題はベンチマークが無意味だということではない。ベンチマークが異なる質問に答えているということだ。
ベンチマークは、管理された条件下で、標準化されたタスクをモデルがどれだけうまく解決するかを測定する——使用するデータは、あなたの会社の実際のワークフロー、独自の知識ベース、特定のエッジケースとは何の関係もない。本番環境で起きること——あなたが持つデータ、すでに存在するプロセス、日常的にインタラクションを行うユーザーと共に——は、それらのメトリクスから15〜25パーセントポイント異なる場合がある。その差は技術的な細部ではない。プロバイダーの約束とビジネス上の成果の間の距離だ。
ここで私が関心を持っているのは、モデルのエンジニアリングではない。この混乱が、新しいテクノロジーに直面したときに組織がどのように機能するかについて明かすものに関心がある。繰り返されるパターンがある:不確実性に直面すると、リーダーシップは成功の基準を技術的な領域に委任する傾向がある。エンジニアの言語——精度、再現率、F1スコア——をビジネスの言語に翻訳することなく採用してしまう。これはリーダーシップが無能だから起きるのではない。誰もこの投資が失敗するとはどういうことかを定義するという不快な会話をしたくなかったからだ。
その会話にはコストがかかる。AIプロジェクトが90日に達しても、どの業務指標にも動きを示せないとき、議論は分析的になる前に政治的になる。各部門が自分の解釈を守り、誰も結果に責任を持ちたがらず、プロジェクトは惰性で維持されるか、フラストレーションからキャンセルされる。どちらの結末も、経営チームが最初から——モデルを選ぶ前に、プロバイダーを選ぶ前に——どのビジネス指標が動くのか、どれだけ動くのかを確立していれば防ぐことができる。
最高財務責任者が聞く必要があること
AIへの投資提案を見直すとき、私が頭の中で適用するテストがある:導入から12か月後に最高財務責任者(CFO)がビジネスケースを読んでいると想像することだ。もしドキュメントが、モデルが推論ベンチマークで93%を獲得したことしか示せないなら、プロジェクトはリスクにさらされている。その数字が無関係だからではなく、CFOが2年目の予算を承認するときに問う質問に対して何も答えていないからだ。
本当の質問はこうだ:ケースごとの解決時間はどれだけ短縮されたか、初回接触解決率はどれだけ改善したか、AI支援のインタラクションのコストは完全な手動処理と比べてどれだけかかったか、新人エージェントが許容可能な業務レベルに達するのにどれだけかかったか。これらのメトリクスはモデルから得られるものではない。システム全体のアーキテクチャ——データの品質、情報取得の設計、統合レイテンシー、制御メカニズム——から得られるものだ。モデルはそのシステムの中の一変数だ。多くの場合、最も決定的な変数ではない。
本番環境で測定されること——会社独自のデータと、ビジネスの実際のエッジケースに対して——こそが、ソリューションが価値を提供するかどうかを定義する。特定の知識ベースと顧客の言語パターンにより適切に調整された、より控えめなモデルは、そのコンテキストに合わせて調整されたことのない、より洗練されたモデルを一貫して上回ることがある。これが公共サービスセクターのコンタクトセンターで起きるのを見てきた:ベンチマークの「勝者」モデルが最終的に、実際の顧客の問い合わせでより良いパフォーマンスを発揮するよりシンプルなモデルに置き換えられたのだ。
示唆は直接的だ:モデルはプロジェクトのアイデンティティとしてではなく、交換可能なコンポーネントとして扱われるべきだ。その論理でアーキテクチャを設計する組織——モデルのレイヤーをアプリケーションのレイヤーから分離する——は、ソリューション全体を解体することなくモデルを置き換えることができる。そうしない組織は、将来のあらゆる改善を高コスト化する技術的依存に閉じ込められてしまう。
予算サイクルを生き抜く3層フレームワーク
産業部門およびサービス部門における複数のデプロイメントを観察した後、最も持続性を示す測定構造は、最も洗練されたものではないことがわかった。技術チームから取締役会まで、指揮系統全体にとって最も読みやすいものだ。
第一層は本番環境での精度を測定する:システムが生成した結果のうち、人間による修正なしに正確なものが何パーセントあるか——プロバイダーが報告する精度ではなく、ユーザーと社内専門家との実際のインタラクションから浮かび上がる、会社の実際のデータとエッジケースに対して測定したもの。
第二層は業務効率を測定する:管理時間が短縮したか、解決率が改善したか、エスカレーションが減少したか。これらは継続を正当化するメトリクスだ。最初の90日以内にこれらの指標の少なくとも1つに動きを示せないデプロイメントは、技術スタックのどこかに問題がある——そしてそれを知るためにより多くの時間を待てば待つほど、修正コストが上がるだけだ。
第三層は財務的インパクトを測定する:AI支援インタラクションのコストと完全な手動インタラクションのコストの比較、投資回収期間、帰属可能な節約額。これは、プロジェクトを経営上の意思決定のバランスシート内の資産に変えるレイヤーだ。それなしでは、AIについての会話は技術愛好家の領域にとどまり、資本を配分する人々の領域にはならない。
このフレームワークを機能させるのは、その複雑さではない。デプロイする前に組織に定義の会話を強制することだ。モデルやプロバイダーを選択する前に、各ユースケースに対して3〜5つの具体的なビジネス指標を定義することは、方法論的な演習ではない。リーダーシップが何にコミットしているかを理解し、それが達成されたかどうかをどの基準で評価するかを理解しているというシグナルだ。
正しく測定する者はスケールする。しない者は方向性なく反復する
規制的なコンテキストがこの会話に緊急性を加える。欧州のAI規制は2024年8月に発効し、2026年8月から広く適用されるが、組織にAIシステムをデプロイするだけでなく、それらのシステムが定義された、監査可能な、非差別的なパラメータ内で動作していることを実証できることを要求する。それは活発な測定インフラなしには不可能だ。すでに業務指標の追跡ダッシュボードを持っている企業は、意図せずして、来たるべきガバナンス要件を遵守するためのより良いポジションにある。
しかし、規制は最低限の論拠に過ぎない。核心的な論拠は組織の成熟度についてのものだ。
AIのスケール化に成功する企業は、必ずしも最良のモデルを選んだ企業ではない。時間をかけてこのプロジェクトへの社内サポートを維持するのに十分な精度で、結果を測定し、調整し、伝える規律を構築した企業だ。その規律は、経営チームの誰かが次の不快なことを言う不快さを引き受けることを要求する:「これが機能するとはどういうことかを適切な時期に定義しなかったため、まだこれが機能しているかどうかわからない。」
その会話が一度も行われなかった組織がある——なぜなら、どの幹部もチームの熱意に疑問を呈する役割を担いたくなかったか、あるいはパイロットがあまりにも政治的な騒音とともに到着したため、誰もが明確な失敗の基準を提案することをためらったからだ。その結果は頻繁に目にするものだ:方向性のない反復の中で維持されるプロジェクト、経営委員会の誰も解釈できないメトリクスを最適化する技術チーム、そして最初の投資が約束したものを提供しなかったことを認めることを恐れて追加予算を承認するリーダーたち。
AIはその問題を解決しない。増幅させる。週に何十万ものインタラクションを生成するシステムは、価値もエラーも増幅させる。何を測定しているかわからなければ、何を掛け算しているかもわからない。
モデルは常に改善される。プロバイダーはますます短いサイクルで、より有能なバージョンをリリースするだろう。それだけでは変わらないのは、行動する前に明確な基準を確立し、起きていることを誠実に測定し、プロジェクトをゼロから再構築する必要なく調整する組織の能力だ。それはどのモデルも提供しない。リーダーシップが構築するか、誰も構築しないかのどちらかだ。











