生成AIの導入効果の測り方|使う前に測る数字と、使わない班を残して比べる設計、自己申告アンケートの偏り

生成AIの導入効果は、管理画面の利用状況とアンケートでは言えません。使う前に測っておく数字、AIを渡す順番で作る「使わない班」、感じた効果と実測がずれた実験(METR)、経営への報告の書き方を、論文と各社の公式ドキュメントで確かめて整理しました。

この記事をシェア:
目次 クリックで開く

この記事の要点

  1. 生成AIの導入効果は、管理画面の利用状況でも、利用者アンケートの「時間が減った」でも言えない。前者は使われた量、後者は感じ方で、仕事が変わったかを測っていない。経験のある開発者16人の実験では、AIで20%速くなったと答えた人たちの作業時間は、実測で19%長くなっていた。
  2. 効果を言うには、使う前に自社の記録で業務の数字を取り、AIを渡す順番を班ごとにずらして、使わない班(まだ渡していない班)を残し、同じ期間で比べる。全員に一斉に渡すと、比べる相手がいなくなる。
  3. 経営への報告は、「使われた量」「班の差」「感じ方」を別々に書く。差には、比べた人数・期間・偏りの幅と、測れなかったことを添える。感じ方のアンケートは、効果の大きさに換算しない。

導入効果を測る4つの手順

渡す順番が、そのまま比べる相手になる

1 使う前に測る

業務の数字を、自社の記録から取る

  • 処理時間・件数・手戻りの件数
  • 担当者の経験年数・役割(あとで層別に見る)

取る場所:AIの管理画面の外

2 渡す順番を決める

先に使う班と、あとで使う班に分ける

  • あとで使う班が、使わない班になる
  • 待つ期間と、報告の日付を先に決める

比べる相手:まだ渡していない班

3 同じ期間で比べる

業務の数字の差を見る

  • 利用状況・業務の数字・アンケートは別々に集める
  • 班の元の成績の違いを揃えて比べる

出すもの:班の差と、その幅

4 差と限界を報告する

測れたことと、測れなかったことを分ける

  • 差が小さいときは「測れなかった」と書く

渡す先:経営・次に渡す班

4つの手順は当社の整理です。各社の機能と研究の内容は、本文の出典に基づきます(2026年10月4日確認)

生成AIを全社に配ったあとで、効果を聞かれて出せる数字は、たいてい2つです。管理画面の利用状況(何人が何回使ったか)と、利用者アンケートの「作業時間が減った」という回答です。どちらも、仕事が変わったことを示す数字ではありません。前者は使われた量、後者は感じ方です。効果を言えるのは、使う前に自社の記録で業務の数字を取っておき、AIを渡す順番をずらして、まだ渡していない班を残し、同じ期間で比べたときだけです。

感じ方が当てにならないことは、実験で確かめられています。経験のある開発者16人を対象にしたMETRの無作為化実験で、開発者は事前に「AIで作業時間が24%短くなる」と予想し、終わったあとも「20%短くなった」と答えました。実測では、AIを使った作業のほうが19%長くかかっていました(Becker ほか)。ソフトウェア開発者を対象にした実験なので、ほかの業務にそのまま当てはまるとは限りません。使いたいのは、感じた速さと測った速さが別の数字になりうる、という点です。

検索で上位に出る解説(SHIFT AI の KPI 設計の記事、同社の評価設計の記事)は、KPIの置き方と、導入前に基準値を取ることを説明しています。2026年10月4日に私たちが読んだ限り、使わない班を残して比べる方法と、自己申告アンケートの偏りには、どちらも触れていませんでした。この記事は、その2点を中心に書きます。数字や仕様は、論文・実験報告・各社の公式ドキュメントを2026年10月4日に開いて確かめたものだけです。

使わない班を残して比べる考え方は、広告で増えた分を測る方法(広告が効いたかを確かめる方法)や、LINE配信で増えた分を測る方法(LINE配信で増えた売上の測り方)と同じです。ここでは、生成AIの展開に当てはめたときに出てくる論点に絞ります。指標を「利用・業務・事業」の3段に分ける考え方は、AI CoE の1年目の記事に書きました。この記事は、そのうち2段目の「業務が変わったか」を、どう比べて確かめるかを扱います。

管理画面の利用状況とアンケートでは、効果は言えない

利用状況の画面が数えているのは、使われた量です。Microsoft の Copilot ダッシュボードには、過去28日の「Copilot assisted hours」(Copilot が助けた時間)が出ます。この数字は、測った時間ではなく推計です。検索や要約の操作と、メール・文書・表計算などを作る操作は、1回あたり6分として足し上げます。会議の要約は、要約した会議の長さをそのまま足します。6分は、Microsoft が行った163人と147人の知識労働者の調査から取った係数です。さらに時給(既定は US$72)を掛けると「助けた金額」になります。Microsoft 自身が、この数字を大まかな推定として見るよう書き、ダッシュボードの数字の変化は、Copilot だけの結果とは限らないと注意しています(Copilot ダッシュボード)。

Google Workspace の Gemini の利用状況レポートは、有効な利用の回数と、過去28日のうち使った日数を数えます。有効な利用は、要約や文章・画像の生成を頼んだとき、提案を採用したときなどです。利用の多さは、利用のある人の上位10%のうち20回以上を「高」、5回以上を「中」、4回以下を「低」と区分けします(Gemini の利用状況を確認する)。

利用状況の画面が数えているものと、数えていないもの

利用状況は「届いたか」の数字で、「効いたか」の数字ではない

数えている

使われた量

  • Gemini:有効な利用の回数と、過去28日のうち使った日数
  • Copilot:操作の回数と、利用者の割合
  • 回数から推計した「助けた時間」(Copilot)

分かること:AIが現場に届いているか

数えていない

仕事がどう変わったか

  • 使う前の、業務の処理時間や件数
  • 使わなかった人の業務の数字
  • 手戻りや誤りの増減

必要なもの:自社の記録と、比べる班

出典:Microsoft Learn「Microsoft Copilot ダッシュボード」(2026年9月29日更新)、Google「Review Gemini usage in your organization」(2026年10月1日更新)。右の列は、確かめた範囲の画面の説明に載っていない項目を当社が整理したものです(2026年10月4日確認)

どちらも、AIが現場に届いているかを知るには役に立ちます。ただ、確かめた範囲の画面の説明には、使った人の業務の数字が使う前からどう変わったか、使わなかった人と比べてどうか、という項目は載っていませんでした。使う前の業務の数字は、利用の記録を始める前の話なので、AIの管理画面にはありません。自社の記録から取る必要があります。

使い始める前に測っておく数字

使う前に測るのは、使い始めたあとでは取り戻せないからです。「以前は1件に何分かかっていたか」は、AIを使い始めた人の記憶にしか残りません。上位の解説も、導入前に基準値を取ることを勧めています。ここで足しておきたいのは、取る場所です。AIの管理画面の外にある、自社の記録から取ります。

Brynjolfsson らの研究は、サポート窓口の記録(1時間あたりに解決したチャットの数)で測りました。AIの支援を導入する前から、窓口の記録に同じ数字が残っていたので、導入の前と後を同じ数字で比べられました(Generative AI at Work)。

使う前に取っておく4つの数字(当社の整理)
使う前に取る数字取る場所使う前に取る理由・注意
1件あたりの処理時間・件数受付・チケット・申請など、AIとは別に残る記録使い始めたあとは、以前の水準が人の記憶にしか残らない。同じ数え方で、使う前から続けて取る
手戻り・修正・誤りの件数レビューや差し戻しの履歴速くなっても質が落ちていないかを見る。数える人と基準を変えない
担当者の経験年数・部署・役割人事の名簿効果が人によって違う(後述の研究では、平均14%・経験の浅い人34%)。班を分けるときと、層別に見るときに使う
他の要因の日付繁忙期・制度の変更・人の入れ替え・別ツールの導入差が出たときに、AI以外の理由を消す

AIを渡す業務は、最初から全部を測らず、1〜3つに絞ります(当社の考え)。数字が自社の記録にすでにある業務か、数える手間が小さい業務から始めます。期間は、使う前と使ったあと(先行班と後続班)で、同じ長さ・同じ季節にそろえます。

使わない班を残して比べる:渡す順番で、比べる相手を作る

全員に一斉に渡すと、比べる相手がいなくなります。比べる相手は、渡す順番で作ります。先に渡す班とあとで渡す班に分けると、あとで渡す班が、同じ期間の「使わない班」になります。

渡す順番で、比べる相手を作る

全員に一斉に渡さず、順番をずらす

先に渡す班あとの班には、まだ渡さない
同じ数字を取り続ける渡す前から、両方の班で
差を出す後続班に渡す前に、先行班との差を見る
後続班に渡す渡したあとの変化も、同じ数字で見る

手順は当社の整理です。順番に渡す設計は、後述の Brynjolfsson らの研究が使った方法を参考にしています(2026年10月4日確認)

Brynjolfsson らの研究の窓口では、AIの支援を、最初に50人を対象にした7週間の無作為の試行で試したあと、担当者ごとに時期をずらして渡していきました。まだ渡されていない担当者が、渡された担当者の比べる相手になります。比べ方は4つに分けられます。

比べ方4つと、偏りの出どころ
比べ方やり方答えられること偏りの出どころ
渡す時期をずらす(先行班・後続班)班を分け、先に渡す班とあとで渡す班を決める。同じ期間の業務の数字を比べる渡したことで、業務の数字がどれだけ変わったか班の分け方が偏ると差が出る。のちにAIを渡された担当者は、渡される前から成績が高めだった(1時間あたりの解決件数が2.0件、渡されなかった担当者は1.7件)。元の成績の違いを揃えて比べる
業務・依頼ごとに無作為で、AIあり・なしに分ける1つずつの依頼を、あり・なしにくじで割り当てる同じ人の、同じ種類の仕事での差「AIなしではやりたくない」依頼が出されなくなる。AIで大きく速くなる依頼が、比べる群から抜ける
使いたい人と、使わない人を比べる(当社の整理)希望者にだけ渡し、希望しなかった人と比べるほとんど答えられない熱心な人・成績の高い人が先に使う。差がAIのせいか、人のせいかが分けられない
導入前と導入後だけを比べる(当社の整理)全員に渡した前後の数字を比べる時間のなかでの変化繁忙期・人の入れ替え・別ツールの導入と、AIの効果が分けられない

1行目の「班の元の成績」は、研究でも課題になっていました。のちにAIを渡された担当者は、渡される前から成績が高かったためです。そこで研究は、時期ごとの共通の変動と担当者ごとの違いを取り除く統計の方法(差の差の推定)で、差を出しています。自社で見るときも、班ごとの元の数字を並べ、差そのものでなく、渡す前からの変化を比べます。

班を分けるときの注意は、2つあります。1つは、待つ班の扱いです。待つ期間と、結果を報告する日付を先に決め、伝えます。期間を長くしすぎないことが、使わない班を残す条件になります(当社の考え)。もう1つは、待つ班の非公式な利用です。個人のアカウントなどで使っている人がいると、使わない班ではなくなります。聞き取りで把握し、数字を読むときに記録します(当社の考え)。

無作為に分ける側にも、落とし穴があります。METRは2025年8月から、開発者を増やして実験を続けましたが、「AIなしでは作業したくない」という開発者が増えました。開発者の30〜50%が、AIなしでやりたくない作業の一部を、実験に出さなかったと答えています。AIで大きく速くなる作業が、比べる群から抜けるため、METRは、新しい実験のデータは効果を示す信頼できる信号ではないとして、実験の設計を変えると発表しました(METR、2026年2月24日)。使わない班に入れられる人が、先に抜けていく例です。自社でも、班の人がこの比較に納得できる説明と期間を用意します。

すでに全員にAIを渡している場合も、次に始める機能や研修は、班を分けて順に展開すれば比べられます。研修の効果は、受講する班とあとで受ける班の比較で測れます。研修を買う前に決めておくことは、Copilot 研修とGemini 研修の記事に書きました。

自己申告のアンケートは、効果の大きさの証拠にならない

METRの実験は、開発者の感じ方と実測がずれることを示しました。16人の開発者は、246の作業を、AIを使ってよい作業と使わない作業に、作業ごとにくじで割り当てられました。事前の予想は24%の短縮、終わったあとの自己評価は20%の短縮でした。実測では、AIを使った作業が19%長くかかっていました(95%の区間は2%〜39%長い)。

作業時間の変化:事前の予想、事後の自己評価、実測

経験のある開発者16人・246の作業。AIを使ってよい作業と使わない作業を、作業ごとにくじで割り当てた。−は短く、+は長くなった方向

事前の予想(AIを使うと)−24%
終わったあとの自己評価−20%
実測+19%

出典:Becker ほか「Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity」(METR、2025年)。棒の長さは変化の大きさで、実測だけ方向が逆です(2026年10月4日確認)

作業時間の自己記録そのものは、画面録画と近い値でした。同じ課題の一部で、自己申告の時間から出した差は24%の遅れ、画面録画の時間から出した差は25%の遅れです(Becker ほか)。ずれたのは、記録した時間ではなく、「AIのおかげでどれだけ変わったか」という本人の判断でした。アンケートで時間の短縮を聞くと、後者を聞くことになります。

この結果は、そのまま自社に当てはめられません。対象は、平均5年の経験がある自分のプロジェクトで作業する開発者16人で、2025年前半のAIツールを使った実験です。METRは、2026年の初めには2025年より速くなっている可能性が高いと書いたうえで、その大きさについては、新しい実験のデータは弱い証拠にしかならないとしています。さらに、高い速さを自己申告する開発者もいるが、そうした推定は当てにならないことがある、とも書いています(METR、2026年2月24日)。使えるのは、感じた効果と測った効果が別になりうる、という点です。

平均だけを見ることにも限りがあります。Brynjolfsson らの研究では、5,179人のサポート担当者の1時間あたりの解決件数が、AIの支援で平均14%増えました。内訳は、経験の浅い・成績の低い担当者で34%増、経験の長い・成績の高い担当者ではわずかな変化でした。平均のアンケートの点数では、この違いが見えません。使う前に経験年数や役割を取っておくのは、層ごとに分けて見るためです。

生成AIの支援を受けたサポート担当者の、1時間あたりの解決件数の増加

5,179人の担当者。AIの支援の導入は、担当者ごとに時期をずらして進められた

全体の平均14%増
経験の浅い・成績の低い担当者34%増
経験の長い・成績の高い担当者わずか

出典:Brynjolfsson, Li, Raymond「Generative AI at Work」(NBER Working Paper 31161、のち The Quarterly Journal of Economics 140巻2号、2025年)(2026年10月4日確認)

アンケートは、効果の大きさを出すためではなく、何に困っているか、どんな使い方をしているか、何が不安かを聞くために使います(当社の考え)。時間の短縮を金額にするときも、時間が推計のままでは、金額の根拠になりません。DX一般の投資対効果の出し方は別の記事にあります。ここでは、生成AIの効果は業務の記録で出す、という点だけを押さえます。

経営への報告は、利用・差・感じ方を分けて書く

報告には、3つの数字を別々の欄で並べます。利用は管理画面から、差は自社の業務の記録から、感じ方はアンケートから取ります。混ぜると、「利用が増えたから効果が出た」「満足度が高いから時間が減った」という、測っていない主張になります。

報告に並べる3つの数字(出どころを分ける)

3つを混ぜず、別々の欄に書く

利用

届いたか

  • 有効に使った人の割合・使った回数
  • 集計の窓(例:直近28日)を書く

出どころ:AIの管理画面

差

効いたか

  • 先行班と後続班の、業務の数字の差
  • 人数・期間・差の幅・元の成績の違い

出どころ:自社の業務の記録

感じ方

どう受け止められたか

  • 困っていること・使い方・不安
  • 効果の大きさには換算しない

出どころ:利用者アンケート

3つの区別は当社の整理です。アンケートを効果に換算しない理由は、上の研究を参照してください(2026年10月4日確認)

差の欄は、次のように書きます(書式は当社の考えで、◯は実際の値を入れる箇所です)。「先行班(◯人)と後続班(◯人)を、◯週間、同じ数字で比べた。1件あたりの処理時間の差は◯。偏りを見込んだ幅は◯。比べられなかった期間・業務は◯」。幅と人数を添えることで、経営が数字を読み違えるのを防げます。

差が小さいとき、または幅が大きいときは、「効果が無かった」と書かず、「この規模と期間では確かめられなかった」と書きます。班を大きくする、期間を延ばす、先に渡す業務を絞ると、幅は狭まります。

効果を測る作業の中心は、アンケートの項目を増やすことではなく、比べる相手が残るように、渡す順番を先に決めることです。Aurant Technologies では、生成AIの活用支援のページに、使い方の決まりづくりから研修・伴走までの支援を載せています。展開の順番や、使う前に取る数字の決め方の相談も、そのページから受け付けています。

AI活用支援

Claude・ChatGPT・Gemini・Copilotのどれをどの業務に使うかの見極めから、社内のAIチャット環境、権限と情報の扱いの設計、MCPやAPIでの既存システム連携、研修・伴走までを支援します。

AT
aurant technologies 編集

上場企業からスタートアップまで、数多くのデータ分析基盤構築・AI導入プロジェクトを主導。単なる技術提供にとどまらず、MA/CRM(Salesforce, Hubspot, kintone, LINE)導入によるマーケティング最適化やバックオフィス業務の自動化など、常に「事業数値(売上・利益)」に直結する改善実績多数。

この記事が役に立ったらシェア:

導入・外注のご相談

進め方と、費用が何で決まるかをお伝えします。

費用感だけのご相談でも構いません。フォームで相談する費用の考え方を見る