
購買審査を通過するAIエージェントのパイロット
購買審査を通過するパイロットは、開発を始める前に5つのことを書面で合意しています。範囲を絞った1つのワークフロー、測定する担当者が決まった1つの成功指標、議論なしにプロジェクトを止める中止基準、セキュリティチームがすでに読んだデータ取り扱いの回答、そして固定価格です。有償で、30日から90日間、実データで実施してください。パイロットはデモでは失敗しません。失敗するのはセキュリティ審査と、成功がどういう状態だったのか誰も言えない会議の場です。
Gartnerは2027年末までにエージェント型AIプロジェクトの40%以上が中止されると予測し、その原因として、膨らむコスト、不明確なビジネス価値、不十分なリスク管理の3つを挙げています。そのどれもが、最初の1行のコードより前、パイロットの組み立て方の段階で決まります。3つすべてを避ける組み立て方を紹介します。

要点
- 有償、30日から90日、範囲を絞った1つのワークフロー、実データ。無償の概念実証には手の空いている人が割り当てられ、何とも比較されません。
- 成功指標と中止基準は開発前に書面にします。中止基準は財務部門を安心させる部分であり、ベンダーが抵抗する部分でもあります。
- セキュリティの質問には6週目ではなく0週目に答えます。パイロットが実際に失敗するのはセキュリティ審査です。
- 双方に1人ずつ責任者を指名します。Deloitteの調査では、成熟したエージェント型AIのガバナンスを持つ組織は21%にすぎず、判断の境界が最大の欠落でした。
- パイロットは、拡大、1回だけ延長、中止のいずれかの判断で締めくくります。デモが決めてくれることはないので、開始前にどれを見込んでいるかを書いておきます。
開発前に合意しておくべき5つのこと
1. 範囲を絞った1つのワークフロー
部署やプラットフォームではなく1つの仕事で、明確なきっかけ、明確な終了状態、数えられる作業単位があるものです。請求書の例外処理の振り分け。問い合わせリードの選別と予約。サポートチケットの仕分けとタグ付け。購買シグナルで見込み客を抽出し、人が承認する下書きを作成する。これは実際に機能するAIリード獲得システムの作り方で紹介した形です。名詞と動詞を含む1文でワークフローを説明できないなら、まだ範囲が絞れておらず、パイロットは失敗するまで膨らみ続けます。
確認方法:このワークフローが先月何回実行されたか言えますか。その数字がないなら、パイロットの前に取得してください。それがベースラインにもなります。
2. 測定担当者を決めた、書面の成功指標
主要指標は1つ、数字は1つ、それを読む人は1人です。週あたりに取り戻せた時間、人の手を介さずに処理された件数の割合、処理時間、エラー率、取引あたりのコスト。それだけで支出を正当化できるものを選びます。
選ぶ指標以上に重要なルールが2つあります。第一に、測定担当者はベンダー側ではなく自社側にすること。自分の宿題を自分で採点するベンダーは証拠になりません。第二に、エージェントが稼働する前にベースラインを記録すること。後付けのベースラインは必ず都合よく見え、決して信用されません。
3. 書面で合意した中止基準
それを下回ればパイロットを終了し、誰も蒸し返さない数字です。指標が「チケットの60%を人の修正なしで仕分けできる」なら、中止基準は35%かもしれません。60日目にそれを下回れば契約は終了し、総リスクは最初から限定された金額だったことになります。
これはAIの実験を通常の購買判断に変える条項であり、ベンダーを見分ける条項でもあります。中止基準に抵抗するベンダーは、自分たちの勝算をどう見ているかを教えてくれています。
4. データの取り扱いを事前に回答する
パイロットが失敗するのはここです。デモは順調でした。価格交渉も順調でした。そこへ5週目にセキュリティ質問票が届き、不十分な回答をするのに6週間かかります。
キックオフ前に次のことに答えを出してください。エージェントがどのデータを読み書きするか、どこで処理されるか、どの再委託先が触れるか、モデルが自社の入力と出力で学習するかどうか(答えは「いいえ」でなければならず、ベンダーとモデル提供元との規約までたどれる必要があります)、アクセスがどう付与され取り消されるか、そしてデータの取り扱いを定めたデータ処理契約(DPA)がすでに存在するかどうか。ベンダーの信頼性に関する文書は、約束ではなくリンクで求めてください。あなたのために書き起こす必要があるなら、それがスケジュールのリスクです。
当社の文書は信頼性とセキュリティで公開しています。セキュリティ体制、データの取り扱い、再委託先、米国国立標準技術研究所(NIST)のAIリスクマネジメントフレームワークの4つの機能に沿ったガバナンスの概要、そして要望に応じて提供するDPAです。当社は標準的な独立セキュリティ監査であるSystem and Organization Controls(SOC)2の報告書を取得しておらず、そのページにはっきりそう書いています。購買チームはいずれにせよそれを知ることになるからです。
5. 固定価格と、2つ目のワークフローの費用
範囲を絞った仕事に1つの金額です。当社が公開しているAIエージェントの費用帯では、小規模な事業者によるシンプルな単一ワークフローの自動化を$3,000から$8,000としています。ここで説明するような、実データでのシャドーモード、監督付きの本番稼働、書面の中止基準を備えたパイロットはより大きな範囲で、当社の場合は料金ページで固定25,000〜60,000米ドルと公開しています。2つ目と3つ目のワークフローの価格も今のうちに確定させてください。1つ目が機能すると交渉力はなくなります。
30日、60日、90日の進め方
0日目から7日目、開発前。 セキュリティ質問票とDPAを進める。ベースラインを記録する。成功指標、中止基準、双方の責任者を承認する。アクセスは最小権限で、自社のシステム内で、自社が取り消せる形で付与する。
7日目から30日目、開発とシャドーモード。 エージェントは実データで動きますが、取り消せない操作は行いません。すべての出力を人が確認し、食い違いが学習のシグナルになります。この段階で測るのは精度で、まだ時間の節約ではありません。
30日目から60日目、監督付きの本番稼働。 エージェントが実行し、取り消せないものはすべて人が承認します。承認率が次に注目すべき指標になります。ほぼすべて承認されるなら自律性を広げます。修正が頻繁なら、ワークフローの境界が見つかったということで、たとえパイロットが終わっても有益な結果です。
60日目から90日目、判断。 事前に書いておいた3つの結末があります。次のワークフローへ拡大する、具体的な修正と新しい期日を決めて1回だけ延長する、または中止する。「続けて様子を見る」は選択肢にありません。それこそが40%を40%にする道です。
セキュリティ部門と法務部門が尋ねること
最初の打ち合わせの前にこれをまとめておけば、数週間を短縮できます。
- モデルの質問。 どのモデルを、どの提供元から、どの規約で使い、自社のデータで学習するのか。
- データの流れ。 何が自社の環境から出て、どこに届き、どれだけ保持され、どう削除されるのか。
- 再委託先の一覧。 カテゴリではなく名前で。
- アクセスと取り消し。 自社で付与し自社で取り消せるプラットフォーム標準のロールか、ベンダーが保持する認証情報か。前者のほうがはるかに承認しやすいです。
- 監査証跡。 エージェントが何を、いつ、誰の権限で行ったかを、ベンダーに尋ねずに自社で読めること。
- 人による承認の境界。 どの操作に人が必要かを書面で。Deloitteが2026年にIT部門と事業部門のリーダー3,235人を調査したところ、成熟したエージェント型AIのガバナンスモデルを持つのは21%のみで、判断の境界、リアルタイム監視、監査証跡が欠けている要素として挙げられました。審査担当者はこれを知っています。
- 規制への対応。 EUで事業を行っている場合、Digital Omnibusの合意によりAI法の高リスク義務の大半は2027年12月と2028年8月に延期されましたが、第50条の透明性義務は2026年8月2日から引き続き適用されます。これには、人がAIシステムとやり取りしていることの開示も含まれます。エージェントがどのように自らを開示するのかをベンダーに尋ねてください。
よく見るパイロット設計の失敗
高コストなワークフローを手作業のまま残し、面白いワークフローを自動化する。 面白いものはデモ映えします。高コストなものは、次の3つの資金になります。
ベースラインがない。 事前の数字がなければ、事後の数字はすべて議論の種になります。
成功を「動くこと」と定義する。 デモではいつも動きます。数字を定義してください。
失敗できないパイロット。 止める基準がないなら、買ったのはパイロットではなく初回の分割払いです。
同じワークフローで2社のベンダーを同時に走らせる。 厳密に見えて、そうではありません。どちらもきれいなデータを得られず、互いに相手のせいにし、倍の費用で学びは減ります。
当社の自社運用で行っていること
当社はこの組み立て方を自社にも適用しています。社内のエージェント群はチーム全体で週50時間以上を取り戻しており、範囲を絞ったワークフローを1つずつ構築し、毎週見直し、取り消せない操作はすべて人が承認しています。また、AIエージェントが外部システムを呼び出すための標準であるModel Context Protocol(MCP)の公開サーバーをmcp.strataigize.comで運用しており、エージェントが当社のビジネスに直接問い合わせできます。これを運用している代理店は他に見つかっていません。まず自分たちが必要としたから存在しています。
だからこそ、最初のワークフローの価格を真顔で提示できます。スライドの上だけでなく、自社の運用でこの取り組みの9か月目の姿をすでに経験しているからです。

よくある質問
AIエージェントのパイロットはどれくらいの期間実施すべきですか?
30日から90日です。30日より短いと目新しさを測ることになります。判断なしに90日を超えると、パイロットがプロジェクトそのものになります。これはGartnerの中止データが示す失敗パターンです。
AIエージェントのパイロットは有償にすべきですか?
はい。無償のパイロットには双方の余力が割り当てられ、何とも比較されないため、デモで終わり、判断が下されることはありません。単一ワークフローの価格で行う有償の範囲を絞ったパイロットなら、本物の人員と本物の成功指標が得られます。
妥当な中止基準とは?
目標指標のおよそ半分から3分の2です。下回れば明らかにワークフローの準備ができていないと言える程度に高く、1週間の不調を乗り切れる程度に低く設定します。正確な数字よりも、それが書面になっていること、判断する人が指名されていることのほうが重要です。
社内でパイロットの責任者になるべきなのは誰ですか?
今そのワークフローを担当している1人です。委員会でも、AI好きの人でもありません。その人は例外を知っていて、出力が正しいかを判断でき、時間が本当に戻ってきたかについて正直に話してくれます。
開始前にベンダーに何を尋ねるべきですか?
全リストはAIエージェントベンダーに尋ねるべき24の質問にあります。そもそもベンダーを使うかどうかを検討中なら、自社開発か購入かから始めてください。
当社と一緒に実施する
当社はまさにこの方法でパイロットの範囲を決めます。1つのワークフロー、固定価格、書面の成功指標、合意した中止基準、事前に回答したセキュリティ。グロース監査を予約いただければ、最も価値の高いワークフローを特定します。または、当社のAIエージェント開発の進め方をご覧ください。
お問い合わせ