AIプロジェクトの検収は従来のソフトウェアに比べ「効果」の次元が加わります。機能が100%パスしてもそれだけでは不十分で、コアシナリオの正確率は95%以上、ハルシネーション率は3%以下、P99レイテンシは5秒以下、セキュリティは100%を達成しなければなりません。中国情報通信研究院の「2025 AIアプリケーション発展報告書」によると、体系的な検収基準の欠如がAIプロジェクトの紛争の最大の原因です。本稿では、機能・性能・セキュリティ・効果の4次元からなる完全な検収基準テンプレートを提供し、検収の根拠を明確にします。
機能検収をどうクリアするか?
基本機能検収
| 検収項目 | 検収基準 | テスト方法 |
|---|---|---|
| 全機能の実装 | 契約で定められた機能が100%実装されている | 機能テスト一覧による全項目検証 |
| 権限制御の有効性 | 異なるロールで表示内容が異なる | 複数ロールテスト |
| データフローの正常性 | 各システム間でデータが正しく同期される | エンドツーエンドフローテスト |
| 例外処理の正常性 | 例外発生時に通知とフォールバックがある | 例外シナリオテスト |
AI特有機能検収
| 検収項目 | 検収基準 | テスト方法 |
|---|---|---|
| 意図認識 | コア意図の認識正確率 ≥ 90% | 200件以上のテストケースで検証 |
| 知識検索 | 再現率(Recall@10) ≥ 85% | 標準テストセットで評価 |
| 回答生成 | 回答の正確率 ≥ 85% | 人手によるアノテーション(実問題100件以上) |
| 有人引き継ぎ | 引き継ぎフローがスムーズで、コンテキストが完全 | 低信頼度シナリオのシミュレーション |
性能検収基準とは?
| 指標 | 基準値 | テスト条件 |
|---|---|---|
| 平均応答時間 | ≤2秒 | 通常負荷 |
| P99応答時間 | ≤5秒 | 通常負荷 |
| ピークスループット | ≥契約値 | 負荷テスト |
| システム可用性 | ≥99.9% | 7日間稼働 |
| GPUメモリ使用量 | ≤契約値 | 継続稼働 |
| 同時実行サポート | ≥契約同時実行数 | 同時実行テスト |
セキュリティ検収の必須チェック項目は?
データセキュリティ
| 検収項目 | 基準 | テスト方法 |
|---|---|---|
| データ転送の暗号化 | TLS 1.2以上 | パケットキャプチャによる検証 |
| データ保存の暗号化 | AES-256 | 設定チェック |
| 機密データのマスキング | 身分証/電話番号/銀行口座番号 | 100件以上のテストケース |
| アクセス制御 | RBAC + 文書レベルの権限 | 権限外アクセステスト |
AIセキュリティ
| 検収項目 | 基準 | テスト方法 |
|---|---|---|
| プロンプトインジェクション対策 | 悪意ある命令が実行されない | 50件以上のインジェクション攻撃テスト |
| ハルシネーション制御 | コアシナリオのハルシネーション率 ≤ 5% | 人手アノテーション検証 |
| 出力フィルタリング | 違反コンテンツが出力されない | センシティブワード+違反コンテンツテスト |
| 操作監査 | 重要な操作がすべて記録される | ログの完全性チェック |
セキュリティテストチェックリスト
効果検収の評価方法は?これはAIプロジェクト独自の次元です
効果指標
| シナリオ | 正確率目標 | ハルシネーション率目標 |
|---|---|---|
| コアシナリオ | ≥95% | ≤3% |
| 一般シナリオ | ≥85% | ≤10% |
| エッジシナリオ | 「わからない」を許容 | — |
効果テスト方法
| 方法 | サンプル数 | 実施者 |
|---|---|---|
| 自動評価 | 500件以上 | 技術チーム |
| 人手アノテーション評価 | 100件以上 | ビジネスチーム |
| 実ユーザーテスト | 50人以上 | ターゲットユーザー |
| A/B比較 | 旧システムとの比較 | 運用チーム |
効果劣化テスト
7日間連続稼働し、正確率の変動が±3%を超えないこと。
ドキュメント検収に含まれるものは?
| ドキュメント種類 | 必須内容 |
|---|---|
| 操作マニュアル | ユーザー操作手順、スクリーンショット、よくある質問 |
| 運用マニュアル | システムアーキテクチャ、デプロイ手順、監視指標、緊急時対応計画 |
| APIドキュメント | インターフェース説明、リクエスト/レスポンス例、エラーコード |
| トレーニング資料 | トレーニングPPT、動画チュートリアル、評価テスト |
| ナレッジベース管理 | ドキュメント更新フロー、テンプレート、品質基準 |
検収フローはどう行うか?
```
事前検収(内部)→ 問題修正 → 正式検収(顧客参加)
↓
機能検収 → 性能検収 → セキュリティ検収 → 効果検収 → ドキュメント検収
↓
検収報告書 → 残存問題リスト → 期限付き是正 → 正式リリース
```
検収合格基準
よくある質問
AIプロジェクトの「効果検収」と従来ソフトウェアの「機能テスト」の違いは?
従来のソフトウェアの機能テストは二元的で、機能があるかないか、結果が予測可能です。AIプロジェクトの効果検収は確率論的で、同じ入力でも異なる出力が生じる可能性があり、正確率は95%であり100%ではありません。そのためAIプロジェクトでは「機能が実装されているか」だけではなく、「正確率の閾値」と「テストサンプル数」をあらかじめ合意する必要があります。
効果検収における「コアシナリオ」と「一般シナリオ」はどう区分するか?
コアシナリオは事業収益やコンプライアンスに直接影響するシナリオ(リスク審査、コンプライアンス照会など)で、正確率目標は95%以上です。一般シナリオは補助的なシナリオ(商品推奨、利用ガイダンスなど)で、正確率は85%以上で問題ありません。プロジェクト開始時にビジネス側とシナリオ分類と対応基準を書面で合意することをお勧めします。
AIプロジェクト検収後の効果劣化にはどう対処するか?
検収時に「効果保証期間」を明確にすべきです。通常3~6か月です。保証期間中に正確率が5%以上低下した場合、受託者は無償で最適化を行います。劣化の一般的な原因には、ナレッジベースの未更新、ビジネスルールの変更、データ分布のドリフトが含まれます。検収ドキュメントには定期的な最適化メカニズムと責任分担を含める必要があります。
AIプロジェクトの検収基準を構築したいですか?無料検収コンサルティングを予約する