中芸汇科技
2026-05-30
プロジェクト検収AI基準品質管理
記事のイメージ
記事のイメージ

AIプロジェクトの検収は従来のソフトウェアに比べ「効果」の次元が加わります。機能が100%パスしてもそれだけでは不十分で、コアシナリオの正確率は95%以上、ハルシネーション率は3%以下、P99レイテンシは5秒以下、セキュリティは100%を達成しなければなりません。中国情報通信研究院の「2025 AIアプリケーション発展報告書」によると、体系的な検収基準の欠如がAIプロジェクトの紛争の最大の原因です。本稿では、機能・性能・セキュリティ・効果の4次元からなる完全な検収基準テンプレートを提供し、検収の根拠を明確にします。

機能検収をどうクリアするか?

基本機能検収

検収項目検収基準テスト方法
全機能の実装契約で定められた機能が100%実装されている機能テスト一覧による全項目検証
権限制御の有効性異なるロールで表示内容が異なる複数ロールテスト
データフローの正常性各システム間でデータが正しく同期されるエンドツーエンドフローテスト
例外処理の正常性例外発生時に通知とフォールバックがある例外シナリオテスト

AI特有機能検収

検収項目検収基準テスト方法
意図認識コア意図の認識正確率 ≥ 90%200件以上のテストケースで検証
知識検索再現率(Recall@10) ≥ 85%標準テストセットで評価
回答生成回答の正確率 ≥ 85%人手によるアノテーション(実問題100件以上)
有人引き継ぎ引き継ぎフローがスムーズで、コンテキストが完全低信頼度シナリオのシミュレーション

性能検収基準とは?

指標基準値テスト条件
平均応答時間≤2秒通常負荷
P99応答時間≤5秒通常負荷
ピークスループット≥契約値負荷テスト
システム可用性≥99.9%7日間稼働
GPUメモリ使用量≤契約値継続稼働
同時実行サポート≥契約同時実行数同時実行テスト

セキュリティ検収の必須チェック項目は?

データセキュリティ

検収項目基準テスト方法
データ転送の暗号化TLS 1.2以上パケットキャプチャによる検証
データ保存の暗号化AES-256設定チェック
機密データのマスキング身分証/電話番号/銀行口座番号100件以上のテストケース
アクセス制御RBAC + 文書レベルの権限権限外アクセステスト

AIセキュリティ

検収項目基準テスト方法
プロンプトインジェクション対策悪意ある命令が実行されない50件以上のインジェクション攻撃テスト
ハルシネーション制御コアシナリオのハルシネーション率 ≤ 5%人手アノテーション検証
出力フィルタリング違反コンテンツが出力されないセンシティブワード+違反コンテンツテスト
操作監査重要な操作がすべて記録されるログの完全性チェック

セキュリティテストチェックリスト

  • [ ] ペネトレーションテスト:高リスク脆弱性なし
  • [ ] 権限外アクセステスト:ロールを越えたアクセスがすべて遮断される
  • [ ] インジェクションテスト:プロンプトインジェクション攻撃がすべて防御される
  • [ ] データ漏洩テスト:機密データがシステム外に出ない
  • 効果検収の評価方法は?これはAIプロジェクト独自の次元です

    効果指標

    シナリオ正確率目標ハルシネーション率目標
    コアシナリオ≥95%≤3%
    一般シナリオ≥85%≤10%
    エッジシナリオ「わからない」を許容

    効果テスト方法

    方法サンプル数実施者
    自動評価500件以上技術チーム
    人手アノテーション評価100件以上ビジネスチーム
    実ユーザーテスト50人以上ターゲットユーザー
    A/B比較旧システムとの比較運用チーム

    効果劣化テスト

    7日間連続稼働し、正確率の変動が±3%を超えないこと。

    ドキュメント検収に含まれるものは?

    ドキュメント種類必須内容
    操作マニュアルユーザー操作手順、スクリーンショット、よくある質問
    運用マニュアルシステムアーキテクチャ、デプロイ手順、監視指標、緊急時対応計画
    APIドキュメントインターフェース説明、リクエスト/レスポンス例、エラーコード
    トレーニング資料トレーニングPPT、動画チュートリアル、評価テスト
    ナレッジベース管理ドキュメント更新フロー、テンプレート、品質基準

    検収フローはどう行うか?

    ```

    事前検収(内部)→ 問題修正 → 正式検収(顧客参加)

    機能検収 → 性能検収 → セキュリティ検収 → 効果検収 → ドキュメント検収

    検収報告書 → 残存問題リスト → 期限付き是正 → 正式リリース

    ```

    検収合格基準

  • 機能検収 100%合格
  • 性能検収 100%合格
  • セキュリティ検収 100%合格
  • 効果検収 コアシナリオ100%合格、一般シナリオ90%以上合格
  • ドキュメント検収 100%合格
  • P0レベルの未解決問題がない
  • よくある質問

    AIプロジェクトの「効果検収」と従来ソフトウェアの「機能テスト」の違いは?

    従来のソフトウェアの機能テストは二元的で、機能があるかないか、結果が予測可能です。AIプロジェクトの効果検収は確率論的で、同じ入力でも異なる出力が生じる可能性があり、正確率は95%であり100%ではありません。そのためAIプロジェクトでは「機能が実装されているか」だけではなく、「正確率の閾値」と「テストサンプル数」をあらかじめ合意する必要があります。

    効果検収における「コアシナリオ」と「一般シナリオ」はどう区分するか?

    コアシナリオは事業収益やコンプライアンスに直接影響するシナリオ(リスク審査、コンプライアンス照会など)で、正確率目標は95%以上です。一般シナリオは補助的なシナリオ(商品推奨、利用ガイダンスなど)で、正確率は85%以上で問題ありません。プロジェクト開始時にビジネス側とシナリオ分類と対応基準を書面で合意することをお勧めします。

    AIプロジェクト検収後の効果劣化にはどう対処するか?

    検収時に「効果保証期間」を明確にすべきです。通常3~6か月です。保証期間中に正確率が5%以上低下した場合、受託者は無償で最適化を行います。劣化の一般的な原因には、ナレッジベースの未更新、ビジネスルールの変更、データ分布のドリフトが含まれます。検収ドキュメントには定期的な最適化メカニズムと責任分担を含める必要があります。

    AIプロジェクトの検収基準を構築したいですか?無料検収コンサルティングを予約する