中芸汇科技
2026-05-30
Приемка проектаСтандарты AIУправление качеством
Иллюстрация к статье
Иллюстрация к статье

Приемка AI-проектов добавляет к традиционным критериям измерение «эффективность» — прохождения всех функций недостаточно: точность в ключевых сценариях ≥95%, уровень галлюцинаций ≤3%, задержка P99 ≤5 секунд, безопасность 100%. Согласно отчёту Китайской академии информационно-коммуникационных технологий «Развитие AI-приложений 2025», отсутствие системных критериев приёмки — главная причина споров вокруг AI-проектов. Эта статья предлагает полный шаблон четырёхмерных критериев приёмки: функциональность, производительность, безопасность, эффективность — чтобы приёмка велась на основе объективных данных.

Как пройти функциональную приёмку?

Приёмка базовой функциональности

Элемент проверкиКритерий приёмкиМетод тестирования
Реализованы все функциональные точки100% функций, оговоренных в контрактеПоэлементная проверка по чек-листу функций
Действует разграничение правРазные роли видят разный контентТестирование с несколькими ролями
Корректная передача данныхДанные корректно синхронизируются между системамиСквозное тестирование процессов
Корректная обработка исключенийПри ошибках выводятся сообщения и предусмотрены запасные сценарииТестирование исключительных ситуаций

Приёмка специфичных для AI функций

Элемент проверкиКритерий приёмкиМетод тестирования
Распознавание намеренийТочность распознавания основных намерений ≥90%Проверка на 200+ тестовых примерах
Поиск знанийПолнота (Recall@10) ≥85%Оценка на стандартном тестовом наборе
Генерация ответовТочность ответов ≥85%Ручная разметка 100+ реальных вопросов
Переход на оператораПлавный процесс передачи, контекст сохраняется полностьюМоделирование сценариев с низкой уверенностью

Каковы критерии приёмки по производительности?

ПоказательЦелевое значениеУсловия тестирования
Среднее время отклика≤2 сек.Нормальная нагрузка
Время отклика P99≤5 сек.Нормальная нагрузка
Пиковая пропускная способность≥ значение, указанное в контрактеНагрузочное тестирование
Доступность системы≥99,9%Работа в течение 7 дней
Использование памяти GPU≤ значение, указанное в контрактеНепрерывная работа
Поддержка параллельных подключений≥ количество, указанное в контрактеТестирование параллельного доступа

Какие обязательные проверки безопасности?

Безопасность данных

Элемент проверкиСтандартМетод тестирования
Шифрование при передаче данныхTLS 1.2+Проверка захваченных пакетов
Шифрование при хранении данныхAES-256Проверка конфигурации
Маскирование чувствительных данныхНомера паспортов / мобильных телефонов / банковских карт100+ тестовых примеров
Контроль доступаRBAC + права на уровне документовТестирование на повышение привилегий

Безопасность AI

Элемент проверкиСтандартМетод тестирования
Защита от внедрения в промпты (Prompt Injection)Вредоносные инструкции не выполняются50+ атак с внедрением
Контроль галлюцинацийУровень галлюцинаций в ключевых сценариях ≤5%Ручная разметка
Фильтрация выводаЗапрещённый контент не выводитсяТестирование на чувствительные слова и запрещённый контент
Аудит операцийПолное протоколирование всех критических операцийПроверка полноты журналов

Чек-лист тестирования безопасности

  • [ ] Тест на проникновение: нет уязвимостей высокого уровня
  • [ ] Тест на повышение привилегий: все попытки межролевого доступа блокируются
  • [ ] Тест на внедрение: все атаки с внедрением в промпты отражены
  • [ ] Тест на утечку данных: конфиденциальные данные не покидают систему
  • Как оценивается приёмка по эффективности? Это уникальное измерение для AI-проектов

    Показатели эффективности

    СценарийЦелевая точностьЦелевой уровень галлюцинаций
    Ключевые сценарии≥95%≤3%
    Обычные сценарии≥85%≤10%
    Нетипичные сценарииДопускается ответ «не знаю»

    Методы тестирования эффективности

    МетодОбъём выборкиИсполнитель
    Автоматизированная оценка500+ записейТехническая команда
    Ручная экспертная оценка100+ записейБизнес-команда
    Тестирование реальными пользователями50+ человекЦелевые пользователи
    A/B-сравнениеСравнение со старой системойКоманда эксплуатации

    Тест на деградацию эффективности

    При непрерывной работе в течение 7 дней колебания точности не должны превышать ±3%.

    Что включает документационная приёмка?

    Тип документаОбязательное содержание
    Руководство пользователяПошаговые инструкции, скриншоты, часто задаваемые вопросы
    Руководство по эксплуатацииАрхитектура системы, шаги развёртывания, показатели мониторинга, план аварийного восстановления
    Документация APIОписание интерфейсов, примеры запросов/ответов, коды ошибок
    Обучающие материалыПрезентации, видеоуроки, контрольные вопросы
    Управление базой знанийПроцесс обновления документов, шаблоны, стандарты качества

    Как строится процесс приёмки?

    ```

    Предварительная приёмка (внутренняя) → Исправление проблем → Официальная приёмка (с участием заказчика)

    Приёмка функций → Приёмка производительности → Приёмка безопасности → Приёмка эффективности → Приёмка документации

    Отчёт о приёмке → Список оставшихся проблем → Исправление в заданный срок → Официальный запуск

    ```

    Критерии прохождения приёмки

  • Функциональная приёмка пройдена на 100%
  • Приёмка по производительности на 100%
  • Приёмка по безопасности на 100%
  • Приёмка по эффективности: ключевые сценарии — 100%, обычные сценарии — ≥90%
  • Документационная приёмка на 100%
  • Нет оставшихся проблем уровня P0
  • Часто задаваемые вопросы

    Чем «приёмка по эффективности» AI-проекта отличается от «функционального тестирования» традиционного ПО?

    Функциональное тестирование традиционного ПО бинарно — функция либо есть, либо нет, результат предсказуем. Приёмка по эффективности AI-проекта носит вероятностный характер — один и тот же ввод может давать разные результаты, точность составляет 95%, а не 100%. Поэтому для AI-проекта необходимо согласовать «порог точности» и «объём тестовой выборки», а не просто факт «реализована ли функция».

    Как разделяются «ключевые сценарии» и «обычные сценарии» при приёмке эффективности?

    Ключевые сценарии — это те, которые напрямую влияют на доходность бизнеса или соблюдение нормативных требований (например, проверка рисков, комплаенс-запросы), целевая точность ≥95%. Обычные сценарии — вспомогательные (рекомендации товаров, инструкции по использованию), достаточно точности ≥85%. Рекомендуется на старте проекта письменно согласовать с заказчиком классификацию сценариев и соответствующие стандарты.

    Что делать, если после приёмки эффективность AI снижается?

    При приёмке следует определить «гарантийный период эффективности» — обычно 3–6 месяцев. Если в течение гарантии точность упадёт более чем на 5%, исполнитель обязан провести бесплатную оптимизацию. Частые причины деградации: необновлённая база знаний, изменение бизнес-правил, дрейф распределения данных. В документацию приёмки необходимо включить механизм регулярной оптимизации и распределение ответственности.

    Хотите разработать критерии приёмки AI-проекта? Запишитесь на бесплатную консультацию