Предыстория проекта
Акционерный банк обрабатывает более 100 000 кредитных заявок ежегодно. Традиционная ручная проверка документов заемщика, кредитных отчетов и финансовых данных занимала 3 дня на одну заявку, а уровень пропуска рисков составлял 3%. Количество регуляторных документов огромно, они часто обновляются, и команда комплаенс не справлялась с оперативным анализом. Банк предъявляет жесткие требования к безопасности данных – любая передача информации за пределы внутренней сети запрещена.
Ключевые проблемы
Решение
Локальное развертывание большой модели
На собственном GPU-кластере банка (8×A100) развернута модель Qwen2.5-72B. Для максимизации пропускной способности используется инференс-фреймворк vLLM. Все вычисления и передача данных осуществляются исключительно во внутренней сети, гарантируя нулевую утечку и полное соответствие требованиям CBIRC к информационной безопасности.
Интеллектуальная проверка кредитного скоринга
На основе большой модели создан помощник кредитного контроля. Он автоматически анализирует документы заемщика, кредитную историю и финансовую отчетность, перекрестно проверяет согласованность информации, выявляет факторы риска и формирует итоговый отчет.
Интеллектуальный анализ регуляторных документов
Разработана система интеллектуальной обработки комплаенс-материалов, которая автоматически интерпретирует нормативные акты, проверяет внутренние политики на соответствие и оценивает последствия изменений в регулировании.
Показатели эффективности
| Показатель | До оптимизации | После оптимизации | Улучшение |
|---|---|---|---|
| Время одобрения кредита | 3 дня | 4 часа | ↓83% |
| Уровень пропуска рисков | 3% | 0,5% | ↓83% |
| Время анализа комплаенс-документа | 2 дня/документ | 2 часа/документ | ↓88% |
| Риск утечки данных | Зависимость от третьих сторон | Нулевая утечка | ↓100% |
> Количественная сводка: эффективность одобрения кредитов выросла на 83%, уровень пропуска рисков снизился на 83%, скорость комплаенс-анализа повысилась на 88%, нулевая утечка данных полностью удовлетворяет требованиям CBIRC.
Технологический стек
Qwen2.5-72B, инференс-фреймворк vLLM, GPU-кластер NVIDIA A100, LangChain, Python, Kubernetes, изолированное развертывание во внутренней сети банка
Часто задаваемые вопросы
Сколько GPU требуется для локального развертывания большой модели в банке?
Обычно требуется от 2 до 8 GPU уровня A100/H800. В рамках проекта для модели Qwen2.5-72B используется 8 карт A100. Для модели класса 7B достаточно одной карты, для 70B рекомендуется не менее 4 карт. Все вычисления выполняются внутри банковской сети, данные не покидают периметр.
Насколько повышается скорость одобрения после локального развертывания?
Время одобрения сокращается с 3 дней до 4 часов (рост на 83%), уровень пропуска рисков снижается с 3% до 0,5% (снижение на 83%), время анализа комплаенс-документов сокращается с 2 дней на документ до 2 часов.
Соответствует ли локальное развертывание большой модели требованиям CBIRC?
Да. Все вычисления и передача данных происходят исключительно во внутренней сети банка, без какой-либо зависимости от третьих сторон, что полностью удовлетворяет требованиям CBIRC о невыходе данных за пределы организации.