[nevr]

On-prem LLM на GPU для финансовой компании

Финтех / LLM Infrastructure
LLM on-prem GPU vLLM Python Docker

Latency: 400ms на запрос.

## Задача

Финансовая компания хотела использовать LLM для анализа документов и внутреннего поиска, но данные не могли покидать контур — ни в OpenAI, ни в облако.

## Решение

Развернул GPU-сервер (NVIDIA A100): установка CUDA, Docker, vLLM, квантизация Mistral 7B и Llama 3. Fine-tuning на внутренних документах (договоры, регламенты). RAG-пайплайн с pgVector. API-совместимый с OpenAI — интеграция в существующие сервисы без переписывания.

## Результат

Latency: 400ms на запрос. Стоимость запроса: в 40x дешевле GPT-4. 100% данных внутри контура. 8 внутренних сервисов подключены к LLM через единый API за 2 недели.

## Похожие кейсы