Локальная LLM в Беларуси: on-prem ИИ для бизнеса
Последнее обновление: 7 июня 2026
Автор: Специалисты Novacom Systems · направление Document Intelligence
Что такое локальная LLM и зачем on-prem
Локальная LLM (on-premises LLM) — большая языковая модель, которая развёрнута на инфраструктуре самой организации (на её серверах или в закрытом контуре) и работает без обращения к внешним облачным сервисам. В противоположность этому облачная LLM — это API: текст запроса уходит на серверы поставщика (часто за рубежом), там обрабатывается и возвращается ответом.
Пример: юридический отдел загружает в чат-ассистента договоры с персональными данными контрагентов. В облачном варианте эти договоры физически покидают организацию и страну. В локальном варианте модель работает на сервере внутри периметра компании, и ни один документ наружу не уходит.
Три причины, по которым белорусские компании переходят на локальную LLM, не связаны с модой на ИИ. Первая — конфиденциальность: данные не передаются третьим лицам и не покидают организацию. Вторая — регуляторная чистота: on-prem проще согласуется с Законом № 99-З и банковской тайной. Третья — экономика на объёме: при большом потоке запросов собственное железо окупается против облачной подписки.
Принципиальное отличие для белорусской компании в том, где оказываются данные. Отправка корпоративных документов в зарубежный облачный ИИ — это, с точки зрения закона, трансграничная передача данных. Локальное развёртывание этот вопрос закрывает: передачи попросту не происходит.
Локальная LLM — это не «ChatGPT у себя на сервере». Это отдельный класс решений: открытая модель, собственное железо, инфраструктура поиска по корпоративным данным и контроль над всем стеком. Новаком разворачивает подобные системы в составе продукта DIRECTUM Bel и отдельной AI-платформы.
Когда локальная LLM действительно нужна
Локальная LLM — недешёвое решение, и разворачивать её «потому что у всех ИИ» не нужно. Есть сценарии, где on-prem оправдан, и сценарии, где облако объективно дешевле и быстрее.
On-prem оправдан, когда: вы работаете с конфиденциальными или персональными данными — договорами, медицинскими сведениями, кадровыми документами, где утечка во внешний сервис недопустима; вы связаны банковской, налоговой или коммерческой тайной; у вас большой и постоянный поток запросов; вам нужен поиск и генерация ответов по внутренней базе документов — сценарий RAG.
Определение. RAG (Retrieval-Augmented Generation) — архитектура, в которой LLM сначала находит релевантные фрагменты в корпоративном хранилище, а затем формирует ответ на их основе. Это снижает «галлюцинации» и позволяет ссылаться на источник, поэтому RAG — основной способ применить LLM к собственным документам компании.
Пример: банк строит внутреннего ассистента, который отвечает сотрудникам на вопросы по кредитным договорам, извлекая суммы, даты и стороны из десятков тысяч документов. Данные не могут уходить наружу из-за банковской тайны, объём запросов высокий — это эталонный кейс для on-prem.
Облако достаточно, когда: задачи разовые или редкие, объём небольшой, а данные публичны и не содержат тайны. Платить за облачный API при сотне запросов в день дешевле, чем содержать сервер с видеокартой и инженера.
| Признак задачи | Локальная LLM | Облачный ИИ |
|---|---|---|
| Конфиденциальные / персональные данные | Да | Рискованно |
| Банковская, налоговая, коммерческая тайна | Да | Нет |
| Большой постоянный объём запросов | Окупается | Дорого на масштабе |
| Разовые задачи, публичные данные | Избыточно | Дешевле |
| Поиск по внутренней базе (RAG) | Да | Зависит от данных |
Связь с корпоративными данными здесь прямая: чем больше у компании внутреннего электронного документооборота, тем сильнее аргумент держать ИИ внутри периметра.
Регуляторное обоснование под РБ
Это ключевой раздел для белорусской компании. Главный тезис: в Беларуси аргумент в пользу локальной LLM проще, чем принято считать, потому что регулирование устроено иначе, чем в соседних странах.
Нет требования локализации данных. Закон Республики Беларусь от 7 мая 2021 г. № 99-З «О защите персональных данных» (действует с 15 ноября 2021 г.) не содержит общего требования хранить персональные данные на серверах внутри страны. Регулятор — Национальный центр защиты персональных данных (НЦЗПД). Это значит, что выбор инфраструктуры и модели у белорусской компании свободнее: закон не обязывает использовать «отечественное» решение и не привязывает обработку к территории.
Но свобода в локализации не означает свободу в передаче данных за рубеж. Здесь вступает в силу регулирование трансграничной передачи.
Определение. Трансграничная передача персональных данных — передача данных оператором на территорию иностранного государства. По статье 9 Закона № 99-З она допускается свободно только в государства, обеспечивающие надлежащий уровень защиты прав субъектов.
Перечень таких государств установлен Приказом НЦЗПД от 15 ноября 2021 г. № 14: это участники Конвенции Совета Европы № 108 (Страсбург, 28 января 1981 г.) и государства ЕАЭС — порядка 55 стран, включая Россию, страны ЕАЭС и ЕС. Передача в страны вне этого перечня требует отдельного разрешения НЦЗПД: нужно подать заявление и согласованный проект договора о трансграничной передаче. За незаконную обработку, включая неправомерную трансграничную передачу, для юридических лиц предусмотрен административный штраф — до 50 базовых величин.
Отсюда практический вывод. Когда сотрудник загружает документ с персональными данными в зарубежный облачный ИИ, серверы которого не входят в перечень, — это потенциально незаконная трансграничная передача без основания. Локальная LLM снимает вопрос целиком: данные не покидают организацию, передачи не происходит, разрешение НЦЗПД не требуется. Это самый чистый путь соответствия.
Банковская тайна. Для банков и финансовых компаний действует статья 121 Банковского кодекса (Кодекс № 441-З от 25 октября 2000 г.): банки гарантируют тайну счетов, вкладов, операций и сведений о клиентах, а раскрытие допускается только в установленных законом случаях. Передача таких сведений во внешний облачный сервис — прямой риск нарушения. On-prem развёртывание в закрытом контуре этот риск устраняет.
Будущий закон об ИИ. Отдельного закона об искусственном интеллекте в Беларуси пока нет, но он разрабатывается. Концепцию проекта планируют включить в план подготовки на 2026 год; среди разработчиков — Национальный центр законодательства и правовой информации, Национальная академия наук, Оперативно-аналитический центр при Президенте и Министерство связи. Указом Президента от 1 апреля 2025 г. № 135 цифровые технологии и ИИ отнесены к приоритетным направлениям науки на 2026–2030 годы. В апреле 2025 года модельный закон о технологиях ИИ принят Межпарламентской ассамблеей СНГ. Компании, которая строит ИИ-систему «в контуре» уже сегодня, будущее ужесточение угрожает меньше.
Показательно, что и регулятор высшего уровня смотрит в ту же сторону: Национальный банк заявлял о планах создать Центр искусственного интеллекта для безопасного развёртывания больших языковых моделей именно «в контуре заказчика».
| Требование РБ | Как закрывает локальная LLM |
|---|---|
| 99-З, трансграничная передача (ст. 9, Приказ № 14) | Данные не покидают организацию — передачи нет |
| Банковская тайна (ст. 121 БК) | Обработка в закрытом контуре, без внешних сервисов |
| Будущий закон об ИИ | Контроль над моделью и данными как страховка |
| Конфиденциальность корпоративных данных | Полная изоляция инференса |
Дисклеймер: этот раздел носит справочный характер и не заменяет юридическую консультацию. Конкретную схему обработки данных и согласований с НЦЗПД следует проверять с юристом по вашему профилю.
Тема тесно связана с регулированием государственного документооборота — например, со СМДО и работой с обращениями граждан, где требования к данным не менее строги.
Технический стек: какие модели и какое железо
Выбор локальной LLM — это не ранжирование по рейтингам, а совмещение трёх параметров: качества на вашем языке и типе документов, объёма видеопамяти, который модель занимает, и лицензии. Ошибка большинства — сравнивать модели по бенчмаркам вроде MMLU. Эти тесты не отражают качество на русскоязычных корпоративных документах.
Критерии выбора. Первый — языковая компетентность: тестируйте модель на собственном корпусе, а не на публичных бенчмарках. Второй — footprint по видеопамяти: помещается ли модель на ваше железо. Третий — лицензия: позволяет ли она коммерческое использование и доработку. Четвёртый — контекстное окно. Пятый — зрелость экосистемы и наличие примеров интеграции.
Определение. Квантизация — сжатие весов модели с 16-битной точности до 8-битной (FP8) или 4-битной (Q4). Это уменьшает занимаемую видеопамять в два-четыре раза ценой потери точности на 1–5%, что позволяет запускать крупные модели на доступном железе.
Определение. Контекстное окно — максимальное число токенов, которое модель обрабатывает за один запрос (вместе с ответом). Окно 32 тысячи токенов — это примерно 6–8 страниц текста; для анализа длинных договоров окно критично.
Определение. Mixture of Experts (MoE) — архитектура, где вместо одной большой сети используется набор специализированных подсетей, и на каждый запрос активируется лишь часть из них. Благодаря этому модель может иметь десятки или сотни миллиардов параметров, но инференс задействует лишь малую долю, что удешевляет вычисления.
Железо удобно делить на три тира. Начальный — одна видеокарта RTX 4090 (24 ГБ): на ней работают модели 7–24B в квантизации, этого хватает для классификации и простого извлечения данных. Средний — A100 (80 ГБ): помещается Qwen3-30B-A3B и подобные, это рабочая лошадка для RAG в банке или на крупном предприятии. Старший — две H100 или эквивалент для моделей класса 70B и выше или для высокой нагрузки.
Сравнение открытых моделей 2026
К середине 2026 года основу выбора для on-prem составляют открытые модели. Ниже — проверенные характеристики ключевых вариантов. Цифры важны: на них держится решение по железу.
| Модель | Параметры (всего / активных) | Контекст | VRAM | Лицензия | Русский | Reasoning |
|---|---|---|---|---|---|---|
| Qwen3-30B-A3B | 30,5B / 3,3B (MoE) | 32K→256K | ~17 ГБ (Q4), ~30 ГБ (FP8) | Apache 2.0 | сильный | средний |
| Llama 3.3 70B | 70B (плотная) | 128K | 40+ ГБ | Llama Community | хороший | хороший |
| Mistral Small 3 | ~24B (плотная) | 32K | ~16 ГБ (Q4) | Apache 2.0 | средний | хороший |
| DeepSeek R1 | 671B / 37B (MoE) | 128K | серверная конфигурация | MIT | хороший | лучший |
| Микро (7–8B) | 7–8B | 4–32K | ~8 ГБ (Q4) | Apache/MIT | базовый | низкий |
Qwen3-30B-A3B — оптимальный баланс для большинства задач на русском языке. Это MoE-модель: из 30,5 миллиарда параметров на каждый токен активируются около 3,3 миллиарда, поэтому при квантизации Q4 она укладывается в ~17 ГБ видеопамяти и помещается даже на одну карту с 24 ГБ. Нативное контекстное окно — 32 тысячи токенов, расширяется до 131 тысячи и более. Лицензия Apache 2.0 разрешает коммерческое использование и дообучение. Это разумный выбор по умолчанию для RAG и извлечения данных.
DeepSeek R1 (релиз 20 января 2025 г., лицензия MIT) — лидер по логике и цепочкам рассуждений, с окном в 128 тысяч токенов. Это тоже MoE: 671 миллиард параметров всего, но лишь 37 миллиардов активны на токен. Платой за качество reasoning становится скорость и потребность в серверной конфигурации из нескольких видеокарт.
Llama 3.3 70B и Mistral Small 3 — крепкие универсалы с большой экосистемой и множеством готовых примеров интеграции. Llama 3.3 70B требует 40+ ГБ видеопамяти (две RTX 4090 или A100), Mistral Small 3 при ~24B параметрах помещается в 16 ГБ при Q4. Микро-модели на 7–8B (включая русскоязычные дообучения) занимают около 8 ГБ и дают минимальную задержку — их место там, где важнее скорость и стоимость, чем точность: классификация писем, простое извлечение полей.
Контекст ЕАЭС: российские модели. GigaChat (Сбер) и YandexGPT (Яндекс) доступны компаниям региона, но их стоит оценивать трезво. Это российские модели; для Беларуси они не имеют статуса «отечественных», а их on-prem-доступность ограничена и лицензируется отдельно. Для развёртывания в закрытом контуре открытые модели практичнее: их веса у вас в руках, лицензия позволяет доработку, а зависимости от внешнего вендора нет.
«Выбор локальной модели — это не поиск победителя в рейтинге, а совмещение трёх кругов: качество на вашем типе документов, footprint на вашем железе и лицензионная чистота. Мы видели компании, которые брали самую «сильную» модель из заголовков, а потом упирались в то, что она не помещается на их сервер или слишком медленна для потока. Правильный выбор — это выбор компромисса под конкретную задачу, а не идеала из бенчмарка».
— Команда Novacom Systems · направление Document Intelligence
Сколько стоит on-prem против облака
Экономика решает не меньше, чем регуляторика. Расчёт сводится к сравнению разовых капитальных затрат на железо с регулярной оплатой облачного API.
Логика проста. Облачный ИИ берёт плату за объём — за токены. При небольшом потоке это дёшево. Но с ростом нагрузки счёт растёт линейно, тогда как собственный сервер — это разовая покупка плюс умеренные эксплуатационные расходы. В какой-то точке кривые пересекаются: это и есть точка окупаемости.
Ниже — ориентировочный иллюстративный расчёт по конфигурациям (стоимость железа в USD, цифры округлены и зависят от поставщика и курса):
| Конфигурация | GPU | Модель | Капзатраты (ориент.) | Когда оправдана |
|---|---|---|---|---|
| Light | RTX 4090 (24 ГБ) | Микро 7–8B / Mistral Small | ~$2–3 тыс. за карту | dev, классификация, малый поток |
| Enterprise | A100 (80 ГБ) | Qwen3-30B-A3B | ~$12–18 тыс. | RAG, банк, крупное предприятие |
| Enterprise+ | 2×H100 | 70B+ / высокая нагрузка | ~$50+ тыс. | большой поток, reasoning |
Эксплуатационные расходы — это инженер на поддержку (обновления модели, мониторинг, резервирование), электроэнергия и обслуживание. В белорусских условиях электричество — незначимая часть бюджета относительно стоимости видеокарт и зарплаты инженера, поэтому закладывать его как ключевой фактор не стоит.
Ключевой вывод по окупаемости: если вы уже платите за облачный ИИ ощутимые суммы при большом объёме запросов, локальная инфраструктура окупается за несколько месяцев. Если поток небольшой, а данные не требуют изоляции, — облако остаётся дешевле, и переходить на on-prem ради самого факта не нужно.
Промежуточный вариант — облако в юрисдикции Беларуси. Государственная платформа beCloud и Республиканский центр обработки данных в Минске позволяют разместить нагрузку на серверах внутри страны: это не полный on-prem, но данные остаются в белорусской юрисдикции.
Типичные ошибки при выборе локальной LLM
Этот раздел — концентрат практики. Конкурентные материалы редко говорят об ошибках вслух, а именно они дороже всего обходятся при внедрении.
Ошибка 1. «Лучшая в рейтинге — лучшая для нас». Лидер публичного бенчмарка не обязательно лучший на ваших документах. Модель, выигрывающая в тестах на логику, может проигрывать в скорости на простом извлечении данных из русскоязычных договоров. Решение: прогоните кандидатов на собственном корпусе из 100–1000 примеров до того, как делать выбор.
Ошибка 2. Недооценка контекстного окна. Окно в 8 тысяч токенов кажется достаточным, пока не попадётся договор на 50 страниц. И наоборот: окно в 128 тысяч бесполезно, если инференс при нём идёт десятки секунд. Решение: посчитайте медианный размер вашего документа в токенах и добавьте запас 20%.
Ошибка 3. Не проверили лицензию до пилота. Модель может быть открытой по коду, но иметь ограничения на коммерческое использование или контролироваться структурой, неприемлемой для вашего комплаенса. Откатывать развёрнутую интеграцию дорого. Решение: согласуйте лицензию с юристом до старта пилота, а не после.
Ошибка 4. Агрессивная квантизация без замера точности. Сжатие модели до Q4 экономит видеопамять, но может уронить точность на сложных задачах. Вы выигрываете на железе и теряете на качестве — иногда незаметно. Решение: измерьте точность в Q4 против FP8 на своей задаче и оцените цену каждого процента ошибок.
Ошибка 5. Развёртывание на dev приравнивают к production. Одна копия модели на одном сервере работает в демо. В бою нужны репликация, балансировка нагрузки, мониторинг и резервный путь — это дополнительные недели работы и железо. Решение: закладывайте 20–30% запаса в бюджет на инфраструктуру уровня production.
Use cases по отраслям в Беларуси
Где локальная LLM приносит измеримую пользу белорусским компаниям — по отраслям. Это обобщённые сценарии, а не описания конкретных клиентов.
Банки и финансовый сектор. Внутренний ассистент по кредитным и клиентским договорам: извлечение сумм, дат, сторон, поиск по базе. Банковская тайна (ст. 121 БК) исключает облако, поэтому развёртывание идёт строго в контуре. Здесь же — поддержка комплаенс-проверок и подготовка ответов на типовые запросы; в продуктовом виде этот сценарий вынесен в AI Compliance Assistant — on-prem-ассистент комплаенса для банка.
Промышленность. Поиск по технической и нормативной документации — регламентам, паспортам оборудования, инструкциям. Сотрудник задаёт вопрос на естественном языке и получает ответ со ссылкой на источник, вместо ручного перебора десятков документов. Объём документации большой, доступ должен быть быстрым — типичный сценарий для on-prem RAG.
Госсектор и организации с госучастием. Обработка обращений, классификация входящей корреспонденции, помощь в подготовке ответов с контролем сроков. Связка с государственным документооборотом (СМДО, работа с обращениями) делает локальную модель естественным расширением уже работающих систем. Ответы по внутренней базе знаний госоргана и подготовку служебных документов закрывает AI Government Knowledge.
Ритейл и услуги. Классификация и маршрутизация входящих заявок и обращений клиентов, автоматизация ответов на повторяющиеся вопросы по внутренней базе знаний. Здесь часто достаточно микро-модели на одной видеокарте — приоритет за скоростью и стоимостью.
Общий знаменатель — данные, которые нельзя или невыгодно отправлять во внешний сервис, и поток запросов, оправдывающий собственное железо. Подробнее о реализованных проектах — на странице клиентов Novacom.
Типовые сценарии — распознавание входящих документов и сравнение версий договоров — закрываются готовым модулем DIRECTUM Bel Intelligence без самостоятельного развёртывания модели. На уровне отдельного подразделения те же сценарии разобраны подробно — например, ИИ для бухгалтерии: распознавание первичных документов и сверка реквизитов на потоке.
Часто задаваемые вопросы
Чем локальная LLM отличается от ChatGPT?
ChatGPT — облачный сервис: ваш текст уходит на серверы поставщика за пределами Беларуси. Локальная LLM работает на инфраструктуре вашей компании, и данные не покидают периметр. Это разные модели владения данными и риском, а не просто «тот же ИИ на своём сервере».
Законно ли использовать облачный ИИ с персональными данными в Беларуси?
Загрузка персональных данных в зарубежный облачный сервис — это трансграничная передача. Она допустима только в государства из перечня НЦЗПД (Конвенция № 108 и ЕАЭС) либо с отдельного разрешения центра. Без основания это риск административной ответственности — штрафа до 50 базовых величин для юрлица.
Нужно ли в Беларуси хранить данные ИИ на серверах внутри страны?
Общего требования локализации персональных данных в Законе № 99-З нет — в отличие от ряда соседних стран. Но отдельные требования к хранению могут вытекать из специального законодательства, а трансграничная передача регулируется. Локальное развёртывание снимает оба вопроса.
Какая модель лучше для русского языка?
Для большинства корпоративных задач на русском хороший баланс качества и требований к железу даёт Qwen3-30B-A3B. Для сложного reasoning — DeepSeek R1, но он медленнее и требовательнее. Окончательный выбор стоит делать по тесту на вашем корпусе документов.
Какое железо минимально нужно для своей LLM?
Для старта — одна видеокарта с 24 ГБ видеопамяти (RTX 4090): на ней работают модели 7–24B в квантизации. Для серьёзного RAG в банке или на предприятии — A100 на 80 ГБ под Qwen3-30B-A3B. Модели класса 70B и выше требуют 40+ ГБ.
Можно ли начать с облака и потом перейти на on-prem?
Да. Распространённый путь — пилот на облачном API открытой модели, а при росте объёма запросов и ужесточении требований к данным — перенос на собственное железо. Переход обычно занимает несколько месяцев.
Подходит ли локальная LLM для работы с банковской тайной?
Да, и часто это единственный приемлемый вариант. Статья 121 Банковского кодекса исключает передачу сведений, составляющих банковскую тайну, во внешние сервисы. On-prem-развёртывание в закрытом контуре позволяет применять ИИ, не нарушая тайну.
Сколько стоит развернуть локальную LLM?
Ориентировочно: начальная конфигурация на одной RTX 4090 — несколько тысяч долларов за карту, конфигурация уровня предприятия на A100 — порядка $12–18 тысяч капзатрат плюс эксплуатация. Окупаемость против облака наступает на большом объёме запросов за несколько месяцев.
Обсудить on-prem AI для вашей задачи
Покажем, как развернуть локальную LLM в вашем контуре с учётом требований Закона № 99-З и банковской тайны, подберём модель и конфигурацию железа под ваш тип документов и объём запросов. Это бесплатная консультация без обязательств.
Материал подготовлен направлением Document Intelligence, Novacom Systems. Носит образовательный характер и не является юридической консультацией.