Развернём open-weight LLM в вашем контуре

Открытые модели — DeepSeek, Qwen, GLM, Kimi (включая K3) — на ваших GPU или в вашем ЦОДе. Данные и код не покидают периметр. Разработчики получают OpenAI-совместимый API с первого дня пилота. Железо не продаём и в своё облако не тянем: это услуга внедрения, наш шлюз-стек и сопровождение по подписке.

Пара строк в @ruchkadev_bot — задачи и железо, если оно уже есть. Отвечаем в течение дня; дальше NDA и sizing-звонок.

Когда on-premise — не прихоть, а условие

периметр

СБ запретила внешние API — команда просит LLM

Данные и код не могут покидать контур, облачные API под запретом, а разработчики видят, насколько быстрее работают коллеги с моделями.

модели

Открытые веса мирового уровня уже выложены

DeepSeek, Qwen, Kimi публикуют веса, которые всерьёз конкурируют с закрытыми флагманами. Но между весами на Hugging Face и рабочим API в проде — месяцы инженерной работы.

самосбор

Свой vLLM силами девопса — проект без хозяина

Развернуть — полдела. Обновлять модели, держать пропускную способность, выдавать ключи и лимиты командам, считать расход — этим кто-то должен жить.

Что вы получаете

Не человеко-месяцы «цифровой трансформации», а инфраструктурный слой с конкретным результатом: модель работает, API отвечает, расход считается.

  • Модель под ваше железо

    От Gemma на одной GPU до DeepSeek и Kimi K3 полного размера на кластере. Сначала sizing, потом обещания: считаем от ваших задач и бюджета VRAM.

  • Рабочий API с первого дня пилота

    vLLM-инференс и шлюз Ручки поверх: OpenAI-совместимый /v1 внутри вашей сети, ключи по командам, лимиты расходов, метеринг. Шлюз — тот же, что держит прод облачной Ручки. API появляется в начале пилота, а не в конце проекта.

  • Агентский кодинг в периметре

    Cline, Codex CLI, Continue и любые OpenAI-совместимые инструменты подключаются штатными конфигами — агент пишет код, не вынося его из контура.

  • Сопровождение по подписке

    Обновления моделей вслед за релизами, тюнинг пропускной способности, инженер на связи по-русски, SLA по договору. Закрывающие документы каждый месяц.

Какое железо под какую модель

Ориентир, а не спека: точный sizing зависит от квантизации, контекста и нагрузки — его мы считаем на втором шаге, по вашим задачам.

Класс модели
Примеры
Железо-ориентир
Компактные
Gemma, Qwen до ~14B
одна GPU на 24–48 ГБ
Средние
Qwen3.6-coder, GLM
1–2 GPU на 80 ГБ
Флагманские MoE
DeepSeek, Kimi K3
кластер от 8 ускорителей

Периметр — всерьёз

Стек работает полностью без выхода в интернет: обновления моделей привозим офлайн-пакетами. Логи — только метаданные (время, модель, токены, ключ), и они ваши, на вашем железе. Доступ на внедрении — по вашим правилам: работаем на площадке или руками ваших инженеров под нашим руководством; постоянный удалённый доступ в контур нам не нужен. После внедрения стек остаётся у вас и работает без нас: подписка — это обновления и инженер на связи, а не привязка. Для 152-ФЗ это значит простую вещь: данные не передаются третьим лицам и не пересекают границу — по архитектуре, а не по оговорке в оферте.

Как проходит внедрение

Обещаний «пилот за неделю» здесь не будет: сроки зависят от доступа в контур и готовности железа. Ориентир: sizing считается днями, пилот — неделями. Точный срок фиксируем до старта — вместе с ценой.

  1. 01

    Заявка и NDA

    Пара строк в бот: задачи, железо (если уже есть), ограничения периметра. Подписываем NDA, разбираем детали.

  2. 02

    Sizing

    Аудит вашего железа или спека под закупку: какая модель, в каком кванте, с какой пропускной способностью встанет в ваш бюджет VRAM.

  3. 03

    Пилот на вашем железе

    Фиксированная цена и критерии приёмки, согласованные до старта: модели, скорость, инструменты, которые должны заработать.

  4. 04

    Прод и сопровождение

    Внедрение по согласованному объёму работ — фикс; дальше подписка на сопровождение. Стек остаётся у вас и работает без нас.

А если контур вам не нужен

Если данные могут ходить наружу, а нужен просто доступ к топ-моделям в рублях — это облачная Ручка: Claude, GPT, Gemini и открытые модели по API, без внедрения. А когда нужно и то и другое, работает гибрид: формат API один, секретное — в контуре, остальное — в облаке, инструменты различают их одной строкой конфига.

Кто это делает

Ручка — команда, которая держит в проде облачный шлюз инференса: тот же OpenAI-совместимый /v1, ключи, лимиты и метеринг под живой ежедневной нагрузкой. В ваш контур приезжает этот стек, а не прототип, собранный под ваш проект. Стены логотипов не покажем — контурное направление новое; вместо неё — пилот с фиксированной ценой и критериями приёмки, согласованными до старта. Договор — с российским юрлицом.

То, что спрашивают до пилота

  • Флагманские открытые MoE-модели полного размера требуют кластер от восьми ускорителей класса 80 ГБ; компактные модели работают на одной серверной GPU. Точный ответ даёт sizing: считаем от задач, нагрузки и квантизации, а не от «какая модель моднее». Железо не продаём — дадим спеку под закупку у вашего поставщика.

Модель в периметре — а не данные наружу

NDA, sizing, фикс-прайс пилота — в таком порядке.