СБ запретила внешние API — команда просит LLM
Данные и код не могут покидать контур, облачные API под запретом, а разработчики видят, насколько быстрее работают коллеги с моделями.
Открытые модели — DeepSeek, Qwen, GLM, Kimi (включая K3) — на ваших GPU или в вашем ЦОДе. Данные и код не покидают периметр. Разработчики получают OpenAI-совместимый API с первого дня пилота. Железо не продаём и в своё облако не тянем: это услуга внедрения, наш шлюз-стек и сопровождение по подписке.
Пара строк в @ruchkadev_bot — задачи и железо, если оно уже есть. Отвечаем в течение дня; дальше NDA и sizing-звонок.
Данные и код не могут покидать контур, облачные API под запретом, а разработчики видят, насколько быстрее работают коллеги с моделями.
DeepSeek, Qwen, Kimi публикуют веса, которые всерьёз конкурируют с закрытыми флагманами. Но между весами на Hugging Face и рабочим API в проде — месяцы инженерной работы.
Развернуть — полдела. Обновлять модели, держать пропускную способность, выдавать ключи и лимиты командам, считать расход — этим кто-то должен жить.
Не человеко-месяцы «цифровой трансформации», а инфраструктурный слой с конкретным результатом: модель работает, API отвечает, расход считается.
От Gemma на одной GPU до DeepSeek и Kimi K3 полного размера на кластере. Сначала sizing, потом обещания: считаем от ваших задач и бюджета VRAM.
vLLM-инференс и шлюз Ручки поверх: OpenAI-совместимый /v1 внутри вашей сети, ключи по командам, лимиты расходов, метеринг. Шлюз — тот же, что держит прод облачной Ручки. API появляется в начале пилота, а не в конце проекта.
Cline, Codex CLI, Continue и любые OpenAI-совместимые инструменты подключаются штатными конфигами — агент пишет код, не вынося его из контура.
Обновления моделей вслед за релизами, тюнинг пропускной способности, инженер на связи по-русски, SLA по договору. Закрывающие документы каждый месяц.
Ориентир, а не спека: точный sizing зависит от квантизации, контекста и нагрузки — его мы считаем на втором шаге, по вашим задачам.
Стек работает полностью без выхода в интернет: обновления моделей привозим офлайн-пакетами. Логи — только метаданные (время, модель, токены, ключ), и они ваши, на вашем железе. Доступ на внедрении — по вашим правилам: работаем на площадке или руками ваших инженеров под нашим руководством; постоянный удалённый доступ в контур нам не нужен. После внедрения стек остаётся у вас и работает без нас: подписка — это обновления и инженер на связи, а не привязка. Для 152-ФЗ это значит простую вещь: данные не передаются третьим лицам и не пересекают границу — по архитектуре, а не по оговорке в оферте.
Обещаний «пилот за неделю» здесь не будет: сроки зависят от доступа в контур и готовности железа. Ориентир: sizing считается днями, пилот — неделями. Точный срок фиксируем до старта — вместе с ценой.
Пара строк в бот: задачи, железо (если уже есть), ограничения периметра. Подписываем NDA, разбираем детали.
Аудит вашего железа или спека под закупку: какая модель, в каком кванте, с какой пропускной способностью встанет в ваш бюджет VRAM.
Фиксированная цена и критерии приёмки, согласованные до старта: модели, скорость, инструменты, которые должны заработать.
Внедрение по согласованному объёму работ — фикс; дальше подписка на сопровождение. Стек остаётся у вас и работает без нас.
Если данные могут ходить наружу, а нужен просто доступ к топ-моделям в рублях — это облачная Ручка: Claude, GPT, Gemini и открытые модели по API, без внедрения. А когда нужно и то и другое, работает гибрид: формат API один, секретное — в контуре, остальное — в облаке, инструменты различают их одной строкой конфига.
Ручка — команда, которая держит в проде облачный шлюз инференса: тот же OpenAI-совместимый /v1, ключи, лимиты и метеринг под живой ежедневной нагрузкой. В ваш контур приезжает этот стек, а не прототип, собранный под ваш проект. Стены логотипов не покажем — контурное направление новое; вместо неё — пилот с фиксированной ценой и критериями приёмки, согласованными до старта. Договор — с российским юрлицом.
Флагманские открытые MoE-модели полного размера требуют кластер от восьми ускорителей класса 80 ГБ; компактные модели работают на одной серверной GPU. Точный ответ даёт sizing: считаем от задач, нагрузки и квантизации, а не от «какая модель моднее». Железо не продаём — дадим спеку под закупку у вашего поставщика.
Открытые веса: DeepSeek, Qwen, Kimi (включая Kimi K3), GLM, Gemma и другие — под вашу задачу и лицензионную политику. Обновляем вслед за релизами: свежая модель встаёт в тот же стек без переделки интеграций. Наш профиль — инференс и сопровождение готовых весов; обучение моделей под заказ — отдельное ремесло, не наше.
Да. Весь стек — vLLM и API-шлюз — работает в вашей сети и наружу не ходит; обновления моделей и стека привозим офлайн-пакетами. В логах шлюза только метаданные: время, модель, токены, ключ — и это ваши логи на вашем железе.
Модель в вашем контуре — значит, данные не передаются третьим лицам и не пересекают границу: техническую часть локализации закрывает архитектура, а не оговорки в оферте. Юридическую оценку вашей схемы обработки ПДн это не заменяет — мы инфраструктурный слой, не комплаенс-консалтинг. Договор с РФ-юрлицом, NDA, закрывающие документы.
Работает у вас и продолжит работать без нас: инференс и шлюз живут в вашем контуре, конфигурация — ваша. Подписка на сопровождение — это обновления моделей и инженер на связи, а не привязка, без которой всё остановится.
Ваши администраторы. Ключи живут в шлюзе: выдача по командам и проектам, лимиты, отзыв — всё это передаём на приёмке вместе с регламентом, наш доступ для этого не нужен. Нужна интеграция с вашим IdP (AD/SSO) — принесите требов ание на sizing, обсудим до старта, а не после.
Для этого пилот и существует: критерии приёмки согласованы до старта, и если они не выполнены — во внедрение не идём. Вы платите фикс за пилот и остаётесь с внятным отчётом: что открытые модели на вашем железе могут, чего не могут и что изменит апгрейд железа или следующий релиз весов.
Пилот и внедрение — фиксированная цена после sizing-звонка, сопровождение — месячная подписка. За токены в контуре не платите вовсе — инференс ваш. Это не ПАК и не платформенная лицензия за миллионы в год: мы собрали это под команды, у которых есть или планируются свои GPU.
Облачная Ручка — доступ к мировым топ-моделям (Claude, GPT, Gemini, открытые) по API в рублях. Контур — открытые модели на вашем железе, когда данные не могут выходить наружу. Формат API один, поэтому работает гибрид: секретное — в контуре, остальное — в облаке, один конфиг у инструментов.
Госзаказ не берём, аттестацию значимых объектов КИИ не делаем и не изображаем, что делаем. Но «ваша компания — субъект КИИ» и «ваш контур разработки — аттестованный значимый объект» — разные вещи: у банка вне топ-10 или страховой среда разработки обычно живёт вне аттестационного контура, и туда мы заходим. Если ваш случай — именно значимый объект, честно скажем «нет» на первом же звонке.
NDA, sizing, фикс-прайс пилота — в таком порядке.