Главная/Услуги

Четыре направления, одна граница ответственности

Каждое направление описано одинаково: что входит в работу, что нужно от вас, что получите на выходе и где проходит граница. В одной системе направления сочетаются: агент опирается на retrieval, работает на self-hosted inference и измеряется evals.

01 / orchestrate

Агентные системы

Агент с ограниченными инструментами, правами и точками подтверждения для работы в системах заказчика.

Что входит

  • оркестрация на runtime Protocore: цикл «рассуждение — действие», состояние между шагами, восстановление после сбоя
  • контракты инструментов: что можно вызывать и с какими правами
  • подтверждение человеком для рискованных действий
  • изоляция инструментов, проверка входа и выхода, журнал всех действий

Что нужно от вас

описание процессов, доступ к системам, с которыми работает агент, и человек, отвечающий за правила

Результат

агент с описанными контрактами, журналом действий, точками подтверждения и сценариями приёмки

Граница ответственности

поведение агента в описанных сценариях — Anchor Inference; правила бизнеса и права доступа — заказчик

02 / retrieve

RAG и семантический поиск

Поиск по документам заказчика с измеренным качеством: гибридный поиск и реранкинг отбирают фрагменты, которые отвечают на вопрос.

Что входит

  • подготовка корпуса: текстовые документы (PDF, DOCX, HTML, Markdown); сканы и сложная вёрстка — отдельная оценка OCR
  • эмбеддинги и индекс внутри контура; BM25 + kNN с объединением через RRF
  • реранкинг и фильтрация шума
  • оценка качества retrieval на регрессионном наборе

Что нужно от вас

корпус документов и несколько десятков вопросов с ожидаемыми ответами; эксперт, который скажет, какой ответ правильный

Результат

поисковый контур с измеренным качеством, регрессионный набор и описание, как обновлять корпус

Граница ответственности

качество измеряется на согласованном наборе — совместно; данные и индекс остаются у заказчика

03 / serve

Self-hosted inference

Открытые модели на оборудовании заказчика через vLLM и Kubernetes; при необходимости — гибрид с внешними API по согласованным правилам.

Что входит

  • vLLM в Kubernetes или на выделенных серверах
  • выбор открытых моделей под задачу и железо
  • производительность и стоимость: батчинг, квантование, размер контекста
  • мониторинг, алерты и документ по эксплуатации

Что нужно от вас

доступ к кластеру или серверам с GPU, требования по безопасности и сети, ожидаемая нагрузка

Результат

работающий inference-сервис с мониторингом, документом по эксплуатации и замерами производительности

Граница ответственности

настройка и передача — Anchor Inference; железо, сеть и доступы — заказчик

04 / verify

Evals и наблюдаемость

Измерение, которое показывает, стало ли лучше после смены модели, промпта или индекса.

Что входит

  • регрессионные наборы на данных заказчика
  • LLM-как-судья с выборочной проверкой людьми
  • метрики качества и панель для команды
  • в production: ошибки, латентность, доля срабатываний quality gate; прогоны при каждом изменении

Что нужно от вас

доступ к логам системы, участие эксперта предметной области в разметке, критерии хорошего ответа

Результат

панель качества, регрессионные прогоны при каждом изменении, отчёты и план улучшений

Граница ответственности

измерение — Anchor Inference; решение о выкатке — команда заказчика

Стек: Python, asyncio, FastAPI, PostgreSQL, Elasticsearch/OpenSearch, vLLM, Kubernetes, Helm. Стоимость оценивается после разбора задачи (этап 1): вы получаете письменное описание, архитектуру и оценку сроков.

Система не заканчивается на ответе модели

Четыре этапа. У каждого письменный результат и критерий приёмки; работа продолжается после первого ответа модели.

Разбор задачинеделя 1

Фиксируем, что и чем измерять

Данные, ограничения контура, требования к доступу и критерии качества. Без этого нельзя измерить, стало ли лучше.

на выходе: описание задачи, архитектура, оценка; приёмка письменно
Прототип с метрикамиизмеримо

Первая версия на ваших данных

Варианты retrieval и промптов сравниваются на регрессионном наборе, а не на ощущениях.

на выходе: прототип и таблица метрик на согласованном наборе
Развёртывание в контуреon-prem или облако

vLLM и Kubernetes в вашей инфраструктуре

Интеграции и телеметрия — по согласованному списку; мониторинг и документ по эксплуатации.

на выходе: система в вашем кластере; приёмка по сценариям
Эксплуатация и evalsпостоянно

Качество в проде под наблюдением

Регрессии при смене модели или индекса, контроль ошибок и латентности, отчёты по качеству. Команда заказчика продолжает работу самостоятельно.

на выходе: отчёты и план улучшений; объём поддержки — по договору

Развёртывание, поддержка, передача

Что происходит после запуска и как ваша команда продолжает работу без постоянной зависимости от исполнителя.

инфраструктура

Кластер, GPU-узлы, сеть и доступы обслуживает команда заказчика. Сервисы системы, модели и индексы — Anchor Inference в объёме договора; границы фиксируются в документе по эксплуатации.

инциденты

Реакция в рабочие дни в течение рабочего дня; иной режим — по договору. Разбор инцидента с журналами и трассами, письменное описание причины и исправления. Круглосуточная поддержка не обещается по умолчанию.

передача

Код в репозитории заказчика, конфигурация и Helm-чарты, документация по эксплуатации и обновлению моделей, обучение команды: ваша команда может продолжать работу самостоятельно.