Руфат Нуриев обновлено

RAG-система на корпоративных документах: что входит в проект и сколько стоит

ИИ-ассистент с корпоративными документами и цитированием источников на экране ноутбука

Корпоративная RAG-система - это не «загрузить PDF в ChatGPT», а инфраструктура, которая индексирует регламенты, договоры, инструкции и базу знаний, находит релевантные фрагменты и генерирует ответы с цитированием источников. В 2026 году это стандарт для внутренних ассистентов, поддержки и запросов на соответствие требованиям. Ниже - состав проекта, этапы, сроки и реалистичные вилки бюджета.

  • MVP на одном источнике (Confluence, SharePoint, папка PDF) - $8 000 - $25 000, 4-8 недель
  • Корпоративная RAG-платформа (несколько источников, RBAC, аудит) - $35 000 - $120 000, 3-5 месяцев
  • Корпоративный: на своей инфраструктуре, DLP, SLA, мультиязычность - $120 000 - $350 000+, 6-10 месяцев
  • Ежемесячные расходы - эмбеддинги, API LLM, векторная БД, переиндексация: от $300 до $12 000+
  • Главный драйвер цены - не модель (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash), а качество извлечения и глубина интеграций с документооборотом

Корпоративная архитектура RAG-системы на стеклянной доске

Что такое RAG на корпоративных документах

RAG дополняет LLM поиском по вашим данным: модель не «помнит» регламент отпусков, а получает нужные абзацы из векторного индекса и строит ответ на их основе. Для бизнеса это снижает галлюцинации и даёт проверяемые ссылки на первоисточник.

Типовой корпоративный сценарий:

  • сотрудник спрашивает про процедуру согласования договора - система находит раздел в Confluence и цитирует пункт;
  • оператор поддержки получает черновик ответа из актуальной базы знаний Zendesk;
  • юрист ищет прецеденты в архиве договоров с фильтром по типу контрагента и дате.

Без RAG корпоративный чат-бот либо отвечает общими фразами, либо «выдумывает» внутренние правила. С RAG ответ привязан к документам, которые можно открыть и проверить.

Из чего состоит проект

Проект RAG делится на восемь блоков. Каждый влияет на срок и бюджет.

Блок Что делается Типичная доля
Обнаружение Источники данных, роли пользователей, KPI качества, ограничения по данным 8-12%
Ingestion (ETL) Подключение Confluence, SharePoint, Google Drive, CRM, тикетов, 1С-выгрузок 15-25%
Нарезка на фрагменты и предобработка Разбиение на фрагменты, очистка, метаданные, OCR для сканов 10-15%
Эмбеддинги и индекс Выбор модели эмбеддингов, векторная БД, гибридный поиск 10-15%
Пайплайн извлечения (retrieval пайплайн) Переранжирование, фильтры по ролям, дедупликация, расширение запроса 15-20%
Слой генерации Промпты, цитирование, защитные правила, запасной вариант при низкой уверенности 10-15%
Интерфейс и API Виджет, Slack/Teams, внутренний портал, API без встроенного фронтенда 10-20%
Observability и проверка качества Метрики извлечения, датасет тестовых вопросов, A/B, алерты 8-12%

Под ключ означает: система индексирует согласованные источники, отвечает в целевых каналах, логирует запросы, проходит пилот и передаётся команде с документацией по переиндексации.

Этапы разработки

1. Аудит данных и ТЗ (1-2 недели)

Фиксируют:

  • какие источники подключаются (Confluence, Notion, SharePoint, локальные PDF, wiki, CRM);
  • объём: число документов, частота обновлений, языки;
  • доступ: SSO, RBAC, разные индексы для отделов;
  • метрики: precision@k, доля ответов с корректной цитатой, время ответа, CSAT.

На выходе - карта источников, матрица прав доступа, список «золотых» вопросов для eval (50-200 штук из реальной практики сотрудников).

2. Прототип ingestion (2-4 недели)

Подключают первый источник и проверяют полный цикл:

  • выгрузка или вебхук при изменении документа;
  • парсинг (HTML, DOCX, PDF, таблицы);
  • нарезка на фрагменты: размер фрагмента, перекрытие, сохранение заголовков и иерархии;
  • запись в векторную БД с метаданными (отдел, дата, автор, тег).

Типичный стек: LangChain / LlamaIndex, Unstructured, Apache Tika, коннекторы к SharePoint Graph API и Confluence REST.

3. Извлечение и качество поиска (3-6 недель)

Основная инженерная работа:

  • модель эмбеддингов: OpenAI text-эмбеддинг-3-large, Cohere, локальные bge-m3 / e5 для развёртывания на своей инфраструктуре;
  • векторная БД: pgvector, Qdrant, Weaviate, Milvus, Pinecone;
  • гибридный поиск: keyword + semantic для точных артикулов, номеров договоров, SKU;
  • reranker: Cohere Rerank, cross-encoder, bge-reranker - поднимает точность на 15-30%;
  • фильтры: пользователь видит только документы своего отдела.

Без итераций на наборе проверки качества извлечение «почти работает» в демо и ломается на реальных вопросах.

4. Generation и guardrails (2-4 недели)

  • системный промпт с правилом «отвечай только по контексту»;
  • цитирование: ссылка на документ, страницу, якорь;
  • ответ «не знаю» при низкой оценке релевантности извлечения;
  • защита от промпт injection через документы;
  • маршрутизация моделей: Gemini 3.5 Flash / GPT-5.6 Luna на простые запросы, Terra / Claude Sonnet 5 на сложные.

5. Интеграции и интерфейс (2-6 недель)

  • виджет на intranet, бот в Slack/Teams/Telegram;
  • SSO (SAML, OIDC), журнал запросов для соответствия требованиям;
  • админка: статус индексации, ручная переиндексация, просмотр «плохих» ответов;
  • API для встраивания в CRM, тикет-систему, IDE.

6. Пилот и production (2-4 недели)

  • регрессия на датасете проверки качества после каждого релиза;
  • пилот на одном отделе (50-200 пользователей);
  • мониторинг задержки, стоимости tokens, drift качества;
  • инструкция по инцидентам: что делать при падении источника, как добавить новый раздел wiki.

Вилки стоимости по типам проектов

1. MVP - один источник, внутренний пилот

Параметр Значение
Бюджет $8 000 - $25 000
Срок 4-8 недель
Источники 1 (Confluence, папка PDF, Notion)
Пользователи до 100, без сложного RBAC
Инфраструктура облако, управляемая векторная БД

Подходит для проверки гипотезы «сотрудники перестанут искать вручную по wiki». Ограничения: один язык, базовое цитирование, ручная переиндексация или cron раз в сутки.

2. Корпоративная RAG-платформа

Параметр Значение
Бюджет $35 000 - $120 000
Срок 3-5 месяцев
Источники 3-8 (wiki, CRM, тикеты, файловое хранилище)
Пользователи 200-5 000, RBAC, SSO
Качество переранжирование, пайплайн проверки качества, гибридный поиск

Стандарт для среднего и крупного бизнеса: HR, IT, поддержка, продажи работают с одной платформой, но видят разные срезы документов.

3. Enterprise

Параметр Значение
Бюджет $120 000 - $350 000+
Срок 6-10 месяцев
Источники ERP, DMS, архивы договоров, SIEM-логи
Требования на своей инфраструктуре / VPC, DLP, audit trail, GDPR/HIPAA
Масштаб мультиязычность, филиалы, SLA 99.9%

Банки, телеком, фарма, госсектор. Значимая часть бюджета - безопасность, пентест, юридическое согласование, резервирование и self-hosted эмбеддинги при политике «данные не покидают контур».

Ежемесячные расходы (операционные расходы)

Статья Диапазон / мес От чего зависит
Эмбеддинги $50 - $800 Объём новых/изменённых документов
LLM API $200 - $8 000 Число запросов, длина контекста, модель
Векторная БД $70 - $600 Управляемый vs self-hosted, размер индекса
Rerank API $30 - $400 Запросы с переранжированием на каждый вопрос
Хостинг воркеров $100 - $1 500 Ingestion, очереди, cron
Поддержка и доработки $1 000 - $8 000 Фикс за сопровождение, обновление eval-набора, новые источники

Пример: 5 000 документов, 3 000 запросов/мес, Terra + pgvector + переранжирование:

  • Embeddings (переиндексация 10% в месяц): ~$40
  • LLM (2 500 input + 600 output токенов на запрос): ~$60-90
  • Инфраструктура: ~$150-250
  • Итого: ~$250-400/мес

При 50 000 запросов/мес и корпоративном SLA операционные расходы легко выходят $3 000 - $12 000/мес. Планируйте TCO на 18-24 месяца, а не только разовую разработку.

Сроки и команда

Тип проекта Состав команды Срок
MVP 1 бэкенд + ML/RAG engineer (частичная занятость) 4-8 недель
Корпоративная платформа 2 бэкенда, 1 ML, 1 фронтенд, PM 3-5 месяцев
Корпоративный 4-7 человек + DevOps, QA, безопасность 6-10 месяцев

Ставки в 2026 году (удалённо, Восточная Европа / СНГ): ML/RAG-специалист $60-100/ч, бэкенд $45-80/ч, DevOps $50-90/ч. Команда из США или Западной Европы - умножайте на 2-3.

Сроки растут не из-за «подключения OpenAI API», а из-за грязных данных (устаревшие wiki, сканы без OCR, дубликаты), согласований доступа к внутренним системам и итераций по качеству на реальных вопросах сотрудников.

Что удорожает проект

Много форматов и устаревших систем. Сканированные PDF без текстового слоя, вложенные таблицы в Excel, устаревший HTML в Confluence - каждый формат требует отдельного парсера и тестов.

RBAC на уровне документа. Пользователь A не должен видеть фрагмент из закрытого договора. Нужны фильтры в индексе, синхронизация прав из AD/SharePoint, аудит - +20-35% к бюджету.

Мультиязычность. Отдельные индексы или multilingual эмбеддинги, проверка качества на каждом языке, локальные стоп-слова. +25-40% при 3+ языках.

Real-time обновления. Webhook при каждом сохранении wiki vs ночной batch - разная архитектура очередей и стоимость ingestion.

На своей инфраструктуре и изоляция от интернета. Self-hosted LLM (Llama 4, Qwen 3.7), локальные эмбеддинги, GPU - +$500-3 000/мес на инфраструктуру, но обязательно для regulated-отраслей.

Как не переплатить

  1. Начните с одного отдела и одного источника - HR или IT-поддержка на Confluence, 30-50 эталонных вопросов.
  2. Проверка качества с первой недели - без датасета вы платите за бесконечные «подкрутки размера фрагмента».
  3. Гибридный поиск с переранжированием - дешевле, чем дообучение LLM на старте; дообучение добавляйте, когда RAG упирается в потолок.
  4. Маршрутизация моделей - Flash/Luna на FAQ, Terra/Sonnet на сложные многошаговые вопросы.
  5. Кэш частых запросов - семантический кэш снижает API на 20-40%.
  6. Фикс на MVP, время и материалы на новые источники - каждый новый коннектор (SAP, 1С) оценивайте отдельно.

Когда RAG не подходит

  • Меньше 20-30 документов, которые редко меняются - проще завести обычный FAQ или базу знаний; расходы на RAG-инфраструктуру не окупятся.
  • Некому поддерживать источники - если после запуска никто не следит за актуальностью документов и качеством ответов, система быстро устареет и потеряет доверие сотрудников.
  • Нужен точный расчёт или действие, а не текстовый ответ - RAG хорош для поиска и объяснений по документам, но не заменяет workflow-автоматизацию или прямую интеграцию с ERP/CRM для выполнения операций.
  • Бюджет и сроки ограничены пилотом на пару недель - даже MVP требует 4-8 недель и от $8 000; если это неприемлемо, начните с готового чат-бота по FAQ без полноценного RAG.

Итог

RAG-система на корпоративных документах в 2026 году - проект от $8 000 (MVP на одном wiki) до $350 000+ (enterprise с развёртыванием на своей инфраструктуре и compliance). Сроки - от 4-8 недель до 10 месяцев. Основные драйверы - число и качество источников, требования к правам доступа, точность извлечения и объём трафика. Модель LLM - лишь часть операционных расходов; качество ingestion и поиска определяет, будет ли система полезной или «красивым демо с галлюцинациями».

Начните с eval-набора реальных вопросов сотрудников, одного источника и измеримых метрик - так проще обосновать бюджет и масштабировать без переписывания архитектуры.

Актуальные ориентиры по стоимости услуг - на странице прайса.

Если нужна помощь с разработкой, внедрением ИИ или сопровождением сайта под вашу задачу - напишите мне.

Часто задаваемые вопросы

Чем RAG отличается от дообучения модели на документах?

Дообучение встраивает знания в веса модели: дорого обновлять при каждом изменении регламента, сложно цитировать источник. RAG хранит документы отдельно, при запросе находит актуальные фрагменты и подставляет в контекст - знания обновляются переиндексацией за минуты или часы. Для корпоративных документов с частыми правками RAG почти всегда выгоднее на старте; дообучение имеет смысл для узкого формата ответа или экономии tokens при миллионах однотипных запросов.

Можно ли собрать RAG на ChatGPT Корпоративный или Copilot без разработки?

Для простых кейсов - частично. Загрузка файлов в кастомный GPT или Microsoft Copilot подходит для пилота на сотнях документов. Ограничения: слабый контроль над нарезкой на фрагменты и извлечением, сложный RBAC, нет кастомной проверки качества, зависимость от вендора, лимиты на объём и интеграции с внутренними DMS. Для прод с тысячами документов, SSO, аудитом и SLA нужна кастомная RAG-платформа или коробочное решение с доработкой - от $35 000 и выше.

Сколько документов «потянет» типовой проект?

MVP комфортно работает с 500-5 000 документами (или до 50 000 страниц) на управляемой векторной БД. Корпоративная платформа масштабируется до 100 000+ документов при шардировании, гибридном поиске и batch-ingestion. Узкое место - не столько хранение векторов, сколько качество парсинга и задержка переранжирования при большом индексе. OCR-архивы на миллионы страниц - отдельный проект ingestion с бюджетом +30-50%.

Как измерить качество RAG до запуска?

Соберите датасет проверки качества: 50-200 реальных вопросов с эталонными документами/абзацами. Метрики: recall@k (нашли ли нужный фрагмент в топ-k), верность фактам (ответ соответствует контексту), точность цитирования (ссылка ведёт на правильное место). Прогоняйте набор после каждого изменения нарезки на фрагменты, эмбеддингов или переранжирования. Целевой ориентир для продакшена: recall@5 выше 85% на ключевых темах, верность фактам выше 90% на пилоте.

Что входит в поддержку после запуска?

Типичный фикс за сопровождение $1 000 - $5 000/мес (малый/средний проект) или 15-25% от стоимости разработки в год: мониторинг качества, обновление eval-набора, починка коннекторов при смене API источника, добавление новых разделов wiki, тюнинг промптов, алерты на рост задержки и стоимости API. Переиндексация при массовом обновлении документов (новый регламент, миграция Confluence) часто оплачивается отдельным спринтом. Без поддержки RAG деградирует за 3-6 месяцев: источники меняются, качество падает незаметно до жалоб пользователей.

Термины в статье

RAG — Retrieval-Augmented Generation — генерация с дополненным поиском

MVP — Minimum Viable Product — минимально жизнеспособный продукт

на своей инфраструктуре — on-premise — на своей инфраструктуре (on-premise)

SLA — Service Level Agreement — соглашение об уровне обслуживания

эмбеддинги — embeddings — числовые векторы, отражающие смысл текста

DLP — Data Loss Prevention — предотвращение утечек данных

галлюцинации — model hallucinations — уверенные, но неверные ответы модели

Confluence — Atlassian wiki for team documentation — вики Atlassian для командной документации

Zendesk — customer support and helpdesk platform — платформа поддержки клиентов и службы поддержки (helpdesk)

переранжирование — reranking — переранжирование кандидатов (reranking)

CRM — Customer Relationship Management — управление взаимоотношениями с клиентами

пайплайн — pipeline — цепочка автоматических шагов обработки

KPI — Key Performance Indicator — ключевой показатель эффективности

ETL — Extract, Transform, Load — извлечение, преобразование и загрузка данных

observability — logs, metrics and traces to understand system behavior — логи, метрики и трассировки для понимания работы системы

промпты — prompts — тексты-инструкции или запросы к модели

OCR — Optical Character Recognition — оптическое распознавание символов

виджет — widget — виджет интерфейса (widget)

RBAC — Role-Based Access Control — разграничение доступа по ролям

LlamaIndex — framework for connecting LLMs to private data — фреймворк для подключения LLM к частным данным

CSAT — Customer Satisfaction Score — индекс удовлетворённости клиентов

LangChain — framework for building LLM applications — фреймворк для приложений на больших языковых моделях

вебхук — webhook — HTTP-уведомление при наступлении события

проверки качества — evals — проверки качества ответов модели (evals)

cross-encoder — rerank model that scores query and document together — реранкер: оценивает запрос и документ вместе

SSO — Single Sign-On — единый вход

системный промпт — system prompt — скрытые инструкции, которые задают поведение модели

pgvector — PostgreSQL extension for vector search — расширение PostgreSQL для векторного поиска

Pinecone — managed vector database for similarity search — управляемая векторная БД для поиска по сходству

reranker — model that reorders search hits by relevance — модель, которая переупорядочивает выдачу по релевантности

Qdrant — vector database for similarity search — векторная БД для поиска по сходству

регрессия — regression — баг, когда раньше работавшая функция снова ломается

SKU — Stock Keeping Unit — единица складского учёта

SAML — Security Assertion Markup Language — язык разметки утверждений безопасности

OIDC — OpenID Connect — протокол OpenID Connect

audit trail — verifiable history of actions and changes — проверяемая история действий и изменений

фикс за сопровождение — retainer — фиксированная плата за сопровождение (retainer)

self-hosted — software you run on your own servers — ПО на собственном сервере

embeddings — numeric vectors that capture text meaning — числовые векторы, отражающие смысл текста

SIEM — Security Information and Event Management — управление информацией и событиями безопасности

HIPAA — Health Insurance Portability and Accountability Act — закон США о медицинском страховании и конфиденциальности

GDPR — General Data Protection Regulation — Общий регламент по защите данных

LLM API — HTTP API to call a large language model — HTTP API для вызова большой языковой модели

ERP — Enterprise Resource Planning — планирование ресурсов предприятия

VPC — Virtual Private Cloud — виртуальное частное облако

фронтенд — frontend — клиентская часть сайта или приложения (frontend)

бэкенд — backend — серверная логика, API и слой данных (backend)

DevOps — Development and Operations — совместная практика разработки и эксплуатации

real-time — processed with minimal delay — в реальном времени, с минимальной задержкой

дообучение — fine-tuning — дополнительное обучение модели под вашу задачу

TCO — Total Cost of Ownership — совокупная стоимость владения

webhook — HTTP callback when an event happens — HTTP-уведомление при наступлении события

ML — Machine Learning — машинное обучение

зависимость от вендора — vendor lock-in — зависимость от вендора (vendor lock-in)

точность цитирования — citation accuracy — точность цитирования (citation accuracy)

GPU — Graphics Processing Unit — графический процессор

верность фактам — faithfulness — верность фактам из контекста (faithfulness)

прод — production — боевая среда с реальными пользователями (production)

GPT — Generative Pre-trained Transformer — семейство генеративных языковых моделей

Контакты