RAG-система на корпоративных документах: что входит в проект и сколько стоит

Корпоративная RAG-система - это не «загрузить PDF в ChatGPT», а инфраструктура, которая индексирует регламенты, договоры, инструкции и базу знаний, находит релевантные фрагменты и генерирует ответы с цитированием источников. В 2026 году это стандарт для внутренних ассистентов, поддержки и запросов на соответствие требованиям. Ниже - состав проекта, этапы, сроки и реалистичные вилки бюджета.
- MVP на одном источнике (Confluence, SharePoint, папка PDF) - $8 000 - $25 000, 4-8 недель
- Корпоративная RAG-платформа (несколько источников, RBAC, аудит) - $35 000 - $120 000, 3-5 месяцев
- Корпоративный: на своей инфраструктуре, DLP, SLA, мультиязычность - $120 000 - $350 000+, 6-10 месяцев
- Ежемесячные расходы - эмбеддинги, API LLM, векторная БД, переиндексация: от $300 до $12 000+
- Главный драйвер цены - не модель (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash), а качество извлечения и глубина интеграций с документооборотом

Что такое RAG на корпоративных документах
RAG дополняет LLM поиском по вашим данным: модель не «помнит» регламент отпусков, а получает нужные абзацы из векторного индекса и строит ответ на их основе. Для бизнеса это снижает галлюцинации и даёт проверяемые ссылки на первоисточник.
Типовой корпоративный сценарий:
- сотрудник спрашивает про процедуру согласования договора - система находит раздел в Confluence и цитирует пункт;
- оператор поддержки получает черновик ответа из актуальной базы знаний Zendesk;
- юрист ищет прецеденты в архиве договоров с фильтром по типу контрагента и дате.
Без RAG корпоративный чат-бот либо отвечает общими фразами, либо «выдумывает» внутренние правила. С RAG ответ привязан к документам, которые можно открыть и проверить.
Из чего состоит проект
Проект RAG делится на восемь блоков. Каждый влияет на срок и бюджет.
| Блок | Что делается | Типичная доля |
|---|---|---|
| Обнаружение | Источники данных, роли пользователей, KPI качества, ограничения по данным | 8-12% |
| Ingestion (ETL) | Подключение Confluence, SharePoint, Google Drive, CRM, тикетов, 1С-выгрузок | 15-25% |
| Нарезка на фрагменты и предобработка | Разбиение на фрагменты, очистка, метаданные, OCR для сканов | 10-15% |
| Эмбеддинги и индекс | Выбор модели эмбеддингов, векторная БД, гибридный поиск | 10-15% |
| Пайплайн извлечения (retrieval пайплайн) | Переранжирование, фильтры по ролям, дедупликация, расширение запроса | 15-20% |
| Слой генерации | Промпты, цитирование, защитные правила, запасной вариант при низкой уверенности | 10-15% |
| Интерфейс и API | Виджет, Slack/Teams, внутренний портал, API без встроенного фронтенда | 10-20% |
| Observability и проверка качества | Метрики извлечения, датасет тестовых вопросов, A/B, алерты | 8-12% |
Под ключ означает: система индексирует согласованные источники, отвечает в целевых каналах, логирует запросы, проходит пилот и передаётся команде с документацией по переиндексации.
Этапы разработки
1. Аудит данных и ТЗ (1-2 недели)
Фиксируют:
- какие источники подключаются (Confluence, Notion, SharePoint, локальные PDF, wiki, CRM);
- объём: число документов, частота обновлений, языки;
- доступ: SSO, RBAC, разные индексы для отделов;
- метрики: precision@k, доля ответов с корректной цитатой, время ответа, CSAT.
На выходе - карта источников, матрица прав доступа, список «золотых» вопросов для eval (50-200 штук из реальной практики сотрудников).
2. Прототип ingestion (2-4 недели)
Подключают первый источник и проверяют полный цикл:
- выгрузка или вебхук при изменении документа;
- парсинг (HTML, DOCX, PDF, таблицы);
- нарезка на фрагменты: размер фрагмента, перекрытие, сохранение заголовков и иерархии;
- запись в векторную БД с метаданными (отдел, дата, автор, тег).
Типичный стек: LangChain / LlamaIndex, Unstructured, Apache Tika, коннекторы к SharePoint Graph API и Confluence REST.
3. Извлечение и качество поиска (3-6 недель)
Основная инженерная работа:
- модель эмбеддингов: OpenAI text-эмбеддинг-3-large, Cohere, локальные bge-m3 / e5 для развёртывания на своей инфраструктуре;
- векторная БД: pgvector, Qdrant, Weaviate, Milvus, Pinecone;
- гибридный поиск: keyword + semantic для точных артикулов, номеров договоров, SKU;
- reranker: Cohere Rerank, cross-encoder, bge-reranker - поднимает точность на 15-30%;
- фильтры: пользователь видит только документы своего отдела.
Без итераций на наборе проверки качества извлечение «почти работает» в демо и ломается на реальных вопросах.
4. Generation и guardrails (2-4 недели)
- системный промпт с правилом «отвечай только по контексту»;
- цитирование: ссылка на документ, страницу, якорь;
- ответ «не знаю» при низкой оценке релевантности извлечения;
- защита от промпт injection через документы;
- маршрутизация моделей: Gemini 3.5 Flash / GPT-5.6 Luna на простые запросы, Terra / Claude Sonnet 5 на сложные.
5. Интеграции и интерфейс (2-6 недель)
- виджет на intranet, бот в Slack/Teams/Telegram;
- SSO (SAML, OIDC), журнал запросов для соответствия требованиям;
- админка: статус индексации, ручная переиндексация, просмотр «плохих» ответов;
- API для встраивания в CRM, тикет-систему, IDE.
6. Пилот и production (2-4 недели)
- регрессия на датасете проверки качества после каждого релиза;
- пилот на одном отделе (50-200 пользователей);
- мониторинг задержки, стоимости tokens, drift качества;
- инструкция по инцидентам: что делать при падении источника, как добавить новый раздел wiki.
Вилки стоимости по типам проектов
1. MVP - один источник, внутренний пилот
| Параметр | Значение |
|---|---|
| Бюджет | $8 000 - $25 000 |
| Срок | 4-8 недель |
| Источники | 1 (Confluence, папка PDF, Notion) |
| Пользователи | до 100, без сложного RBAC |
| Инфраструктура | облако, управляемая векторная БД |
Подходит для проверки гипотезы «сотрудники перестанут искать вручную по wiki». Ограничения: один язык, базовое цитирование, ручная переиндексация или cron раз в сутки.
2. Корпоративная RAG-платформа
| Параметр | Значение |
|---|---|
| Бюджет | $35 000 - $120 000 |
| Срок | 3-5 месяцев |
| Источники | 3-8 (wiki, CRM, тикеты, файловое хранилище) |
| Пользователи | 200-5 000, RBAC, SSO |
| Качество | переранжирование, пайплайн проверки качества, гибридный поиск |
Стандарт для среднего и крупного бизнеса: HR, IT, поддержка, продажи работают с одной платформой, но видят разные срезы документов.
3. Enterprise
| Параметр | Значение |
|---|---|
| Бюджет | $120 000 - $350 000+ |
| Срок | 6-10 месяцев |
| Источники | ERP, DMS, архивы договоров, SIEM-логи |
| Требования | на своей инфраструктуре / VPC, DLP, audit trail, GDPR/HIPAA |
| Масштаб | мультиязычность, филиалы, SLA 99.9% |
Банки, телеком, фарма, госсектор. Значимая часть бюджета - безопасность, пентест, юридическое согласование, резервирование и self-hosted эмбеддинги при политике «данные не покидают контур».
Ежемесячные расходы (операционные расходы)
| Статья | Диапазон / мес | От чего зависит |
|---|---|---|
| Эмбеддинги | $50 - $800 | Объём новых/изменённых документов |
| LLM API | $200 - $8 000 | Число запросов, длина контекста, модель |
| Векторная БД | $70 - $600 | Управляемый vs self-hosted, размер индекса |
| Rerank API | $30 - $400 | Запросы с переранжированием на каждый вопрос |
| Хостинг воркеров | $100 - $1 500 | Ingestion, очереди, cron |
| Поддержка и доработки | $1 000 - $8 000 | Фикс за сопровождение, обновление eval-набора, новые источники |
Пример: 5 000 документов, 3 000 запросов/мес, Terra + pgvector + переранжирование:
- Embeddings (переиндексация 10% в месяц): ~$40
- LLM (2 500 input + 600 output токенов на запрос): ~$60-90
- Инфраструктура: ~$150-250
- Итого: ~$250-400/мес
При 50 000 запросов/мес и корпоративном SLA операционные расходы легко выходят $3 000 - $12 000/мес. Планируйте TCO на 18-24 месяца, а не только разовую разработку.
Сроки и команда
| Тип проекта | Состав команды | Срок |
|---|---|---|
| MVP | 1 бэкенд + ML/RAG engineer (частичная занятость) | 4-8 недель |
| Корпоративная платформа | 2 бэкенда, 1 ML, 1 фронтенд, PM | 3-5 месяцев |
| Корпоративный | 4-7 человек + DevOps, QA, безопасность | 6-10 месяцев |
Ставки в 2026 году (удалённо, Восточная Европа / СНГ): ML/RAG-специалист $60-100/ч, бэкенд $45-80/ч, DevOps $50-90/ч. Команда из США или Западной Европы - умножайте на 2-3.
Сроки растут не из-за «подключения OpenAI API», а из-за грязных данных (устаревшие wiki, сканы без OCR, дубликаты), согласований доступа к внутренним системам и итераций по качеству на реальных вопросах сотрудников.
Что удорожает проект
Много форматов и устаревших систем. Сканированные PDF без текстового слоя, вложенные таблицы в Excel, устаревший HTML в Confluence - каждый формат требует отдельного парсера и тестов.
RBAC на уровне документа. Пользователь A не должен видеть фрагмент из закрытого договора. Нужны фильтры в индексе, синхронизация прав из AD/SharePoint, аудит - +20-35% к бюджету.
Мультиязычность. Отдельные индексы или multilingual эмбеддинги, проверка качества на каждом языке, локальные стоп-слова. +25-40% при 3+ языках.
Real-time обновления. Webhook при каждом сохранении wiki vs ночной batch - разная архитектура очередей и стоимость ingestion.
На своей инфраструктуре и изоляция от интернета. Self-hosted LLM (Llama 4, Qwen 3.7), локальные эмбеддинги, GPU - +$500-3 000/мес на инфраструктуру, но обязательно для regulated-отраслей.
Как не переплатить
- Начните с одного отдела и одного источника - HR или IT-поддержка на Confluence, 30-50 эталонных вопросов.
- Проверка качества с первой недели - без датасета вы платите за бесконечные «подкрутки размера фрагмента».
- Гибридный поиск с переранжированием - дешевле, чем дообучение LLM на старте; дообучение добавляйте, когда RAG упирается в потолок.
- Маршрутизация моделей - Flash/Luna на FAQ, Terra/Sonnet на сложные многошаговые вопросы.
- Кэш частых запросов - семантический кэш снижает API на 20-40%.
- Фикс на MVP, время и материалы на новые источники - каждый новый коннектор (SAP, 1С) оценивайте отдельно.
Когда RAG не подходит
- Меньше 20-30 документов, которые редко меняются - проще завести обычный FAQ или базу знаний; расходы на RAG-инфраструктуру не окупятся.
- Некому поддерживать источники - если после запуска никто не следит за актуальностью документов и качеством ответов, система быстро устареет и потеряет доверие сотрудников.
- Нужен точный расчёт или действие, а не текстовый ответ - RAG хорош для поиска и объяснений по документам, но не заменяет workflow-автоматизацию или прямую интеграцию с ERP/CRM для выполнения операций.
- Бюджет и сроки ограничены пилотом на пару недель - даже MVP требует 4-8 недель и от $8 000; если это неприемлемо, начните с готового чат-бота по FAQ без полноценного RAG.
Итог
RAG-система на корпоративных документах в 2026 году - проект от $8 000 (MVP на одном wiki) до $350 000+ (enterprise с развёртыванием на своей инфраструктуре и compliance). Сроки - от 4-8 недель до 10 месяцев. Основные драйверы - число и качество источников, требования к правам доступа, точность извлечения и объём трафика. Модель LLM - лишь часть операционных расходов; качество ingestion и поиска определяет, будет ли система полезной или «красивым демо с галлюцинациями».
Начните с eval-набора реальных вопросов сотрудников, одного источника и измеримых метрик - так проще обосновать бюджет и масштабировать без переписывания архитектуры.
Актуальные ориентиры по стоимости услуг - на странице прайса.
Если нужна помощь с разработкой, внедрением ИИ или сопровождением сайта под вашу задачу - напишите мне.
Часто задаваемые вопросы
Чем RAG отличается от дообучения модели на документах?
Дообучение встраивает знания в веса модели: дорого обновлять при каждом изменении регламента, сложно цитировать источник. RAG хранит документы отдельно, при запросе находит актуальные фрагменты и подставляет в контекст - знания обновляются переиндексацией за минуты или часы. Для корпоративных документов с частыми правками RAG почти всегда выгоднее на старте; дообучение имеет смысл для узкого формата ответа или экономии tokens при миллионах однотипных запросов.
Можно ли собрать RAG на ChatGPT Корпоративный или Copilot без разработки?
Для простых кейсов - частично. Загрузка файлов в кастомный GPT или Microsoft Copilot подходит для пилота на сотнях документов. Ограничения: слабый контроль над нарезкой на фрагменты и извлечением, сложный RBAC, нет кастомной проверки качества, зависимость от вендора, лимиты на объём и интеграции с внутренними DMS. Для прод с тысячами документов, SSO, аудитом и SLA нужна кастомная RAG-платформа или коробочное решение с доработкой - от $35 000 и выше.
Сколько документов «потянет» типовой проект?
MVP комфортно работает с 500-5 000 документами (или до 50 000 страниц) на управляемой векторной БД. Корпоративная платформа масштабируется до 100 000+ документов при шардировании, гибридном поиске и batch-ingestion. Узкое место - не столько хранение векторов, сколько качество парсинга и задержка переранжирования при большом индексе. OCR-архивы на миллионы страниц - отдельный проект ingestion с бюджетом +30-50%.
Как измерить качество RAG до запуска?
Соберите датасет проверки качества: 50-200 реальных вопросов с эталонными документами/абзацами. Метрики: recall@k (нашли ли нужный фрагмент в топ-k), верность фактам (ответ соответствует контексту), точность цитирования (ссылка ведёт на правильное место). Прогоняйте набор после каждого изменения нарезки на фрагменты, эмбеддингов или переранжирования. Целевой ориентир для продакшена: recall@5 выше 85% на ключевых темах, верность фактам выше 90% на пилоте.
Что входит в поддержку после запуска?
Типичный фикс за сопровождение $1 000 - $5 000/мес (малый/средний проект) или 15-25% от стоимости разработки в год: мониторинг качества, обновление eval-набора, починка коннекторов при смене API источника, добавление новых разделов wiki, тюнинг промптов, алерты на рост задержки и стоимости API. Переиндексация при массовом обновлении документов (новый регламент, миграция Confluence) часто оплачивается отдельным спринтом. Без поддержки RAG деградирует за 3-6 месяцев: источники меняются, качество падает незаметно до жалоб пользователей.
Термины в статье
RAG — Retrieval-Augmented Generation — генерация с дополненным поиском
MVP — Minimum Viable Product — минимально жизнеспособный продукт
на своей инфраструктуре — on-premise — на своей инфраструктуре (on-premise)
SLA — Service Level Agreement — соглашение об уровне обслуживания
эмбеддинги — embeddings — числовые векторы, отражающие смысл текста
DLP — Data Loss Prevention — предотвращение утечек данных
галлюцинации — model hallucinations — уверенные, но неверные ответы модели
Confluence — Atlassian wiki for team documentation — вики Atlassian для командной документации
Zendesk — customer support and helpdesk platform — платформа поддержки клиентов и службы поддержки (helpdesk)
переранжирование — reranking — переранжирование кандидатов (reranking)
CRM — Customer Relationship Management — управление взаимоотношениями с клиентами
пайплайн — pipeline — цепочка автоматических шагов обработки
KPI — Key Performance Indicator — ключевой показатель эффективности
ETL — Extract, Transform, Load — извлечение, преобразование и загрузка данных
observability — logs, metrics and traces to understand system behavior — логи, метрики и трассировки для понимания работы системы
промпты — prompts — тексты-инструкции или запросы к модели
OCR — Optical Character Recognition — оптическое распознавание символов
виджет — widget — виджет интерфейса (widget)
RBAC — Role-Based Access Control — разграничение доступа по ролям
LlamaIndex — framework for connecting LLMs to private data — фреймворк для подключения LLM к частным данным
CSAT — Customer Satisfaction Score — индекс удовлетворённости клиентов
LangChain — framework for building LLM applications — фреймворк для приложений на больших языковых моделях
вебхук — webhook — HTTP-уведомление при наступлении события
проверки качества — evals — проверки качества ответов модели (evals)
cross-encoder — rerank model that scores query and document together — реранкер: оценивает запрос и документ вместе
SSO — Single Sign-On — единый вход
системный промпт — system prompt — скрытые инструкции, которые задают поведение модели
pgvector — PostgreSQL extension for vector search — расширение PostgreSQL для векторного поиска
Pinecone — managed vector database for similarity search — управляемая векторная БД для поиска по сходству
reranker — model that reorders search hits by relevance — модель, которая переупорядочивает выдачу по релевантности
Qdrant — vector database for similarity search — векторная БД для поиска по сходству
регрессия — regression — баг, когда раньше работавшая функция снова ломается
SKU — Stock Keeping Unit — единица складского учёта
SAML — Security Assertion Markup Language — язык разметки утверждений безопасности
OIDC — OpenID Connect — протокол OpenID Connect
audit trail — verifiable history of actions and changes — проверяемая история действий и изменений
фикс за сопровождение — retainer — фиксированная плата за сопровождение (retainer)
self-hosted — software you run on your own servers — ПО на собственном сервере
embeddings — numeric vectors that capture text meaning — числовые векторы, отражающие смысл текста
SIEM — Security Information and Event Management — управление информацией и событиями безопасности
HIPAA — Health Insurance Portability and Accountability Act — закон США о медицинском страховании и конфиденциальности
GDPR — General Data Protection Regulation — Общий регламент по защите данных
LLM API — HTTP API to call a large language model — HTTP API для вызова большой языковой модели
ERP — Enterprise Resource Planning — планирование ресурсов предприятия
VPC — Virtual Private Cloud — виртуальное частное облако
фронтенд — frontend — клиентская часть сайта или приложения (frontend)
бэкенд — backend — серверная логика, API и слой данных (backend)
DevOps — Development and Operations — совместная практика разработки и эксплуатации
real-time — processed with minimal delay — в реальном времени, с минимальной задержкой
дообучение — fine-tuning — дополнительное обучение модели под вашу задачу
TCO — Total Cost of Ownership — совокупная стоимость владения
webhook — HTTP callback when an event happens — HTTP-уведомление при наступлении события
ML — Machine Learning — машинное обучение
зависимость от вендора — vendor lock-in — зависимость от вендора (vendor lock-in)
точность цитирования — citation accuracy — точность цитирования (citation accuracy)
GPU — Graphics Processing Unit — графический процессор
верность фактам — faithfulness — верность фактам из контекста (faithfulness)
прод — production — боевая среда с реальными пользователями (production)
GPT — Generative Pre-trained Transformer — семейство генеративных языковых моделей