Rufat Nuriyev aktualisiert

RAG-System auf Unternehmensdokumenten: Projektumfang und Kosten

KI-Assistent mit Unternehmensdokumenten und Quellenangaben auf einem Laptop-Bildschirm

Ein unternehmerisches RAG-System (Retrieval-Augmented Generation) ist nicht „PDF in ChatGPT hochladen“, sondern Infrastruktur, die Richtlinien, Verträge, Anleitungen und Wissensbasen indexiert, relevante Abschnitte findet und Antworten mit Quellenangaben erzeugt. 2026 ist das Standard für interne Assistenten, Support und Compliance-Anfragen. Unten: Projektbestandteile, Phasen, Zeitrahmen und realistische Budgetspannen.

  • MVP mit einer Quelle (Confluence, SharePoint, PDF-Ordner) - $8.000 - $25.000, 4-8 Wochen
  • Unternehmens-RAG-Plattform (mehrere Quellen, RBAC, Audit) - $35.000 - $120.000, 3-5 Monate
  • Enterprise: On-Prem, DLP, SLA, Mehrsprachigkeit - $120.000 - $350.000+, 6-10 Monate
  • Monatliche Kosten - Embeddings, LLM-API, Vektor-DB, Reindexierung: ab $300 bis $12.000+
  • Hauptpreistreiber - nicht das Modell (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash), sondern Retrieval-Qualität und Tiefe der DMS-Integrationen

Unternehmensarchitektur-Diagramm eines RAG-Systems auf einer Glastafel

Was RAG auf Unternehmensdokumenten bedeutet

RAG erweitert ein LLM um Suche in Ihren Daten: Das Modell „kennt“ die Urlaubsregelung nicht auswendig, sondern erhält relevante Absätze aus dem Vektorindex und baut die Antwort darauf. Für Unternehmen weniger Halluzinationen und prüfbare Quellen.

Typische Szenarien:

  • Mitarbeiter fragt nach Vertragsfreigabe - System findet den Confluence-Abschnitt und zitiert die Klausel;
  • Support erhält Entwurf aus aktueller Zendesk-Wissensbasis;
  • Recht sucht Präzedenzfälle im Vertragsarchiv mit Filtern nach Partnertyp und Datum.

Ohne RAG antwortet ein Firmen-Chatbot allgemein oder „erfindet“ interne Regeln. Mit RAG ist die Antwort an prüfbare Dokumente gebunden.

Projektbestandteile

Acht Blöcke - jeder beeinflusst Zeit und Budget.

Block Inhalt Typischer Anteil
Discovery Datenquellen, Rollen, Qualitäts-KPIs, Datenschutz 8-12%
Ingestion (ETL) Confluence, SharePoint, Google Drive, CRM, Tickets, ERP 15-25%
Chunking und Preprocessing Fragmentierung, Bereinigung, Metadaten, OCR 10-15%
Embeddings und Index Embedding-Modell, Vektor-DB, Hybridsuche (BM25 + Vektor) 10-15%
Retrieval-Pipeline Reranking, Rollenfilter, Deduplizierung, Query Expansion 15-20%
Generation Layer Prompts, Zitate, Guardrails, Fallback bei niedriger Konfidenz 10-15%
Interface und API Widget, Slack/Teams, Intranet, Headless-API 10-20%
Observability und Eval Retrieval-Metriken, Testfragen, A/B, Alerts 8-12%

Schlüsselfertig: indexierte Quellen, Antworten in Zielkanälen, Query-Logging, Pilot, Übergabe mit Reindex-Dokumentation.

Entwicklungsphasen

1. Datenaudit und Lastenheft (1-2 Wochen)

Festlegung von Quellen, Volumen, Zugriff (SSO, RBAC), Metriken (precision@k, Zitatgenauigkeit, CSAT). Ergebnis: Quellenkarte, Rechtematrix, 50-200 Eval-Fragen aus der Praxis.

2. Ingestion-Prototyp (2-4 Wochen)

Erste Quelle, voller Zyklus: Export/Webhook, Parsing (HTML, DOCX, PDF), Chunking, Schreiben in Vektor-DB mit Metadaten. Stack: LangChain / LlamaIndex, Unstructured, Apache Tika, SharePoint/Confluence-Connectors.

3. Retrieval und Suchqualität (3-6 Wochen)

Embedding-Modell, Vektor-DB (pgvector, Qdrant, Weaviate), Hybridsuche, Reranker (+15-30% Genauigkeit), abteilungsbezogene Filter. Ohne Eval-Iterationen bricht Retrieval in Produktion.

4. Generation und Guardrails (2-4 Wochen)

Prompt „nur aus Kontext antworten“, Zitate, „weiß nicht“ bei niedrigem Score, Schutz vor Prompt Injection, Modell-Routing (Flash/Luna vs Terra/Sonnet).

5. Integrationen und UI (2-6 Wochen)

Intranet-Widget, Slack/Teams-Bot, SSO, Admin-Panel, API für CRM und Tickets.

6. Pilot und Produktion (2-4 Wochen)

Regression auf Eval-Set, Pilot mit 50-200 Nutzern, Monitoring, Runbook.

Kosten nach Projekttyp

MVP - eine Quelle

Parameter Wert
Budget $8.000 - $25.000
Dauer 4-8 Wochen
Quellen 1
Nutzer bis 100

Unternehmens-RAG-Plattform

Parameter Wert
Budget $35.000 - $120.000
Dauer 3-5 Monate
Quellen 3-8
Nutzer 200-5.000, RBAC, SSO

Enterprise

Parameter Wert
Budget $120.000 - $350.000+
Dauer 6-10 Monate
Anforderungen On-Prem/VPC, DLP, GDPR/HIPAA, SLA 99,9%

Monatliche Kosten (OPEX)

Posten Bereich/Monat
Embeddings $50 - $800
LLM-API $200 - $8.000
Vektor-DB $70 - $600
Rerank $30 - $400
Hosting $100 - $1.500
Support $1.000 - $8.000

Beispiel: 5.000 Dokumente, 3.000 Anfragen/Monat - ca. $250-400/Monat. Bei 50.000 Anfragen: $3.000 - $12.000/Monat.

Zeitplan und Team

Typ Team Dauer
MVP 1 Backend + ML (Teilzeit) 4-8 Wochen
Plattform 2 Backend, 1 ML, 1 Frontend, PM 3-5 Monate
Enterprise 4-7 + DevOps, QA, Security 6-10 Monate

Stundensätze 2026 (Remote, Osteuropa/GUS): ML/RAG $60-100/h, Backend $45-80/h. USA/Westeuropa: Faktor 2-3.

Was das Projekt verteuert

Viele Legacy-Formate, dokumentenbezogenes RBAC (+20-35%), Mehrsprachigkeit (+25-40%), Echtzeit-Updates, On-Prem mit GPU (+$500-3.000/Monat).

Kosten sparen

  1. Ein Abteilung, eine Quelle, 30-50 Referenzfragen.
  2. Eval ab Woche eins.
  3. Hybridsuche + Rerank statt Fine-Tuning am Anfang.
  4. Modell-Routing für einfache vs komplexe Fragen.
  5. Semantischer Cache (20-40% API-Ersparnis).
  6. Festpreis MVP, T&M für neue Connectors.

Wann sich RAG nicht lohnt

  • Weniger als 20-30 Dokumente, die selten wechseln - ein normales FAQ reicht, die RAG-Infrastruktur zahlt sich nicht aus.
  • Niemand pflegt die Quellen nach dem Start - ohne laufende Pflege veraltet das System schnell und verliert das Vertrauen der Mitarbeiter.
  • Es braucht eine exakte Berechnung oder Aktion statt einer Textantwort - RAG ersetzt keine Workflow-Automatisierung oder direkte ERP/CRM-Integration.
  • Budget und Zeit reichen nur für einen zweiwöchigen Pilot - schon ein MVP braucht 4-8 Wochen und ab $8.000; sonst besser ein fertiger FAQ-Bot statt vollem RAG.

Fazit

RAG auf Unternehmensdokumenten 2026: $8.000 (MVP) bis $350.000+ (Enterprise). 4-8 Wochen bis 10 Monate. Treiber: Quellen, Rechte, Retrieval-Qualität, Traffic. Ingestion und Suche entscheiden über Nutzen vs Demo mit Halluzinationen.

Aktuelle Orientierung zu den Servicekosten - auf der Preisseite.

Wenn Sie Hilfe bei Entwicklung, KI-Einführung oder Website-Betreuung für Ihr Projekt brauchen - schreiben Sie mir.

Häufig gestellte Fragen

Unterschied RAG vs Fine-Tuning?

Fine-Tuning bindet Wissen in Gewichte - teure Updates, schwache Quellenangaben. RAG aktualisiert per Reindexierung. Für sich ändernde Firmendokumente startet man mit RAG.

RAG ohne Entwicklung via ChatGPT Enterprise oder Copilot?

Teilweise für Piloten mit wenigen hundert Dokumenten. Für Produktion mit SSO, Audit und tausenden Dokumenten: Custom-RAG ab ca. $35.000.

Wie viele Dokumente?

MVP: 500-5.000 Dokumente. Plattform: 100.000+ mit Sharding. OCR-Archive im Millionenbereich: +30-50% Budget.

Qualität messen?

Eval-Datensatz mit 50-200 Fragen. Metriken: recall@k, faithfulness, citation accuracy. Ziel: recall@5 > 85%, faithfulness > 90% im Pilot.

Support nach Launch?

Retainer $1.000 - $5.000/Monat oder 15-25%/Jahr der Entwicklungskosten: Monitoring, Eval-Updates, Connector-Fixes, Prompt-Tuning. Ohne Support Degradation in 3-6 Monaten.

Begriffe in diesem Artikel

MVP — Minimum Viable Product

on-prem — software hosted in your own infrastructure — Software in der eigenen Infrastruktur, nicht in der Cloud

embeddings — numeric vectors that capture text meaning — numerische Vektoren, die Textbedeutung abbilden

SLA — Service Level Agreement

DLP — Data Loss Prevention

RAG — Retrieval-Augmented Generation

LLM — Large Language Model

Confluence — Atlassian wiki for team documentation — Atlassian-Wiki für Teamdokumentation

chunking — splitting documents into retrieval-friendly pieces — Aufteilen von Dokumenten in suchbare Fragmente

query expansion — broaden a query to improve recall

ETL — Extract, Transform, Load

CRM — Customer Relationship Management

reranking — reordering search results by relevance — Neusortierung von Suchergebnissen nach Relevanz

ERP — Enterprise Resource Planning

guardrails — rules and filters that keep AI outputs safe and on-policy — Regeln und Filter, die KI-Antworten sicher und regelkonform halten

observability — logs, metrics and traces to understand system behavior — Logs, Metriken und Traces zum Verständnis des Systems

OCR — Optical Character Recognition

fallback — backup path used when the primary option fails — Ausweichweg, wenn der Hauptweg scheitert

widget — embedded UI component

LlamaIndex — framework for connecting LLMs to private data — Framework zum Anbinden von LLMs an private Daten

prompt injection — attack that manipulates model behavior via input — Angriff, der Modellverhalten über Eingaben manipuliert

LangChain — framework for building LLM applications — Framework für LLM-Anwendungen

RBAC — Role-Based Access Control

webhook — HTTP callback when an event happens — HTTP-Rückruf bei einem Ereignis

retrieval — finding relevant context before generation — Finden relevanter Kontexte vor der Generierung

SSO — Single Sign-On

reranker — model that reorders search hits by relevance — Modell, das Treffer nach Relevanz neu sortiert

regression — bug where a previously working feature breaks again — Bug, bei dem eine zuvor funktionierende Funktion wieder bricht

fine-tuning — additional training of a model on domain data — zusätzliches Training des Modells auf Domänendaten

runbook — step-by-step playbook for incidents and operations — Schritt-für-Schritt-Anleitung für Incidents und Betrieb

GDPR — General Data Protection Regulation

HIPAA — Health Insurance Portability and Accountability Act

frontend — client-side UI of a site or app — clientseitige Oberfläche einer Site/App

backend — server-side logic, APIs and data layer — serverseitige Logik, APIs und Datenschicht

VPC — Virtual Private Cloud

citation accuracy — citations point to the right place

DevOps — Development and Operations

faithfulness — how well an answer sticks to the retrieved sources — wie treu eine Antwort den gefundenen Quellen bleibt

ML — Machine Learning

GPU — Graphics Processing Unit

T&M — time and materials billing

sharding — splitting data across shards

retainer — fixed monthly fee for ongoing support — feste monatliche Pauschale für laufenden Support

Kontakt