RAG-System auf Unternehmensdokumenten: Projektumfang und Kosten

Ein unternehmerisches RAG-System (Retrieval-Augmented Generation) ist nicht „PDF in ChatGPT hochladen“, sondern Infrastruktur, die Richtlinien, Verträge, Anleitungen und Wissensbasen indexiert, relevante Abschnitte findet und Antworten mit Quellenangaben erzeugt. 2026 ist das Standard für interne Assistenten, Support und Compliance-Anfragen. Unten: Projektbestandteile, Phasen, Zeitrahmen und realistische Budgetspannen.
- MVP mit einer Quelle (Confluence, SharePoint, PDF-Ordner) - $8.000 - $25.000, 4-8 Wochen
- Unternehmens-RAG-Plattform (mehrere Quellen, RBAC, Audit) - $35.000 - $120.000, 3-5 Monate
- Enterprise: On-Prem, DLP, SLA, Mehrsprachigkeit - $120.000 - $350.000+, 6-10 Monate
- Monatliche Kosten - Embeddings, LLM-API, Vektor-DB, Reindexierung: ab $300 bis $12.000+
- Hauptpreistreiber - nicht das Modell (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash), sondern Retrieval-Qualität und Tiefe der DMS-Integrationen

Was RAG auf Unternehmensdokumenten bedeutet
RAG erweitert ein LLM um Suche in Ihren Daten: Das Modell „kennt“ die Urlaubsregelung nicht auswendig, sondern erhält relevante Absätze aus dem Vektorindex und baut die Antwort darauf. Für Unternehmen weniger Halluzinationen und prüfbare Quellen.
Typische Szenarien:
- Mitarbeiter fragt nach Vertragsfreigabe - System findet den Confluence-Abschnitt und zitiert die Klausel;
- Support erhält Entwurf aus aktueller Zendesk-Wissensbasis;
- Recht sucht Präzedenzfälle im Vertragsarchiv mit Filtern nach Partnertyp und Datum.
Ohne RAG antwortet ein Firmen-Chatbot allgemein oder „erfindet“ interne Regeln. Mit RAG ist die Antwort an prüfbare Dokumente gebunden.
Projektbestandteile
Acht Blöcke - jeder beeinflusst Zeit und Budget.
| Block | Inhalt | Typischer Anteil |
|---|---|---|
| Discovery | Datenquellen, Rollen, Qualitäts-KPIs, Datenschutz | 8-12% |
| Ingestion (ETL) | Confluence, SharePoint, Google Drive, CRM, Tickets, ERP | 15-25% |
| Chunking und Preprocessing | Fragmentierung, Bereinigung, Metadaten, OCR | 10-15% |
| Embeddings und Index | Embedding-Modell, Vektor-DB, Hybridsuche (BM25 + Vektor) | 10-15% |
| Retrieval-Pipeline | Reranking, Rollenfilter, Deduplizierung, Query Expansion | 15-20% |
| Generation Layer | Prompts, Zitate, Guardrails, Fallback bei niedriger Konfidenz | 10-15% |
| Interface und API | Widget, Slack/Teams, Intranet, Headless-API | 10-20% |
| Observability und Eval | Retrieval-Metriken, Testfragen, A/B, Alerts | 8-12% |
Schlüsselfertig: indexierte Quellen, Antworten in Zielkanälen, Query-Logging, Pilot, Übergabe mit Reindex-Dokumentation.
Entwicklungsphasen
1. Datenaudit und Lastenheft (1-2 Wochen)
Festlegung von Quellen, Volumen, Zugriff (SSO, RBAC), Metriken (precision@k, Zitatgenauigkeit, CSAT). Ergebnis: Quellenkarte, Rechtematrix, 50-200 Eval-Fragen aus der Praxis.
2. Ingestion-Prototyp (2-4 Wochen)
Erste Quelle, voller Zyklus: Export/Webhook, Parsing (HTML, DOCX, PDF), Chunking, Schreiben in Vektor-DB mit Metadaten. Stack: LangChain / LlamaIndex, Unstructured, Apache Tika, SharePoint/Confluence-Connectors.
3. Retrieval und Suchqualität (3-6 Wochen)
Embedding-Modell, Vektor-DB (pgvector, Qdrant, Weaviate), Hybridsuche, Reranker (+15-30% Genauigkeit), abteilungsbezogene Filter. Ohne Eval-Iterationen bricht Retrieval in Produktion.
4. Generation und Guardrails (2-4 Wochen)
Prompt „nur aus Kontext antworten“, Zitate, „weiß nicht“ bei niedrigem Score, Schutz vor Prompt Injection, Modell-Routing (Flash/Luna vs Terra/Sonnet).
5. Integrationen und UI (2-6 Wochen)
Intranet-Widget, Slack/Teams-Bot, SSO, Admin-Panel, API für CRM und Tickets.
6. Pilot und Produktion (2-4 Wochen)
Regression auf Eval-Set, Pilot mit 50-200 Nutzern, Monitoring, Runbook.
Kosten nach Projekttyp
MVP - eine Quelle
| Parameter | Wert |
|---|---|
| Budget | $8.000 - $25.000 |
| Dauer | 4-8 Wochen |
| Quellen | 1 |
| Nutzer | bis 100 |
Unternehmens-RAG-Plattform
| Parameter | Wert |
|---|---|
| Budget | $35.000 - $120.000 |
| Dauer | 3-5 Monate |
| Quellen | 3-8 |
| Nutzer | 200-5.000, RBAC, SSO |
Enterprise
| Parameter | Wert |
|---|---|
| Budget | $120.000 - $350.000+ |
| Dauer | 6-10 Monate |
| Anforderungen | On-Prem/VPC, DLP, GDPR/HIPAA, SLA 99,9% |
Monatliche Kosten (OPEX)
| Posten | Bereich/Monat |
|---|---|
| Embeddings | $50 - $800 |
| LLM-API | $200 - $8.000 |
| Vektor-DB | $70 - $600 |
| Rerank | $30 - $400 |
| Hosting | $100 - $1.500 |
| Support | $1.000 - $8.000 |
Beispiel: 5.000 Dokumente, 3.000 Anfragen/Monat - ca. $250-400/Monat. Bei 50.000 Anfragen: $3.000 - $12.000/Monat.
Zeitplan und Team
| Typ | Team | Dauer |
|---|---|---|
| MVP | 1 Backend + ML (Teilzeit) | 4-8 Wochen |
| Plattform | 2 Backend, 1 ML, 1 Frontend, PM | 3-5 Monate |
| Enterprise | 4-7 + DevOps, QA, Security | 6-10 Monate |
Stundensätze 2026 (Remote, Osteuropa/GUS): ML/RAG $60-100/h, Backend $45-80/h. USA/Westeuropa: Faktor 2-3.
Was das Projekt verteuert
Viele Legacy-Formate, dokumentenbezogenes RBAC (+20-35%), Mehrsprachigkeit (+25-40%), Echtzeit-Updates, On-Prem mit GPU (+$500-3.000/Monat).
Kosten sparen
- Ein Abteilung, eine Quelle, 30-50 Referenzfragen.
- Eval ab Woche eins.
- Hybridsuche + Rerank statt Fine-Tuning am Anfang.
- Modell-Routing für einfache vs komplexe Fragen.
- Semantischer Cache (20-40% API-Ersparnis).
- Festpreis MVP, T&M für neue Connectors.
Wann sich RAG nicht lohnt
- Weniger als 20-30 Dokumente, die selten wechseln - ein normales FAQ reicht, die RAG-Infrastruktur zahlt sich nicht aus.
- Niemand pflegt die Quellen nach dem Start - ohne laufende Pflege veraltet das System schnell und verliert das Vertrauen der Mitarbeiter.
- Es braucht eine exakte Berechnung oder Aktion statt einer Textantwort - RAG ersetzt keine Workflow-Automatisierung oder direkte ERP/CRM-Integration.
- Budget und Zeit reichen nur für einen zweiwöchigen Pilot - schon ein MVP braucht 4-8 Wochen und ab $8.000; sonst besser ein fertiger FAQ-Bot statt vollem RAG.
Fazit
RAG auf Unternehmensdokumenten 2026: $8.000 (MVP) bis $350.000+ (Enterprise). 4-8 Wochen bis 10 Monate. Treiber: Quellen, Rechte, Retrieval-Qualität, Traffic. Ingestion und Suche entscheiden über Nutzen vs Demo mit Halluzinationen.
Aktuelle Orientierung zu den Servicekosten - auf der Preisseite.
Wenn Sie Hilfe bei Entwicklung, KI-Einführung oder Website-Betreuung für Ihr Projekt brauchen - schreiben Sie mir.
Häufig gestellte Fragen
Unterschied RAG vs Fine-Tuning?
Fine-Tuning bindet Wissen in Gewichte - teure Updates, schwache Quellenangaben. RAG aktualisiert per Reindexierung. Für sich ändernde Firmendokumente startet man mit RAG.
RAG ohne Entwicklung via ChatGPT Enterprise oder Copilot?
Teilweise für Piloten mit wenigen hundert Dokumenten. Für Produktion mit SSO, Audit und tausenden Dokumenten: Custom-RAG ab ca. $35.000.
Wie viele Dokumente?
MVP: 500-5.000 Dokumente. Plattform: 100.000+ mit Sharding. OCR-Archive im Millionenbereich: +30-50% Budget.
Qualität messen?
Eval-Datensatz mit 50-200 Fragen. Metriken: recall@k, faithfulness, citation accuracy. Ziel: recall@5 > 85%, faithfulness > 90% im Pilot.
Support nach Launch?
Retainer $1.000 - $5.000/Monat oder 15-25%/Jahr der Entwicklungskosten: Monitoring, Eval-Updates, Connector-Fixes, Prompt-Tuning. Ohne Support Degradation in 3-6 Monaten.
Begriffe in diesem Artikel
MVP — Minimum Viable Product
on-prem — software hosted in your own infrastructure — Software in der eigenen Infrastruktur, nicht in der Cloud
embeddings — numeric vectors that capture text meaning — numerische Vektoren, die Textbedeutung abbilden
SLA — Service Level Agreement
DLP — Data Loss Prevention
RAG — Retrieval-Augmented Generation
LLM — Large Language Model
Confluence — Atlassian wiki for team documentation — Atlassian-Wiki für Teamdokumentation
chunking — splitting documents into retrieval-friendly pieces — Aufteilen von Dokumenten in suchbare Fragmente
query expansion — broaden a query to improve recall
ETL — Extract, Transform, Load
CRM — Customer Relationship Management
reranking — reordering search results by relevance — Neusortierung von Suchergebnissen nach Relevanz
ERP — Enterprise Resource Planning
guardrails — rules and filters that keep AI outputs safe and on-policy — Regeln und Filter, die KI-Antworten sicher und regelkonform halten
observability — logs, metrics and traces to understand system behavior — Logs, Metriken und Traces zum Verständnis des Systems
OCR — Optical Character Recognition
fallback — backup path used when the primary option fails — Ausweichweg, wenn der Hauptweg scheitert
widget — embedded UI component
LlamaIndex — framework for connecting LLMs to private data — Framework zum Anbinden von LLMs an private Daten
prompt injection — attack that manipulates model behavior via input — Angriff, der Modellverhalten über Eingaben manipuliert
LangChain — framework for building LLM applications — Framework für LLM-Anwendungen
RBAC — Role-Based Access Control
webhook — HTTP callback when an event happens — HTTP-Rückruf bei einem Ereignis
retrieval — finding relevant context before generation — Finden relevanter Kontexte vor der Generierung
SSO — Single Sign-On
reranker — model that reorders search hits by relevance — Modell, das Treffer nach Relevanz neu sortiert
regression — bug where a previously working feature breaks again — Bug, bei dem eine zuvor funktionierende Funktion wieder bricht
fine-tuning — additional training of a model on domain data — zusätzliches Training des Modells auf Domänendaten
runbook — step-by-step playbook for incidents and operations — Schritt-für-Schritt-Anleitung für Incidents und Betrieb
GDPR — General Data Protection Regulation
HIPAA — Health Insurance Portability and Accountability Act
frontend — client-side UI of a site or app — clientseitige Oberfläche einer Site/App
backend — server-side logic, APIs and data layer — serverseitige Logik, APIs und Datenschicht
VPC — Virtual Private Cloud
citation accuracy — citations point to the right place
DevOps — Development and Operations
faithfulness — how well an answer sticks to the retrieved sources — wie treu eine Antwort den gefundenen Quellen bleibt
ML — Machine Learning
GPU — Graphics Processing Unit
T&M — time and materials billing
sharding — splitting data across shards
retainer — fixed monthly fee for ongoing support — feste monatliche Pauschale für laufenden Support