003 · SYSTÈMES RAG · FRANCE ENTIÈRE

Interrogez vos documents en langage naturel.

Un système RAG (Retrieval Augmented Generation) transforme votre corpus documentaire en base de connaissance interrogeable. Réponses sourcées, sans hallucination — le modèle cite d'où vient chaque information.

// VUE MÉTIER · POUR DIRIGEANTS
Vos documents PDF · Notion · Drive · wiki Le RAG cherche · cite · répond avec sources Réponse + liens sources

Trois briques. Vos documents nourrissent le RAG. Vos équipes posent des questions en langage naturel. Le système répond en citant les sources — vérifiables en un clic.

// VUE DÉTAILLÉE · POUR MANAGERS IT / MÉTIER
▸ INDEXATION · une fois par doc Docs sources PDF · DOCX · Notion Chunking passages 500-1000 tokens Embeddings BGE · OpenAI · Cohere Vector DB pgvector · Qdrant ▸ REQUÊTE · temps réel Question langage naturel Retrieval top-k + re-rank LLM + contexte Claude · GPT · Mistral Réponse sourcée + liens origine ▸ MONITORING · continu Feedback utilisateur 👍 / 👎 par réponse Métriques qualité precision · recall · latence Ré-indexation delta docs modifiés / ajoutés

Trois flux. Indexation asynchrone (une fois par doc). Requête temps réel (question → retrieval → LLM). Monitoring continu (feedback, qualité, delta). Le tout traçable.

// VUE TECHNIQUE · POUR DEV / DSI
// LAYER INGESTION unstructured.io docling · marker-pdf tika · pandoc Prefect · Airflow (planification) // LAYER STORAGE + INDEX PostgreSQL 16 + pgvector HNSW index · IVFFlat backup BGE-m3 embeddings multilingue · 1024d · souverain Blob storage (S3/OVH) docs sources originaux // LAYER RETRIEVAL + GENERATION Hybrid search BM25 + vector · RRF Re-ranker cross-encoder BGE-reranker · top 5 Claude Sonnet · citations forcées structured output · zero hallucination guardrail // LAYER MONITORING + EVAL Langfuse RAGAS eval Prometheus + Grafana Feedback UI intégré

Quatre layers. Ingestion (parseurs robustes) · Storage/index (pgvector + BGE) · Retrieval + Generation (hybride + re-ranker + citations forcées) · Monitoring (Langfuse + RAGAS). Stack éprouvée, self-hostable, 100% souverain possible.

✦ PROJET-TYPE · RAG sur 1 corpus

4 à 6 semaines, du corpus brut à la production.

Ingestion, indexation, tuning retrieval, mise en production. Chaque phase produit un livrable démontrable — vous voyez l'avancement en continu.

À partir de
12 k€
// fourchette 12-35 k€ selon volume
Semaine 01

Cadrage + audit corpus

≈ 15% budget
Semaine 02

Ingestion + indexation

≈ 30% budget
Semaines 03-04

Retrieval + tuning

≈ 40% budget
Semaines 05-06

Interface + prod

≈ 15% budget
// FOURCHETTES SELON VOLUME ET COMPLEXITÉ
Palier simple

RAG mono-corpus

12-18 k€
4-5 sem · < 5 000 docs
Un corpus homogène (wiki, FAQ, procédures), interface web simple, formats standards. Cas type : base connaissance interne, support N1.
Palier standard

RAG multi-sources

18-25 k€
5-7 sem · 5-50 k docs
Plusieurs sources (Drive + Notion + intranet), formats mixtes, ré-indexation delta, filtres par droits utilisateurs. Le format le plus fréquent.
Palier avancé

RAG souverain complexe

25-40 k€
7-10 sem · 50 k+ docs
100% self-hosted (Mistral + BGE), scan OCR, retrievers agents multi-étapes, éval automatisée continue. Cas type : santé, défense, données sensibles.
Coûts additionnels · run

À prévoir

Embeddings : 20-200 €/mois selon volume. Vector DB : inclus si pgvector self-hosted. LLM : 100-600 €/mois. Ré-indexation : automatisée.

Ce qui déplace le curseur

Trois variables

Hétérogénéité des sources, exigence de souveraineté, volume total. Un RAG souverain multi-sources coûte 2× un RAG standard mono-corpus.

Un corpus documentaire dormant ?

Décrivez-le — je vous dis si un RAG est pertinent. 30 min gratuites + devis ferme sous 48h.

Prendre rendez-vous