Une réponse. Ses preuves.
Interrogez le corpus, comparez les configurations et inspectez les passages retrouvés.
Conçu par Thierno Sarré · Protocole et mesures du 9 septembre 2026
Ouvrez le capot.
Posez une question pour voir la réponse,
ses sources et le temps de recherche.
Les choix, expliqués.
Le problème
Comment retrouver la bonne information lorsque les documents contiennent du jargon et des règles qui changent entre deux versions ?
Les contraintes
20 sections de documentation Atlas API fictive, en français, avec une version active et des archives contradictoires. Exécution locale, sans clé API.
Décisions et arbitrages
Les sections servent de chunks sémantiques. Le baseline utilise des fenêtres de 180 caractères avec 30 caractères de recouvrement. La fusion RRF combine BM25 et les embeddings multilingues. Le cross-encoder reclasse 6 candidats. La reformulation enrichit la question avec un glossaire déterministe.
Limites connues
La réponse est un extrait du document, sans génération par LLM. Les questions sont rédigées pour ce corpus fictif. Le refus reste heuristique : une question de tarification absente du corpus peut recevoir un extrait non pertinent. Le reranker peut dégrader le classement, comme sur la vérification d’un webhook. Le parser PDF/HTML est fourni en CLI ; les imports ne sont pas ouverts aux visiteurs.
Quatre configurations.
Des résultats vérifiables.
| Configuration | Recall@3 | Refus corrects | Faux refus | Support extractif | Latence p95 | Coût API |
|---|---|---|---|---|---|---|
| Vectoriel seul | 85.7 % | 62.5 % | 30.4 % | 100.0 % | 13 ms | 0 €* |
| Hybride | 96.4 % | 62.5 % | 12.5 % | 100.0 % | 11 ms | 0 €* |
| Hybride + rerank | 96.4 % | 62.5 % | 14.3 % | 100.0 % | 60 ms | 0 €* |
| + reformulationRetenue | 96.4 % | 62.5 % | 10.7 % | 100.0 % | 51 ms | 0 €* |
Recall@3 + refus correct − faux refus ; latence p95 pour départager. Ce choix vaut pour ce jeu de démonstration ; il doit être réévalué sur vos données.
Protocole, métriques et limites
Recall@3 : part des 56 questions répondables dont le document attendu est dans les trois résultats. Refus corrects : part des 8 questions hors corpus refusées. Faux refus : questions répondables refusées. Support extractif : présence exacte de la réponse dans le passage cité ; ce n’est pas un score de faithfulness LLM.
- Corpus fictif de 20 sections publiques et 64 questions rédigées pour cette démonstration ; aucun jeu de test externe.
- Réponses extractives : le support textuel exact ne mesure pas la faithfulness d’un LLM ni la pertinence de la réponse.
- Une passe après préchauffage, CPU local, sans réseau et sans charge concurrente ; p95 indicatif.
- 0 € d’appels API ; calcul, hébergement et maintenance exclus.
- Reformulation par glossaire déterministe. Seuil de refus heuristique non calibré sur un jeu indépendant.