PLAYGROUND / LABORATOIRES IAConnexion au moteur…

Une réponse. Ses preuves.

Interrogez le corpus, comparez les configurations et inspectez les passages retrouvés.

Conçu par Thierno Sarré · Protocole et mesures du 9 septembre 2026

PlaygroundATLAS API
À ESSAYER
Corpus fictif. Les questions sont enregistrées localement pour l’audit. N’entrez pas de données sensibles.
Réponse & sources

Ouvrez le capot.

Posez une question pour voir la réponse,
ses sources et le temps de recherche.

QuestionRecherchePreuve
DERRIÈRE LA DÉMONSTRATION

Les choix, expliqués.

Le problème

Comment retrouver la bonne information lorsque les documents contiennent du jargon et des règles qui changent entre deux versions ?

Les contraintes

20 sections de documentation Atlas API fictive, en français, avec une version active et des archives contradictoires. Exécution locale, sans clé API.

01Document
02Chunking
03BM25 + vecteurs
04Cross-encoder
05Passage cité

Décisions et arbitrages

Les sections servent de chunks sémantiques. Le baseline utilise des fenêtres de 180 caractères avec 30 caractères de recouvrement. La fusion RRF combine BM25 et les embeddings multilingues. Le cross-encoder reclasse 6 candidats. La reformulation enrichit la question avec un glossaire déterministe.

Limites connues

La réponse est un extrait du document, sans génération par LLM. Les questions sont rédigées pour ce corpus fictif. Le refus reste heuristique : une question de tarification absente du corpus peut recevoir un extrait non pertinent. Le reranker peut dégrader le classement, comme sur la vérification d’un webhook. Le parser PDF/HTML est fourni en CLI ; les imports ne sont pas ouverts aux visiteurs.

LE BANC D’ÉVALUATION

Quatre configurations.
Des résultats vérifiables.

Rapport JSON
64 questions20 sections publiquesCPU arm64Exécuté le 09/09/2026
Mesures locales après préchauffage — une passe par configuration
ConfigurationRecall@3Refus correctsFaux refusSupport extractifLatence p95Coût API
Vectoriel seul85.7 %62.5 %30.4 %100.0 %13 ms0 €*
Hybride96.4 %62.5 %12.5 %100.0 %11 ms0 €*
Hybride + rerank96.4 %62.5 %14.3 %100.0 %60 ms0 €*
+ reformulationRetenue96.4 %62.5 %10.7 %100.0 %51 ms0 €*
Configuration retenue : + reformulation

Recall@3 + refus correct − faux refus ; latence p95 pour départager. Ce choix vaut pour ce jeu de démonstration ; il doit être réévalué sur vos données.

Protocole, métriques et limites

Recall@3 : part des 56 questions répondables dont le document attendu est dans les trois résultats. Refus corrects : part des 8 questions hors corpus refusées. Faux refus : questions répondables refusées. Support extractif : présence exacte de la réponse dans le passage cité ; ce n’est pas un score de faithfulness LLM.

  • Corpus fictif de 20 sections publiques et 64 questions rédigées pour cette démonstration ; aucun jeu de test externe.
  • Réponses extractives : le support textuel exact ne mesure pas la faithfulness d’un LLM ni la pertinence de la réponse.
  • Une passe après préchauffage, CPU local, sans réseau et sans charge concurrente ; p95 indicatif.
  • 0 € d’appels API ; calcul, hébergement et maintenance exclus.
  • Reformulation par glossaire déterministe. Seuil de refus heuristique non calibré sur un jeu indépendant.

L’assistant du portfolio

Connexion en cours…

À propos de Thierno

Le portfolio,
en conversation.

Parcours, projets, missions : posez votre question et retrouvez les pages utiles.