Illustration : un tableau blanc avec le pipeline d’ingestion esquissé au marqueur : sources, chunks, provenance, un canal de chat.
Une illustration du contexte, et non une photographie.

Des heures d’attente
aux réponses en quelques secondes.

Réponses avec sources à l’appui. Une couche ajoutée à la plateforme d’inférence d’IA existante de l’entreprise, qui gardait la documentation technique et le code source synchronisés dans des bases de connaissances dédiées, et qui répondait à partir de celles-ci en joignant la source. Les équipes terrain obtenaient de vraies réponses pour leurs clients dans Slack en quelques secondes plutôt qu’en quelques heures.

Contexte
Bâti par François dans le cadre de son travail chez une grande entreprise de logiciels, sur sa plateforme d’inférence d’IA existante.
Service
Synchronisation et ingestion des connaissances (documentation, code source), retrieval et grounding des citations, evaluation harness, gouvernance des données, diffusion dans Slack.
Secteur
Logiciels d’entreprise
Spécialité
Bâtir et intégrer l’IA
Statut
En service. Plus de vingt bases de connaissances, ouvertes à toute l’entreprise.

Aperçu

Dans une grande entreprise de logiciels, les réponses dont les gens avaient besoin existaient déjà dans la documentation, le code source, les tickets et les réponses passées. Les trouver, c’était ça, le travail. L’entreprise avait déjà une plateforme d’inférence d’IA. Ce qui manquait, c’était la couche qui transforme des sources techniques éparpillées en bases de connaissances dédiées et qui les garde synchronisées. Cette couche a été bâtie par-dessus, à travers les API de la plateforme, sans rien rebâtir de ce qui fonctionnait déjà. Plusieurs mécanismes de diffusion ont été livrés; celui qui l’a emporté à l’usage, ce sont les canaux Slack, où les équipes terrain répondaient rapidement à de vraies questions de clients.

Défi

Les questions techniques prenaient généralement de 2 à 3 heures avant d’obtenir une réponse, d’après les historiques de communication précédant le workflow. Le temps passait à chercher, à demander et à attendre, et la même question recevait plusieurs réponses, différentes. Une réponse sans source ne pouvait pas être utilisée en confiance avec un client. Une base de connaissances devenue périmée la semaine suivant son chargement était pire que rien. Un deuxième stack d’inférence aurait aussi ajouté de l’infrastructure et des frais d’exploitation.

Solution

Une couche d’ingestion partagée dans laquelle n’importe quelle équipe interne pouvait brancher une base de connaissances, avec des synchronisations automatisées depuis la documentation et le code source pour garder les bases à jour : des content transformers et une source factory partagée pour normaliser ce qui entrait, un chunking ajusté pour la qualité du retrieval, la résolution des liens et la normalisation des URL canoniques pour que chaque passage renvoie à une seule adresse, et la provenance estampillée sur chaque chunk.

Par-dessus, le retrieval avec grounding des citations, la sécurité par l’ingénierie du prompt système, et un evaluation harness utilisant un LLM-as-judge pour mesurer la qualité du retrieval et repérer les régressions. Un audit automatisé et la gouvernance des données déterminaient à quoi le contenu de chaque équipe pouvait servir, et pour qui. L’inférence elle-même restait sur la plateforme de l’entreprise.

Résultats

Des heures d’attente aux réponses en quelques secondes.

Temps de réponse, avant
Généralement 2 à 3 heures
Temps de réponse de l’IA, après
Généralement 5 à 10 secondes
Adoption
Environ 600 utilisateurs et 2 000 questions sur cinq mois
Satisfaction des utilisateurs
Plus de 80 % parmi les réponses évaluées
Couverture de la rétroaction
Environ 40 % des questions ont reçu une évaluation de l’utilisateur, soit à peu près 800 réponses

Les temps de réponse reflètent les historiques de courriels, de Slack et d’autres communications, avant et après. La satisfaction reflète les évaluations soumises par les utilisateurs; les réponses non évaluées sont exclues. Le temps de résolution complète n’a pas été mesuré de façon constante. Les chiffres d’adoption couvrent une seule base de connaissances, et la couverture de la rétroaction est approximative.

  • Les équipes d’avant-vente, d’après-vente et de go-to-market recevaient des réponses techniques avec sources dans Slack pendant leur travail avec les clients.
  • Bâti sur la plateforme d’inférence existante, sans deuxième stack d’inférence à exploiter.
  • Les capacités d’évaluation du retrieval, de provenance et d’audit soutenaient des contrôles de qualité continus. Les évaluations de satisfaction des utilisateurs étaient distinctes de l’évaluation automatisée.

Expérience pertinente en retrieval de connaissances, en intégrations de systèmes et en évaluation de l’IA.