Un chatbot IA branché sur un forum :
le web 1.0 comme base de connaissances
Des années de pannes résolues, de restaurations documentées, de réponses de spécialistes — les forums sont des mines de savoir. Mais ce savoir dort dans un format que les assistants IA ignorent. Retour d’expérience concret : depuis l’été 2026, le chatbot de prv-concept.com — le « Père Hervé », mascotte chef d’atelier de l’association dédiée au V6 PRV — répond aux visiteurs en s’appuyant sur le forum phpBB de la communauté. Voici comment, et surtout avec quels garde-fous.
Le paradoxe du web 1.0
Un forum de passionnés est ce qui se rapproche le plus d’une base de connaissances vivante : les questions y sont posées avec les mots réels des utilisateurs, les réponses viennent de gens qui ont démonté le moteur, et chaque cas résolu reste archivé. C’est précisément ce qu’aucun modèle de langage ne sait restituer : ces discussions ne sont pas dans ses corpus d’entraînement, ou n’y figurent que par fragments. Interrogé « à froid », un LLM sur un sujet aussi pointu que le V6 PRV fait ce qu’il fait toujours quand il ne sait pas : il improvise avec aplomb. Les puristes objecteront qu’un forum — du contenu créé par ses membres — relève techniquement des prémices du web participatif, le « 2.0 » avant la lettre ; « web 1.0 » est ici le raccourci que tout le monde emploie pour ce web d’avant, rendu côté serveur et fier de sa pagination.
Le réflexe classique serait de moderniser le forum ou de réécrire son contenu. Mauvaise idée : la communauté y vit très bien, et la valeur est justement dans son historique. La bonne question est : comment faire de cet existant, sans le toucher, la source de vérité d’une IA moderne ?
L’architecture : un modèle qui ne « sait » rien — et c’est voulu
Le Père Hervé fonctionne en RAG (retrieval-augmented generation) : le modèle de langage n’a aucune connaissance propre du site. À chaque question, le serveur assemble un dossier de faits, et le modèle a pour instruction de répondre uniquement à partir de ce dossier. Trois sources l’alimentent :
- Un socle rédigé — l’identité de l’association, l’histoire du moteur, les fiches véhicules : des faits stables, maintenus comme du contenu éditorial ;
- Le forum, en direct — les sujets et l’activité de la communauté au moment où la question est posée ;
- La boutique, en direct — les produits réellement disponibles, via l’API du site marchand.
Pourquoi interroger directement la base de données du forum
Le chatbot ne « lit » pas les pages du forum : il interroge directement sa base de données, par des requêtes ciblées sur les tables de phpBB. Ce choix est d’abord une affaire de performance : pas d’allers-retours HTTP ni de HTML à analyser — quelques requêtes indexées, exécutées en millisecondes sur le même hébergement, là où parcourir les pages aurait ajouté des secondes à chaque réponse. Il garantit ensuite la fraîcheur : un sujet posté il y a une minute est déjà interrogeable, sans réindexation ni cache à invalider. Il donne enfin un contrôle fin : on choisit précisément les colonnes exposées — titres, forums publics, dates — et rien d’autre n’atteint jamais le modèle.
Apprendre à l’IA à ne pas inventer
Brancher les sources ne suffit pas : il faut apprendre au modèle à s’en tenir aux faits. Quatre règles, toutes nées d’un dérapage observé puis corrigé :
- Zéro connaissance implicite. Si le dossier de faits ne contient pas la réponse, le chatbot le dit et oriente vers le forum ou l’association — il ne complète jamais avec sa « culture générale », premier réservoir à hallucinations.
- Citer les titres de sujets mot pour mot. Un titre paraphrasé est un sujet inventé : le visiteur ne le retrouvera pas. Les titres remontés de la base sont restitués verbatim, avec leur lien.
- Ne rien présumer des membres. Sur le forum d’une association dédiée à un moteur V6, tous les véhicules des membres n’ont pas ce moteur — il y a là-bas une Renault 25 turbo-Diesel. Le chatbot a appris à ne pas « corriger » la réalité pour la rendre plus cohérente.
- Une température basse et des réponses courtes. Moins on laisse le modèle « créer », moins il dérive ; et une réponse concise se vérifie d’un coup d’œil.
Les garde-fous : côté serveur, pas seulement dans le prompt
La leçon la plus importante de ces semaines de mise au point : les instructions données au modèle ne sont pas des garanties. Un modèle économique paraphrase, oublie, se laisse embarquer par la formulation d’une question. Chaque règle critique existe donc en deux exemplaires : une consigne dans le prompt, et un mécanisme déterministe côté serveur qui s’applique quoi qu’il arrive.
- Filtrage du contenu sensible. Tout forum vivant contient des échanges qui n’ont pas leur place dans la bouche de l’assistant officiel du site : certains sujets sont écartés des réponses côté serveur, silencieusement — pas seulement « interdits » au modèle.
- Vie privée des membres. Le chatbot ne publie des personnes que ce que le site rend public : les rôles au bureau, rien de plus.
- Aucun lien externe. Le chatbot ne pointe jamais hors du site — les URLs sont vérifiées et réécrites au besoin après génération.
- Un repli résilient. Si le modèle est indisponible, les données réelles — sujets du forum, produits de la boutique — restent servies telles quelles, et l’interface l’annonce honnêtement.
- Des tests de régression sur le vrai chatbot. Chaque règle a son test automatisé, exécuté contre le chatbot en production : des assertions vérifient ce qu’il doit dire, et surtout ce qu’il ne doit jamais dire. Aucun déploiement sans suite verte.
Quand le chatbot devient membre du forum
Dernière étape, la plus inattendue : le Père Hervé n’est pas qu’un guichet de réponses — il participe. La validation des inscriptions au forum est automatisée par un script planifié, et c’est le compte « Père Hervé » qui envoie les messages privés de bienvenue et répond aux présentations des nouveaux membres. Même identité des deux côtés : quand on demande au chatbot comment se passe une inscription, il répond « je t’enverrai un message de bienvenue » — à la première personne, parce que c’est vrai.
Ce que ce chantier démontre
Ce qui vaut pour un forum phpBB vaut pour tout patrimoine documentaire : wiki interne, FAQ historique, base de tickets, archives métier. Trois enseignements transposables :
- L’existant est un actif IA. Pas besoin de refondre ni de migrer : le RAG se branche sur ce qui est là, et l’interrogation directe des données en fait une source rapide et toujours fraîche.
- Pas de réentraînement. Le savoir reste dans vos données, sous votre contrôle — le modèle n’apprend rien, il consulte. Le jour où un fait change, la réponse change.
- La confiance vient des garde-fous. La différence entre un gadget et un outil que l’association assume publiquement, ce ne sont pas les capacités du modèle : ce sont les règles apprises, les protections serveur et les tests qui les verrouillent.
Le résultat se teste en direct sur prv-concept.com — et la fiche complète de la réalisation est sur notre page Réalisations. Un patrimoine documentaire à valoriser, un chatbot à ancrer dans vos données ? C’est le cœur de notre offre de création de sites propulsés par l’IA — parlons-en, réponse sous 48 h ouvrées.
Cet article vit aussi sur les réseaux — venez en discuter
