Accueil/Préparation IA

Comment convertir les documents WordStar pour les pipelines RAG et l'ingestion LLM

Un guide pratique pour transformer une archive .WS héritée en texte prêt pour l'IA — localement, en toute sécurité, et à grande échelle.

TL;DR

Convertir WordStar documents en Markdown pour la récupération et texte brut pour le triage. Évitez PDF comme intermédiaire — il convertit la structure en mise en page puis vous fait deviner la structure avec des heuristiques d'extraction. WordStar Converter fait cela localement en masse, donc les documents confidentiels ne quittent jamais votre réseau en chemin vers votre système d'IA privé.

Le problème : les documents anciens sont invisibles pour l'IA

Si votre organisation existe depuis trente ans, une partie significative de sa mémoire institutionnelle se trouve dans des formats qu’aucun pipeline d’ingestion ne peut lire. WordStar était largement utilisé dans les cabinets d’avocats, les administrations gouvernementales, les universités et les hôpitaux au cours des années 1990, ce qui signifie que les politiques fondatrices, les contrats originaux, les premières spécifications techniques et le raisonnement derrière les décisions toujours en vigueur aujourd’hui peuvent tous se trouver dans des fichiers .ws.

Le mode de défaillance est subtil. Un système de récupération privé de son corpus historique ne dit pas « Je n'ai pas cela » — il répond avec confiance à partir de ce qu'il possède, et la réponse omet le contexte qui explique pourquoi les choses sont telles qu'elles sont. Personne ne le remarque, car l'écart est invisible de l'extérieur.

Étape par étape : WordStar vers la base de données vectorielle

Le flux de travail pour rendre une archive .WS héritée prête pour l'IA :

1

Inventoriez vos archives sources

Repérez chaque fichier .ws, y compris les variantes en majuscules .WS et les fichiers versionnés .wsd / .ws3–.ws8 laissés par les systèmes DOS. WordStar Converter parcourt récursivement des arborescences entières : un seul passage sur un ancien serveur de fichiers en trouve généralement plus que prévu.

2

Convertissez en Markdown (et en TXT pour le tri)

Produisez les deux formats en une seule passe. Le Markdown alimente l’index, car les titres, listes et tableaux sont conservés comme une vraie structure. Le texte brut permet de fouiller rapidement le corpus, de calculer des empreintes pour repérer les doublons et d’identifier les modèles vides avant d’y consacrer du budget d’embeddings.

3

Découpez par titre, pas par nombre de caractères

Un découpage de taille fixe coupe les arguments en plein milieu et sépare une conclusion de son raisonnement. Découpez aux limites des titres avec un léger chevauchement, et reportez le chemin des titres dans le texte du fragment pour que la recherche sache d’où provient chaque passage.

4

Ajoutez des métadonnées pour filtrer

Étiquetez chaque fragment avec le nom du fichier source, la date du document, le service et le chemin du dossier. Avec des corpus historiques, le filtrage par métadonnées est indispensable : « que disait la politique de 1996 ? » est un filtre plus une recherche, jamais une recherche seule.

5

Calculez les embeddings en local

Utilisez un modèle d’embeddings local – BGE, E5 ou une variante de Sentence-Transformers – plutôt qu’une API hébergée. Si la confidentialité justifie la création d’un système privé, envoyer le corpus à un service d’embeddings tiers ruine la démarche.

6

Chargez dans votre base vectorielle et interrogez-la

Stockez les vecteurs dans pgvector, Chroma, Qdrant ou Weaviate. Demandez au modèle d’indiquer la date de toute source historique et ajoutez un petit glossaire qui fait correspondre les anciens noms de services et codes produits aux actuels : le rappel sur les corpus anciens s’améliore nettement pour un coût quasi nul.

Comparaison des formats : quel est le meilleur résultat pour l'IA ?

Tous les résultats ne sont pas égaux pour l'ingestion de LLM. Voici comment les cibles réalistes se comparent :

FactorMarkdownTXTHTMLPDFBrut .ws
LLM LisibilitéExcellentGoodBien (bruit de balise)FairNone
Efficacité des jetonsHighHighestFaible (surcharge de balisage)Faible (bruit d'extraction)N/A
Structure pour le découpageVrais titres et tableauxNoneVrais titres et tableauxDépendant de la mise en pageIllisible
TablesLes tables de tuyaux conservent les liens d'en-tête/valueLignes lisibles uniquementÉléments de table réelsLes en-têtes se détachent des valeursN/A
ÉquationsLaTeX — consultableLaTeX ou abandonnéImages ou MathMLImages seulementN/A
Complexité de traitementIngestion directeIngestion directeHTML décapagePDF analyseur / OCRAucun analyseur n'existe dans la pile
Meilleur pourRAG sur les documents ; docs-comme-codeTriage, déduplication, classificationPublication et exploration intranetLecture humaine, dossiers de rétentionRien (source de vérité seulement)

Quel est le meilleur format pour introduire des documents hérités dans un LLM ?

Markdown, dans presque tous les cas. Il conserve la hiérarchie des titres dont votre séparateur de texte a besoin, préserve la structure des tableaux et transporte les équations sous forme de LaTeX plutôt que comme images. Utilisez texte brut à côté de lui pour le triage et la déduplication. Éviter PDF En tant qu'intermédiaire — l'extraction PDF réintroduit les en-têtes courants, la césure et la confusion de l'ordre des colonnes comme du bruit que le modèle doit ensuite analyser.

Pourquoi les drapeaux de wrap et les commandes point décident de la qualité des chunks

Markdown n'a aucun concept de drapeau de dépassement de bit élevé — il a des paragraphes et des niveaux de titre. La seule façon pour un convertisseur de savoir où une phrase se termine réellement, ou qu'une ligne est un en-tête à partir de .he, consiste à interpréter le flux natif WordStar. Avec cela, vous obtenez une véritable structure sur laquelle segmenter. Sans cela, vous obtenez une séquence plate de données corrompues à bits élevés et vous perdez le seul avantage pour lequel vous avez converti en Markdown.

Donc, avant de convertir une archive pour un pipeline de récupération, convertissez un échantillon représentatif et vérifiez que les titres, les en-têtes de page et les sauts de paragraphe ont été conservés. Cela prend une minute et cela détermine la qualité de tout ce qui suit.

Pourquoi le traitement local est important pour les pipelines d'IA

La plupart des équipes construisent des systèmes privés RAG spécifiquement pour garder le matériel réglementé — contrats, dossiers d'affaires, dossiers du personnel, correspondance des patients — en dehors de l'infrastructure tierce. Utiliser un convertisseur basé sur le cloud pour préparer ces documents va à l'encontre de l'objectif, et il est facile de passer cela inaperçu car la conversion est considérée comme de la plomberie plutôt que comme du traitement.

WordStar Converter traite tout sur votre machine, donc la chaîne de garde reste ininterrompue du fichier .ws jusqu'au magasin de vecteurs. Associez-le à un modèle d'encodage local et à une base de données vectorielle auto-hébergée et vous pourrez déclarer honnêtement lors d'un audit de conformité que le corpus n'a jamais quitté le réseau.

Lecture associée

Prêt à rendre vos archives WordStar prêtes pour l'IA ?

Téléchargez l'essai gratuit et convertissez jusqu'à 10 fichiers. Voyez à quelle vitesse .WS devient un texte propre et structuré pour votre pipeline RAG.

Essai gratuit

Toutes les fonctions de l’app — jusqu’à 10 fichiers

Windows 10 ou 11

Téléchargez l’installateur Windows pour l’essai complet de 10 fichiers. La même app que vous débloquez avec une licence — 100 % local sur votre PC.

Acheter Standard — à partir de $39.95