Hoe WordStar-documenten te converteren voor RAG-pijplijnen en LLM-ingestie
Een praktische handleiding om een legacy .WS-archief om te zetten naar AI-klaar tekstmateriaal — lokaal, veilig en op grote schaal.
TL;DR
Converteer WordStar documenten naar Markdown voor ophalen en platte tekst voor triage. Vermijd PDF als tussenstap — het zet structuur om in lay-out en laat je vervolgens de structuur proberen terug te raden met extractieheuristieken. WordStar Converter doet dit lokaal in bulk, zodat vertrouwelijke documenten je netwerk nooit verlaten op weg naar je privé-AI-systeem.
Het probleem: verouderde documenten zijn onzichtbaar voor AI
Als je organisatie al dertig jaar bestaat, bevindt een aanzienlijk deel van haar institutionele geheugen zich in formaten die geen enkel innameproces kan lezen. WordStar werd gedurende de jaren 90 veel gebruikt in advocatenkantoren, overheidsdepartementen, universiteiten en ziekenhuizen, wat betekent dat oprichtingsbeleid, originele contracten, vroege technische specificaties en de overwegingen achter beslissingen die vandaag de dag nog van kracht zijn, allemaal nog in .ws-bestanden kunnen zitten.
De faalmode is subtiel. Een zoek- of herinneringssysteem dat zijn historische corpus mist, zegt niet 'Dat heb ik niet' — het geeft zelfverzekerd antwoord op basis van wat het wel heeft, en het antwoord laat de context weg die uitlegt waarom de dingen zijn zoals ze zijn. Niemand merkt het, omdat de kloof van buitenaf onzichtbaar is.
Stap-voor-Stap: WordStar naar Vector Database
De workflow om een legacy .WS-archief AI-klaar te maken:
Inventariseer je bronarchieven
Zoek elk .ws-bestand op, inclusief varianten in hoofdletters (.WS) en genummerde .wsd- / .ws3–.ws8-bestanden die DOS-systemen hebben achtergelaten. WordStar Converter doorzoekt complete mappenstructuren recursief, dus één ronde over een uitgefaseerde bestandsserver vindt meestal meer dan iemand had verwacht.
Converteer naar Markdown (en TXT voor triage)
Maak beide formaten in één keer. Markdown voedt de index, omdat koppen, lijsten en tabellen als echte structuur behouden blijven. Platte tekst biedt een snelle manier om het corpus te doorzoeken, hashes te berekenen om duplicaten te vinden en lege sjablonen op te sporen voordat je er embeddingbudget aan besteedt.
Deel op per kop, niet per aantal tekens
Opdelen in vaste groottes knipt argumenten doormidden en scheidt een conclusie van de onderbouwing. Splits op kopgrenzen met een bescheiden overlap en neem het koppenpad op in de tekst van elk fragment, zodat de zoekfunctie weet waar elke passage vandaan komt.
Voeg metadata toe om te filteren
Label elk fragment met de bronbestandsnaam, documentdatum, afdeling en mappad. Bij historische corpora is filteren op metadata onmisbaar: ‘wat stond er in het beleid van 1996’ is een filter plus een zoekopdracht, nooit alleen een zoekopdracht.
Maak embeddings lokaal
Gebruik een lokaal embeddingmodel – BGE, E5 of een Sentence-Transformers-variant – in plaats van een gehoste API. Als vertrouwelijkheid de reden is om een privésysteem te bouwen, maak je dat uitgangspunt teniet door het corpus naar een embeddingdienst van derden te sturen.
Laad in je vectoropslag en stel vragen
Sla vectoren op in pgvector, Chroma, Qdrant of Weaviate. Laat het model de datum van elke historische bron noemen en voeg een kleine woordenlijst toe die verouderde afdelingsnamen en productcodes koppelt aan de huidige – de trefzekerheid op oude corpora verbetert enorm, vrijwel zonder kosten.
Formaatvergelijking: Welke output is het beste voor AI?
Niet alle uitvoer is gelijk voor LLM-inname. Zo vergelijken de realistische doelstellingen:
| Factor | Markdown | TXT | HTML | Rauw .ws | |
|---|---|---|---|---|---|
| LLM Leesbaarheid | Uitstekend | Good | Goed (taggeluid) | Fair | None |
| Token efficiëntie | High | Highest | Laag (markup-overhead) | Laag (extractiegeluid) | N/A |
| Structuur voor Chunking | Echte koppen en tabellen | None | Echte koppen en tabellen | Lay-outafhankelijk | Onoleesbaar |
| Tables | Pijptabellen houden header/value-links bij | Alleen leesbare rijen | Echte tafelelementen | Koppen lossen zich van waarden | N/A |
| Vergelijkingen | LaTeX — doorzoekbaar | LaTeX of laten vallen | Afbeeldingen of MathML | Alleen afbeeldingen | N/A |
| Verwerkingscomplexiteit | Directe inname | Directe inname | HTML verwijderen | PDF-parser / OCR | Er bestaat geen parser in de stack |
| Beste Voor | RAG over documenten; docs-als-code | Triage, deduplicatie, classificatie | Intranet publiceren + crawlen | Menselijke lees- en retentiegegevens | Niets (enkel bron van waarheid) |
Wat is het beste formaat om legacy-documenten in een LLM te voeren?
Markdown, in bijna elk geval. Het behoudt de koppenhiërarchie die je chunker nodig heeft, behoudt de tabelstructuur en draagt vergelijkingen als LaTeX in plaats van als afbeeldingen. Gebruik platte tekst ernaast voor triage en deduplicatie. Vermijd PDF als een intermediair — PDF extractie herintroduceert doorlopende koppen, koppeling, en verwarring over kolomvolgorde als ruis waar het model vervolgens doorheen moet redeneren.
Waarom Wrap-vlaggen en Puntcommando's de Chunk-kwaliteit Beslissen
Markdown heeft geen concept van een high-bit wrap-vlag — het heeft alinea's en kopniveaus. De enige manier waarop een converter kan weten waar een zin daadwerkelijk overloopt, of dat een regel een kop is van .he, is door het interpreteren van de inheemse WordStar-stroom. Daarmee krijg je echte structuur om op te segmenteren. Zonder dat krijg je een vlakke reeks van high-bit afval en verlies je het enige voordeel waarvoor je naar Markdown bent geconverteerd.
Dus voordat je een archief omzet voor een retrieval-pijplijn, zet een representatieve steekproef om en bevestig dat koppen, paginakoppen en alinea-einden behouden zijn gebleven. Het kost een minuut en het bepaalt de kwaliteit van alles stroomafwaarts.
Waarom lokale verwerking belangrijk is voor AI-pijplijnen
De meeste teams bouwen privé RAG systemen specifiek om gereguleerd materiaal — contracten, dossierbestanden, personeelsdossiers, correspondentie van patiënten — buiten de infrastructuur van derden te houden. Het gebruik van een cloudgebaseerde converter om die documenten voor te bereiden, ondermijnt het doel en het is makkelijk te missen omdat conversie wordt behandeld als technische infrastructuur in plaats van als verwerking.
WordStar Converter verwerkt alles op je machine, zodat de keten van bewaring ononderbroken verloopt van .ws-bestand tot vectoropslag. Combineer het met een lokaal embeddingmodel en een zelfgehoste vectordatabase en je kunt eerlijk aangeven tijdens een compliance-review dat het corpus nooit het netwerk hebt verlaten.
Gerelateerde lectuur
Klaar om je WordStar-archieven AI-klaar te maken?
Download de gratis proefversie en converteer tot 10 bestanden. Zie hoe snel .WS schoon, gestructureerd tekst wordt voor je RAG pijplijn.
Gratis proefperiode
Alle app-functies — tot 10 bestanden
Windows 10 of 11
Download het Windows-installatieprogramma voor de volledige proefperiode van 10 bestanden. Dezelfde app die je met een licentie ontgrendelt — 100% lokaal op je pc.