Hvordan konvertere WordStar-dokumenter for RAG-rørledninger og LLM-inntak
En praktisk veiledning for å gjøre et eldre .WS-arkiv til AI-klar tekst – lokalt, sikkert, og i skala.
TL;DR
Konverter WordStar-dokumenter til Markdown for henting og ren tekst for triage. Unngå PDF som et mellomledd – det konverterer struktur til layout og får deg så til å gjette strukturen tilbake med ekstraksjonsheuristikk. WordStar Converter gjør dette lokalt i bulk, så konfidensielle dokumenter forlater aldri nettverket ditt på vei inn i ditt private AI-system.
Problemet: eldre dokumenter er usynlige for AI
Hvis organisasjonen din har eksistert i tretti år, er en meningsfull del av dens institusjonelle minne i formater ingen inntakspipeline kan lese. WordStar ble mye brukt i advokatfirmaer, offentlige avdelinger, universiteter og sykehus gjennom 1990-tallet, noe som betyr at grunnleggende retningslinjer, originale kontrakter, tidlige tekniske spesifikasjoner og begrunnelsen bak beslutninger som fortsatt er i kraft i dag, kan alle ligge i .ws-filer.
Feilmodusen er subtil. Et gjenfinningssystem som mangler sitt historiske korpus sier ikke "det har jeg ikke" - det svarer selvsikkert ut fra det det har, og svaret utelater konteksten som forklarer hvorfor ting er som de er. Ingen legger merke til det, fordi gapet er usynlig fra utsiden.
Trinn-for-trinn: WordStar til vektordatabase
Arbeidsflyten for å gjøre et eldre .WS-arkiv AI-klar:
Kartlegg kildearkivene
Finn alle .ws-filer, inkludert varianter med store bokstaver (.WS) og versjonerte .wsd- / .ws3–.ws8-filer etterlatt av DOS-systemer. WordStar Converter søker rekursivt gjennom hele mappetrær, så én gjennomgang av en utrangert filserver finner som regel mer enn noen hadde ventet.
Konverter til Markdown (og TXT for sortering)
Lag begge formatene i én omgang. Markdown mater indeksen fordi overskrifter, lister og tabeller bevares som ekte struktur. Ren tekst gir deg en rask måte å søke i korpuset, lage hash-verdier for duplikater og finne tomme maler før du bruker embedding-budsjett på dem.
Del opp etter overskrifter, ikke etter antall tegn
Oppdeling i faste størrelser kutter argumenter midt over og skiller en konklusjon fra begrunnelsen. Del ved overskriftsgrenser med en moderat overlapp, og ta med overskriftsstien i tekstbiten slik at søket vet hvor hvert avsnitt kommer fra.
Legg til metadata for filtrering
Merk hver tekstbit med kildefilnavn, dokumentdato, avdeling og mappesti. I historiske korpus er filtrering på metadata helt nødvendig – «hva sa retningslinjen fra 1996» er et filter pluss et søk, aldri bare et søk.
Lag embeddinger lokalt
Kjør en lokal embedding-modell – BGE, E5 eller en Sentence-Transformers-variant – i stedet for et nettbasert API. Hvis fortrolighet er grunnen til at du bygger et privat system, undergraver du hele poenget ved å sende korpuset til en tredjeparts embedding-tjeneste.
Last inn i vektorlageret og still spørsmål
Lagre vektorene i pgvector, Chroma, Qdrant eller Weaviate. Be modellen oppgi datoen for alle historiske kilder, og legg inn en liten ordliste som knytter utgåtte avdelingsnavn og produktkoder til dagens – treffsikkerheten på gamle korpus blir langt bedre nesten uten kostnad.
Formatsammenligning: Hvilken utgang er best for AI?
Ikke alle utdata er like for LLM-inntak. Her er hvordan de realistiske målene sammenlignes:
| Faktor | Markdown | TXT | HTML | Rå .ws | |
|---|---|---|---|---|---|
| LLM Lesbarhet | Utmerket | Bra | Bra (merkestøy) | Rettferdig | Ingen |
| Token effektivitet | Høy | Høyest | Lav (markup overhead) | Lav (avtrekksstøy) | N/A |
| Struktur for Chunking | Ekte overskrifter og tabeller | Ingen | Ekte overskrifter og tabeller | Layoutavhengig | Uleselig |
| Tabeller | Rørtabeller holder overskrift/verdikoblinger | Kun lesbare rader | Ekte bordelementer | Overskrifter løsner fra verdier | N/A |
| Ligninger | LaTeX — søkbar | LaTeX eller droppet | Bilder eller MathML | Kun bilder | N/A |
| Behandlingskompleksitet | Direkte inntak | Direkte inntak | HTML stripping | PDF-parser / OCR | Det finnes ingen parser i stabelen |
| Best for | RAG over dokumenter; docs-as-code | Triage, dedup, klassifisering | Intranettpublisering + crawling | Menneskelig lesing, oppbevaringsregistre | Ingenting (bare kilde til sannhet) |
Hva er det beste formatet for å mate eldre dokumenter inn i en LLM?
Markdown, i nesten alle tilfeller. Den beholder overskriftshierarkiet din chunker trenger, bevarer tabellstrukturen og bærer ligninger som LaTeX i stedet for som bilder. Bruk ren tekst ved siden av for triage og deduplisering. Unngå PDF som et mellomledd — PDF-ekstraksjon gjenintroduserer løpende overskrifter, orddeling og forvirring av kolonnerekkefølgen som støy som modellen da må resonnere seg gjennom.
Hvorfor vikle flagg og punktkommandoer bestemmer stykkekvalitet
Markdown har ikke noe konsept for et høybit-ombrytingsflagg – det har avsnitt og overskriftsnivåer. Den eneste måten en konverter kan vite hvor en setning faktisk brytes, eller at en linje er en overskrift fra .he, er ved å tolke den opprinnelige WordStar-strømmen. Med det får du skikkelig struktur å bite på. Uten det får du en flat sekvens med høybits søppel og mister den eneste fordelen du konverterte til Markdown for.
Så før du konverterer et arkiv for en gjenfinningspipeline, konverter et representativt utvalg og kontroller at overskrifter, sideoverskrifter og avsnittsskift overlevde. Det tar et minutt og det bestemmer kvaliteten på alt nedstrøms.
Hvorfor lokal behandling er viktig for AI-rørledninger
De fleste team bygger private RAG-systemer spesifikt for å holde regulert materiale – kontrakter, saksfiler, personaljournaler, pasientkorrespondanse – utenfor tredjeparts infrastruktur. Å bruke en skybasert konverter for å forberede disse dokumentene overvinner formålet, og det er lett å gå glipp av fordi konvertering blir behandlet som rørleggerarbeid i stedet for som behandling.
WordStar Converter behandler alt på maskinen din, slik at varetektskjeden går uavbrutt fra .ws-fil til vektorlager. Par den med en lokal innbyggingsmodell og en selvdrevet vektordatabase, og du kan ærlig opplyse i en samsvarsgjennomgang at korpuset aldri forlot nettverket.
Relatert lesing
Klar til å gjøre WordStar-arkivene dine AI-klare?
Last ned den gratis prøveversjonen og konverter opptil 10 filer. Se hvor raskt .WS blir ren, strukturert tekst for RAG-pipelinen din.
Gratis prøveversjon
Alle app-funksjoner — opptil 10 filer
Windows 10 eller 11
Last ned Windows-installasjonsprogrammet for den fulle 10-fil-prøveversjonen. Samme app du låser opp med en lisens — 100 % lokalt på PC-en din.