Hjem/AI-forberedelse

Hvordan konvertere WordStar-dokumenter for RAG-rørledninger og LLM-inntak

En praktisk veiledning for å gjøre et eldre .WS-arkiv til AI-klar tekst – lokalt, sikkert, og i skala.

TL;DR

Konverter WordStar-dokumenter til Markdown for henting og ren tekst for triage. Unngå PDF som et mellomledd – det konverterer struktur til layout og får deg så til å gjette strukturen tilbake med ekstraksjonsheuristikk. WordStar Converter gjør dette lokalt i bulk, så konfidensielle dokumenter forlater aldri nettverket ditt på vei inn i ditt private AI-system.

Problemet: eldre dokumenter er usynlige for AI

Hvis organisasjonen din har eksistert i tretti år, er en meningsfull del av dens institusjonelle minne i formater ingen inntakspipeline kan lese. WordStar ble mye brukt i advokatfirmaer, offentlige avdelinger, universiteter og sykehus gjennom 1990-tallet, noe som betyr at grunnleggende retningslinjer, originale kontrakter, tidlige tekniske spesifikasjoner og begrunnelsen bak beslutninger som fortsatt er i kraft i dag, kan alle ligge i .ws-filer.

Feilmodusen er subtil. Et gjenfinningssystem som mangler sitt historiske korpus sier ikke "det har jeg ikke" - det svarer selvsikkert ut fra det det har, og svaret utelater konteksten som forklarer hvorfor ting er som de er. Ingen legger merke til det, fordi gapet er usynlig fra utsiden.

Trinn-for-trinn: WordStar til vektordatabase

Arbeidsflyten for å gjøre et eldre .WS-arkiv AI-klar:

1

Kartlegg kildearkivene

Finn alle .ws-filer, inkludert varianter med store bokstaver (.WS) og versjonerte .wsd- / .ws3–.ws8-filer etterlatt av DOS-systemer. WordStar Converter søker rekursivt gjennom hele mappetrær, så én gjennomgang av en utrangert filserver finner som regel mer enn noen hadde ventet.

2

Konverter til Markdown (og TXT for sortering)

Lag begge formatene i én omgang. Markdown mater indeksen fordi overskrifter, lister og tabeller bevares som ekte struktur. Ren tekst gir deg en rask måte å søke i korpuset, lage hash-verdier for duplikater og finne tomme maler før du bruker embedding-budsjett på dem.

3

Del opp etter overskrifter, ikke etter antall tegn

Oppdeling i faste størrelser kutter argumenter midt over og skiller en konklusjon fra begrunnelsen. Del ved overskriftsgrenser med en moderat overlapp, og ta med overskriftsstien i tekstbiten slik at søket vet hvor hvert avsnitt kommer fra.

4

Legg til metadata for filtrering

Merk hver tekstbit med kildefilnavn, dokumentdato, avdeling og mappesti. I historiske korpus er filtrering på metadata helt nødvendig – «hva sa retningslinjen fra 1996» er et filter pluss et søk, aldri bare et søk.

5

Lag embeddinger lokalt

Kjør en lokal embedding-modell – BGE, E5 eller en Sentence-Transformers-variant – i stedet for et nettbasert API. Hvis fortrolighet er grunnen til at du bygger et privat system, undergraver du hele poenget ved å sende korpuset til en tredjeparts embedding-tjeneste.

6

Last inn i vektorlageret og still spørsmål

Lagre vektorene i pgvector, Chroma, Qdrant eller Weaviate. Be modellen oppgi datoen for alle historiske kilder, og legg inn en liten ordliste som knytter utgåtte avdelingsnavn og produktkoder til dagens – treffsikkerheten på gamle korpus blir langt bedre nesten uten kostnad.

Formatsammenligning: Hvilken utgang er best for AI?

Ikke alle utdata er like for LLM-inntak. Her er hvordan de realistiske målene sammenlignes:

FaktorMarkdownTXTHTMLPDFRå .ws
LLM LesbarhetUtmerketBraBra (merkestøy)RettferdigIngen
Token effektivitetHøyHøyestLav (markup overhead)Lav (avtrekksstøy)N/A
Struktur for ChunkingEkte overskrifter og tabellerIngenEkte overskrifter og tabellerLayoutavhengigUleselig
TabellerRørtabeller holder overskrift/verdikoblingerKun lesbare raderEkte bordelementerOverskrifter løsner fra verdierN/A
LigningerLaTeX — søkbarLaTeX eller droppetBilder eller MathMLKun bilderN/A
BehandlingskompleksitetDirekte inntakDirekte inntakHTML strippingPDF-parser / OCRDet finnes ingen parser i stabelen
Best forRAG over dokumenter; docs-as-codeTriage, dedup, klassifiseringIntranettpublisering + crawlingMenneskelig lesing, oppbevaringsregistreIngenting (bare kilde til sannhet)

Hva er det beste formatet for å mate eldre dokumenter inn i en LLM?

Markdown, i nesten alle tilfeller. Den beholder overskriftshierarkiet din chunker trenger, bevarer tabellstrukturen og bærer ligninger som LaTeX i stedet for som bilder. Bruk ren tekst ved siden av for triage og deduplisering. Unngå PDF som et mellomledd — PDF-ekstraksjon gjenintroduserer løpende overskrifter, orddeling og forvirring av kolonnerekkefølgen som støy som modellen da må resonnere seg gjennom.

Hvorfor vikle flagg og punktkommandoer bestemmer stykkekvalitet

Markdown har ikke noe konsept for et høybit-ombrytingsflagg – det har avsnitt og overskriftsnivåer. Den eneste måten en konverter kan vite hvor en setning faktisk brytes, eller at en linje er en overskrift fra .he, er ved å tolke den opprinnelige WordStar-strømmen. Med det får du skikkelig struktur å bite på. Uten det får du en flat sekvens med høybits søppel og mister den eneste fordelen du konverterte til Markdown for.

Så før du konverterer et arkiv for en gjenfinningspipeline, konverter et representativt utvalg og kontroller at overskrifter, sideoverskrifter og avsnittsskift overlevde. Det tar et minutt og det bestemmer kvaliteten på alt nedstrøms.

Hvorfor lokal behandling er viktig for AI-rørledninger

De fleste team bygger private RAG-systemer spesifikt for å holde regulert materiale – kontrakter, saksfiler, personaljournaler, pasientkorrespondanse – utenfor tredjeparts infrastruktur. Å bruke en skybasert konverter for å forberede disse dokumentene overvinner formålet, og det er lett å gå glipp av fordi konvertering blir behandlet som rørleggerarbeid i stedet for som behandling.

WordStar Converter behandler alt på maskinen din, slik at varetektskjeden går uavbrutt fra .ws-fil til vektorlager. Par den med en lokal innbyggingsmodell og en selvdrevet vektordatabase, og du kan ærlig opplyse i en samsvarsgjennomgang at korpuset aldri forlot nettverket.

Relatert lesing

Klar til å gjøre WordStar-arkivene dine AI-klare?

Last ned den gratis prøveversjonen og konverter opptil 10 filer. Se hvor raskt .WS blir ren, strukturert tekst for RAG-pipelinen din.

Gratis prøveversjon

Alle app-funksjoner — opptil 10 filer

Windows 10 eller 11

Last ned Windows-installasjonsprogrammet for den fulle 10-fil-prøveversjonen. Samme app du låser opp med en lisens — 100 % lokalt på PC-en din.

Kjøp Standard — fra $39.95