Hem/AI-förberedelse

Så här konverterar du WordStar-dokument för RAG-pipelines och LLM-intag

En praktisk guide för att förvandla ett äldre .WS-arkiv till AI-klar text – lokalt, säkert, och i skala.

TL;DR

Konvertera WordStar-dokument till Markdown för hämtning och oformaterad text för triage. Undvik PDF som mellanliggande — det konverterar struktur till layout och får dig sedan att gissa strukturen tillbaka med extraktionsheuristik. WordStar Converter gör detta lokalt i bulk, så konfidentiella dokument lämnar aldrig ditt nätverk på väg in i ditt privata AI-system.

Problemet: äldre dokument är osynliga för AI

Om din organisation har funnits i trettio år, finns en meningsfull del av dess institutionella minne i format som ingen intagspipeline kan läsa. WordStar användes flitigt på advokatbyråer, statliga avdelningar, universitet och sjukhus under 1990-talet, vilket innebär att grundpolicyer, ursprungliga kontrakt, tidiga tekniska specifikationer och resonemanget bakom beslut som fortfarande gäller idag kan alla finnas i .ws-filer.

Felläget är subtilt. Ett hämtningssystem som saknar sin historiska korpus säger inte "det har jag inte" - det svarar självsäkert utifrån vad det har, och svaret utelämnar sammanhanget som förklarar varför saker och ting är som de är. Ingen märker det, eftersom gapet är osynligt från utsidan.

Steg-för-steg: WordStar till Vector Database

Arbetsflödet för att göra ett äldre .WS-arkiv AI-färdigt:

1

Inventera källarkiven

Hitta varje .ws-fil, inklusive varianter med versaler (.WS) och versionerade .wsd- / .ws3–.ws8-filer som DOS-system lämnat efter sig. WordStar Converter söker rekursivt igenom hela mappträd, så en enda genomgång av en avvecklad filserver hittar oftast mer än någon väntat sig.

2

Konvertera till Markdown (och TXT för sortering)

Skapa båda formaten i ett svep. Markdown matar indexet eftersom rubriker, listor och tabeller bevaras som verklig struktur. Ren text ger dig ett snabbt sätt att söka i korpusen, beräkna hashvärden för dubbletter och hitta tomma mallar innan du lägger embedding-budget på dem.

3

Dela upp efter rubriker, inte efter antal tecken

Uppdelning i fasta storlekar klyver resonemang mitt itu och skiljer en slutsats från sin motivering. Dela vid rubrikgränser med en måttlig överlappning och ta med rubriksökvägen i textbiten så att sökningen vet var varje stycke kommer ifrån.

4

Lägg till metadata för filtrering

Märk varje textbit med källfilnamn, dokumentdatum, avdelning och mappsökväg. I historiska korpusar är metadatafiltrering nödvändig – ”vad sa policyn från 1996” är ett filter plus en sökning, aldrig bara en sökning.

5

Skapa embeddings lokalt

Kör en lokal embedding-modell – BGE, E5 eller en Sentence-Transformers-variant – i stället för ett molnbaserat API. Om konfidentialitet är skälet till att du bygger ett privat system, raserar du hela premissen genom att skicka korpusen till en embedding-tjänst hos tredje part.

6

Läs in i vektorlagret och ställ frågor

Lagra vektorerna i pgvector, Chroma, Qdrant eller Weaviate. Be modellen ange datum för varje historisk källa och lägg in en liten ordlista som kopplar utgångna avdelningsnamn och produktkoder till dagens – träffsäkerheten i gamla korpusar förbättras avsevärt nästan utan kostnad.

Formatjämförelse: Vilken utdata är bäst för AI?

Alla utdata är inte lika för LLM-intag. Så här jämför de realistiska målen:

FaktorMarkdownTXTHTMLPDFRå .ws
LLM LäsbarhetUtmärktBraBra (taggljud)RättvistInga
Token effektivitetHögHögstLåg (markup overhead)Lågt (extraktionsljud)N/A
Struktur för ChunkingRiktiga rubriker och tabellerIngaRiktiga rubriker och tabellerLayoutberoendeOläsbar
TabellerRörtabeller håller rubrik/värde länkarEndast läsbara raderRiktiga bordselementRubriker lösgörs från värdenN/A
EkvationerLaTeX — sökbarLaTeX eller tappadeBilder eller MathMLEndast bilderN/A
BearbetningskomplexitetDirekt förtäringDirekt förtäringHTML strippningPDF-parser / OCRDet finns ingen parser i stacken
Bäst förRAG över dokument; docs-as-codeTriage, dedup, klassificeringIntranätspublicering + genomsökningMänsklig läsning, retentionsregisterIngenting (endast sanningens källa)

Vilket är det bästa formatet för att mata in äldre dokument till en LLM?

Markdown, i nästan alla fall. Den behåller den rubrikhierarki som din chunker behöver, bevarar tabellstrukturen och bär ekvationer som LaTeX snarare än som bilder. Använd oformaterad text bredvid den för triage och deduplicering. Undvik PDF som mellanliggande — PDF-extraktion återinför löpande rubriker, avstavning och kolumnordningsförvirring som brus som modellen sedan måste resonera igenom.

Varför linda flaggor och punktkommandon avgör chunkkvalitet

Markdown har inget koncept för en hög-bits wrap-flagga – den har stycken och rubriknivåer. Det enda sättet som en omvandlare kan veta var en mening faktiskt radbryts, eller att en rad är en rubrik från .he, är genom att tolka den ursprungliga WordStar-strömmen. Med det får du rejäl struktur att bita på. Utan det får du en platt sekvens av skräp med höga bitar och förlorar den enda fördelen du konverterade till Markdown för.

Så innan du konverterar ett arkiv för en hämtningspipeline, konvertera ett representativt urval och bekräfta att rubriker, sidhuvuden och styckebrytningar överlevde. Det tar en minut och det avgör kvaliteten på allt nedströms.

Varför lokal bearbetning är viktig för AI pipelines

De flesta team bygger privata RAG-system specifikt för att hålla reglerat material – kontrakt, ärendehandlingar, personaljournaler, patientkorrespondens – borta från tredje parts infrastruktur. Att använda en molnbaserad konverterare för att förbereda dessa dokument motverkar syftet, och det är lätt att missa eftersom konverteringen behandlas som VVS snarare än som bearbetning.

WordStar Converter bearbetar allt på din maskin, så spårbarhetskedjan löper obruten från .ws-fil till vektorbutik. Koppla ihop den med en lokal inbäddningsmodell och en vektordatabas som är självvärd och du kan ärligt säga i en överensstämmelsegranskning att korpusen aldrig lämnade nätverket.

Relaterad läsning

Är du redo att göra dina WordStar-arkiv AI-klara?

Ladda ner den kostnadsfria testversionen och konvertera upp till 10 filer. Se hur snabbt .WS blir ren, strukturerad text för din RAG-pipeline.

Gratis provperiod

Alla appfunktioner — upp till 10 filer

Windows 10 eller 11

Ladda ner Windows-installationsprogrammet för den fulla 10-filsprovperioden. Samma app du låser upp med en licens — 100 % lokalt på din PC.

Köp Standard — från $39.95