WordStar ドキュメントを RAG パイプラインおよび LLM 取り込み用に変換する方法
レガシーな.WSアーカイブをAI対応のテキストに変換するための実践ガイド — ローカルで、安全に、そして大規模に。
TL;DR
WordStarの文書を変換する Markdown 取得および プレーンテキスト トリアージ用です。PDFを中間として使用するのは避けてください — それは構造をレイアウトに変換し、次に抽出ヒューリスティクスで構造を推測することになります。WordStar Converterはこれをローカルで一括して行うため、機密文書はプライベートAIシステムに入る途中でネットワーク外に出ることはありません。
問題:レガシー文書はAIにとって見えない
もしあなたの組織が30年以上の歴史を持っているなら、その機関の記憶の重要な部分は、どの取り込みパイプラインでも読み取れない形式で保存されています。WordStarは1990年代を通じて法律事務所、政府機関、大学、病院で広く使用されていました。つまり、創設時の方針、元の契約書、初期の技術仕様、そして現在も有効な決定の背後にある理由などが、すべて.wsファイルに保存されている可能性があるということです。
障害の発生モードは微妙です。過去のコーパスを欠いた検索システムは「それは持っていません」とは言いません ― 持っている情報から自信を持って答えますが、その答えには物事がそうである理由を説明する文脈が欠けています。誰も気づきません、なぜならそのギャップは外からは見えないからです。
ステップ・バイ・ステップ:WordStar からベクターデータベースへ
レガシー .WS アーカイブを AI 対応にするためのワークフロー:
元のアーカイブを棚卸しする
大文字の .WS や、DOS システムが残したバージョン付きの .wsd / .ws3~.ws8 ファイルも含め、すべての .ws ファイルを洗い出します。WordStar Converter はフォルダーツリー全体を再帰的にスキャンするため、使われなくなったファイルサーバーを 1 回走査するだけで、たいてい予想以上のファイルが見つかります。
Markdown に変換する(振り分け用に TXT も)
1 回で両方の形式を出力します。見出し、リスト、表が本来の構造として残るため、インデックスには Markdown を使います。プレーンテキストは、コーパスを素早く検索し、ハッシュで重複を見つけ、埋め込みの予算を使う前に空のテンプレートを見つけるのに役立ちます。
文字数ではなく見出しで分割する
固定長の分割は論旨を途中で断ち切り、結論とその根拠を切り離してしまいます。見出しの境界で少し重ねて分割し、見出しのパスをチャンク本文に含めて、各段落の出どころを検索側が把握できるようにします。
絞り込み用のメタデータを付ける
各チャンクに元のファイル名、文書の日付、部署、フォルダーのパスをタグ付けします。過去の文書群ではメタデータによる絞り込みが不可欠です。「1996 年の方針には何と書かれていたか」は、検索だけでなく絞り込みと検索の組み合わせです。
ローカルで埋め込みを作成する
ホスト型 API ではなく、BGE、E5、Sentence-Transformers 系などのローカル埋め込みモデルを使います。機密性のためにプライベートなシステムを構築するのなら、コーパスを第三者の埋め込みサービスに送った時点で前提が崩れます。
ベクトルストアに読み込んで問い合わせる
ベクトルは pgvector、Chroma、Qdrant、Weaviate に保存します。過去の資料については日付を明示するようモデルに指示し、廃止された部署名や製品コードを現在のものに対応付ける小さな用語集を加えると、古い文書群での再現率がほとんどコストをかけずに大きく向上します。
フォーマット比較:AIにとって最適な出力はどれか?
すべての出力がLLMの取り込みに対して同等というわけではありません。現実的な目標がどのように比較されるかは次の通りです。
| Factor | Markdown | TXT | HTML | 生の .ws | |
|---|---|---|---|---|---|
| LLM 読みやすさ | 優秀 | Good | 良い(タグノイズ) | Fair | None |
| トークン効率 | High | Highest | 低い(マークアップのオーバーヘッド) | 低(抽出ノイズ) | N/A |
| チャンク化のための構造 | 本物の見出しと表 | None | 本物の見出しと表 | レイアウト依存 | 読めない |
| Tables | パイプテーブルはヘッダー/valueリンクを保持します | 読みやすい行のみ | 本物のテーブル要素 | ヘッダーが値から切り離される | N/A |
| 方程式 | LaTeX — 検索可能 | LaTeX またはドロップされた | 画像または MathML | 画像のみ | N/A |
| 処理の複雑さ | 直接摂取 | 直接摂取 | HTML 剥離 | PDF パーサー / OCR | スタックにパーサーは存在しません |
| 最適 | RAG を文書に渡って;ドキュメント・アズ・コード | トリアージ、重複排除、分類 | イントラネットの公開 + クロール | 人間の読書・記憶保持記録 | なし(唯一の真実の情報源のみ) |
レガシー文書をLLMに投入する最適なフォーマットは何ですか?
Markdownほとんどの場合、ヘッディングの階層をチャンク処理に必要な形で維持し、表の構造を保持し、方程式を画像ではなく LaTeX として保持します。使用する プレーンテキスト トリアージと重複排除のためにそれと一緒に。 PDFを避ける 中間段階として — PDF 抽出は、モデルが推論しなければならないノイズとして、再びランニングヘッダー、ハイフネーション、および列の順序の混乱をもたらします。
なぜラップフラグとドットコマンドがチャンクの品質を決定するのか
Markdown にはハイビットラップフラグの概念はありません — 段落と見出しレベルがあります。コンバーターが文が実際にどこで折り返されるか、または行が見出しであることを知る唯一の方法は .heは、ネイティブのWordStarストリームを解釈することで行います。そうすることで、チャンク化できる実際の構造を得ることができます。それがなければ、高ビットのゴミの平坦なシーケンスになり、Markdownに変換した唯一の利点を失ってしまいます。
したがって、アーカイブをリトリーバルパイプライン用に変換する前に、代表的なサンプルを変換し、見出し、ページヘッダー、および段落区切りが保持されていることを確認してください。これは1分で済み、下流のすべての品質を判断することができます。
AIパイプラインにおいてローカル処理が重要な理由
ほとんどのチームは、規制対象の資料—契約書、事件ファイル、人事記録、患者とのやり取り—をサードパーティのインフラから隔離するために、専用のRAGシステムを構築します。これらの文書を準備するためにクラウドベースの変換ツールを使用すると、その目的が台無しになり、変換が処理ではなく配管作業として扱われるため、見落としがちです。
WordStar Converter はあなたのマシン上ですべてを処理するため、.ws ファイルからベクターストアまでの管理履歴が途切れることはありません。ローカルの埋め込みモデルとセルフホストのベクターデータベースと組み合わせれば、コーパスがネットワーク外に出ることはなかったと、コンプライアンスレビューで正直に述べることができます。
関連資料
あなたのWordStarアーカイブをAI対応にする準備はできていますか?
無料トライアルをダウンロードして、10ファイルまで変換できます。.WSがあなたのRAGパイプライン向けにどれだけ迅速にクリーンで構造化されたテキストになるかをご覧ください。
無料トライアル
アプリ全機能 — 最大 10 ファイル
Windows 10 または 11
完全な 10 ファイルトライアル用の Windows インストーラーをダウンロード。ライセンスで解除するのと同じアプリ — PC 上で 100% ローカル。