홈/AI 준비

WordStar 문서를 RAG 파이프라인과 LLM 수집에 맞게 변환하는 방법

레거시 .WS 아카이브를 AI 준비 텍스트로 변환하는 실용 가이드 — 로컬에서, 안전하게, 대규모로.

TL;DR

WordStar 문서를 변환 Markdown 검색 및 일반 텍스트 삼자 분류를 위해. 중간 단계로 PDF을 피하세요 — 이것은 구조를 레이아웃으로 변환한 다음 추출 휴리스틱으로 구조를 다시 추측하게 만듭니다. WordStar Converter는 이를 한 번에 로컬에서 수행하므로, 기밀 문서는 개인 AI 시스템으로 들어가는 동안 네트워크를 벗어나지 않습니다.

문제: 기존 문서는 AI에게 보이지 않습니다

귀하의 조직이 30년 이상 존재했다면, 그 조직의 제도적 기억의 상당 부분은 어떤 수집 파이프라인도 읽을 수 없는 형식으로 보관되어 있습니다. WordStar는 1990년대 동안 법률 사무소, 정부 부서, 대학, 병원에서 널리 사용되었는데, 이는 오늘날까지 유효한 설립 정책, 초기 계약, 초기 기술 사양 및 의사 결정의 근거가 모두 .ws 파일에 있을 수 있음을 의미합니다.

실패 모드는 미묘합니다. 자신의 과거 자료를 놓친 검색 시스템은 '그건 없어요'라고 말하지 않습니다 — 대신 가지고 있는 것에서 자신감 있게 답변하며, 답변에는 상황이 왜 그런지 설명하는 맥락이 빠집니다. 아무도 눈치채지 못하는데, 그 격차는 외부에서 보면 보이지 않기 때문입니다.

단계별: WordStar에서 벡터 데이터베이스로

레거시 .WS 아카이브를 AI 준비 상태로 만드는 워크플로우:

1

원본 아카이브 목록 만들기

대문자 .WS 변형과 DOS 시스템이 남긴 버전별 .wsd / .ws3~.ws8 파일까지 포함해 모든 .ws 파일을 찾으세요. WordStar Converter는 전체 폴더 트리를 재귀적으로 검색하므로, 퇴역한 파일 서버를 한 번만 훑어도 대개 예상보다 많은 파일을 찾아냅니다.

2

Markdown으로 변환하기(분류용 TXT도 함께)

두 형식을 한 번에 만드세요. 제목, 목록, 표가 실제 구조로 남기 때문에 색인에는 Markdown을 씁니다. 일반 텍스트는 코퍼스를 빠르게 검색하고, 해시로 중복을 찾고, 임베딩 예산을 쓰기 전에 빈 템플릿을 골라내는 데 유용합니다.

3

글자 수가 아니라 제목 기준으로 청킹하기

고정 크기 청킹은 논지를 중간에서 자르고 결론을 그 근거와 떼어 놓습니다. 제목 경계에서 약간 겹치게 나누고, 제목 경로를 청크 본문에 넣어 검색이 각 구절의 출처를 알 수 있게 하세요.

4

필터링용 메타데이터 붙이기

모든 청크에 원본 파일 이름, 문서 날짜, 부서, 폴더 경로를 태그로 붙이세요. 과거 문서 코퍼스에서는 메타데이터 필터링이 필수입니다. "1996년 정책에는 뭐라고 되어 있었나"는 검색만이 아니라 필터와 검색의 조합입니다.

5

로컬에서 임베딩하기

호스팅 API 대신 BGE, E5 또는 Sentence-Transformers 계열의 로컬 임베딩 모델을 실행하세요. 기밀성 때문에 비공개 시스템을 만드는 것이라면, 코퍼스를 제3자 임베딩 서비스로 보내는 순간 그 전제가 무너집니다.

6

벡터 저장소에 적재하고 질의하기

벡터는 pgvector, Chroma, Qdrant 또는 Weaviate에 저장하세요. 과거 자료의 날짜를 밝히도록 모델에 지시하고, 폐지된 부서명과 제품 코드를 현재 것과 연결하는 작은 용어집을 넣으면 오래된 코퍼스의 재현율이 거의 비용 없이 크게 향상됩니다.

형식 비교: AI에 가장 적합한 출력은 무엇인가?

모든 출력이 LLM 수용에 대해 동일한 것은 아닙니다. 현실적인 목표를 비교하면 다음과 같습니다:

FactorMarkdownTXTHTMLPDF원시 .ws
LLM 가독성우수Good좋아요 (태그 소음)FairNone
토큰 효율성HighHighest낮음 (마크업 오버헤드)낮음(추출 소음)N/A
청킹을 위한 구조실제 제목과 표None실제 제목과 표레이아웃 의존읽을 수 없음
Tables파이프 테이블은 헤더/value 링크를 유지합니다읽을 수 있는 행만실제 테이블 요소헤더가 값에서 분리됩니다N/A
방정식LaTeX — 검색 가능LaTeX 또는 드롭됨이미지 또는 MathML이미지 전용N/A
처리 복잡성직접 섭취직접 섭취HTML 벗기기PDF 파서 / OCR스택에 파서가 존재하지 않습니다
가장 적합문서 위에 RAG; 코드처럼 취급되는 문서분류, 중복 제거, 분류인트라넷 퍼블리싱 + 크롤링인간 읽기, 기억 보존 기록없음(진실의 근원만)

레거시 문서를 LLM에 입력하기 위한 가장 좋은 형식은 무엇인가요?

Markdown, 거의 모든 경우에. 이는 청크 분석기가 필요로 하는 제목 계층 구조를 유지하고, 표 구조를 보존하며, 수식을 그림이 아닌 LaTeX으로 전달합니다. 사용 일반 텍스트 분류 및 중복 제거를 위해 그 옆에서 함께. PDF을 피하세요 중간 — PDF 추출은 러닝 헤더, 하이픈화, 열차 혼동을 노이즈로 다시 도입하여 모델이 이를 추론해야 합니다.

왜 랩 플래그와 도트 명령이 청크 품질을 결정하는가

Markdown에는 하이비트 랩 플래그에 대한 개념이 없습니다 — 그것에는 단락과 제목 수준이 있습니다. 변환기가 문장이 실제로 어디에서 줄 바꿈되는지, 또는 줄이 헤더인지 알 수 있는 유일한 방법은 .he, 네이티브 WordStar 스트림을 해석함으로써 가능합니다. 이렇게 하면 실제 구조를 기반으로 청킹할 수 있습니다. 이것이 없으면, 높은 비트의 쓰레기들이 줄지어 있는 평면 시퀀스만 얻고, Markdown로 변환한 단 하나의 이점도 잃게 됩니다.

그러므로 아카이브를 검색 파이프라인용으로 변환하기 전에 대표 샘플을 변환하고 제목, 페이지 머리글 및 단락 구분이 제대로 유지되었는지 확인하세요. 몇 분 정도 걸리며 이후 모든 작업의 품질을 결정합니다.

AI 파이프라인에서 로컬 처리의 중요성

대부분의 팀은 규제된 자료 — 계약서, 사건 파일, 인사 기록, 환자 서신 — 를 제3자 인프라에서 벗어나게 하기 위해 특별히 사설 RAG 시스템을 구축합니다. 이러한 문서를 준비하기 위해 클라우드 기반 변환기를 사용하는 것은 목적을 무색하게 하며, 변환이 처리 과정이 아닌 단순 인프라 작업으로 취급되기 때문에 쉽게 간과될 수 있습니다.

WordStar Converter는 귀하의 컴퓨터에서 모든 것을 처리하므로, .ws 파일에서 벡터 스토어까지 연속적인 관리가 끊기지 않습니다. 이를 로컬 임베딩 모델과 자체 호스팅 벡터 데이터베이스와 함께 사용하면, 준수 검토에서 코퍼스가 네트워크를 벗어나지 않았다고 정직하게 말할 수 있습니다.

관련 읽기

WordStar 아카이브를 AI 사용 가능하게 만들 준비가 되셨나요?

무료 체험판을 다운로드하고 최대 10개의 파일을 변환하세요. .WS가 RAG 파이프라인용 깔끔하고 구조화된 텍스트로 얼마나 빠르게 변환되는지 확인하세요.

무료 체험

앱 전체 기능 — 최대 10개 파일

Windows 10 또는 11

전체 10개 파일 체험용 Windows 설치 프로그램을 다운로드하세요. 라이선스로 잠금 해제하는 것과 같은 앱 — PC에서 100% 로컬.

Standard 구매 — $39.95부터