Strona główna / Artykuły / Twój pipeline RAG rozpoczyna się przed pierwszym embedowaniem.

Twój pipeline RAG rozpoczyna się przed pierwszym embedowaniem.

Stwórz inwentarz źródłowy, który odróżnia użyteczne dowody od brakującego tekstu, błędnych oznaczeń autorstwa oraz niekompletnej ekstrakcji.

553 słów

System wyszukiwania może zwrócić płynną odpowiedź z dokumentu, który w ogóle nie powinien trafić do jego bazy dowodów. Tytuł może należeć do jednej strony, podczas gdy URL wskazuje na inną. Zapisana strona może zawierać jedynie przegląd. Tabela po ekstrakcji może pozostać jako lista liczb bez etykiet.

Wbudowanie tych danych umożliwia ich wyszukiwanie, ale nie czyni ich wiarygodnymi.

Dla aplikacji opartej na wiedzy zacząłbym od inwentarza źródeł: rejestru tego, co zostało zebrane, co faktycznie zostało wyekstrahowane oraz czego można bezpiecznie użyć do udzielenia odpowiedzi. Taki inwentarz ułatwia również sprawdzanie procesu publikacji opartego na artykułach, ponieważ każdy szkic może odwoływać się do konkretnej wersji swoich dowodów.

Rozdzielenie procesu odkrywania od dowodów

Tytuł, autor oraz krótka opis to przydatne metadane służące do znajdowania treści. Pomagają one podjąć decyzję, który artykuł przeczytać dalej. Są jednak niewystarczające do odtworzenia argumentacji artykułu, sprawdzenia jego przykładów czy przedstawienia wniosków autora.

Jasno określ dostępność treści. Przydatne stany to wyłącznie metadane, tekst wydobyty o nieznanej kompletności, zweryfikowany pełny tekst oraz konflikt tożsamości. Unikaj użycia pojedynczego flagi indexed: true, która ukrywa wszystkie te cztery sytuacje.

Minimalny zapis może wyglądać w ten sposób:

{
  "source_id": "article-42",
  "canonical_url": "https://example.com/article-42",
  "content_status": "extracted_text",
  "completeness": "unverified",
  "content_hash": "sha256-of-extracted-text",
  "retrieved_at": "2026-09-17T12:00:00Z"
}

Hash identyfikuje wersję tekstu. Nie jest to miara prawdziwości. Podobnie długi fragment wydobyty stanowi dowód na dostępność tekstu, ale nie jest dowodem na to, że żadna bariera płatności, błąd parsera czy blok nawigacyjny go nie zmieniły.

Zachowaj relacje, które niosą znaczenie

Analiza dokumentu i dzielenie go na fragmenty rozwiązuje różne problemy. Analiza musi odtworzyć strukturę, natomiast dzielenie na fragmenty decyduje o sposobie jej podziału. Jeśli proces wyodrębniania danych oddzieli wartość z tabeli od jej nagłówka kolumny, późniejszy narzędzie do dzielenia nie będzie w stanie wiarygodnie odtworzyć brakującej relacji.

Rozważmy przewodnik konserwacyjny, w którym wymieniono komponent, okres jego kontroli oraz warunki, przy których ten okres się zmienia. Zapisanie tylko okresu kontroli daje przekonującą, ale niekompletną odpowiedź. Należy zachować etykiety oraz wyjątki razem, zanim rozważy się podobieństwo wektorowe.

Dlatego właśnie granice fragmentów wymagają wyraźnego zaprojektowania. Narzędzie do dzielenia nie może zrekompensować braku danych, które zniknęły wcześniej.

Zrób błędy widocznymi, nie wyrzucając jednocześnie całego inventarza

Zachowaj problematyczne zapisy dostępne do wyszukiwania w celach konserwacyjnych, ale wyklucz je z zbioru dowodów używanego do tworzenia odpowiedzi lub publikacji. Zapisz powód: niezgodny identyfikator, brak treści, niepewny język lub błąd wyodrębniania danych.

To rozróżnienie umożliwia dwa sposoby pracy. Wyszukiwanie w celach konserwacyjnych służy do ustalenia, co wymaga naprawy. Wyszukiwanie odpowiedzi służy do określenia, które źródła mogą potwierdzić dane twierdzenia. Nie powinny one w tajemnicy zwracać tych samych wyników.

Przed publikacją dodaj kolejną weryfikację: przeczytaj fragmenty, które zamierzasz użyć. Źródło może być istotne dla tematu, ale nie musi wspierać konkretnej konkluzji w twoim projekcie.

Testuj jakość źródeł jako część produktu

Stwórz małą kolekcję celowo nieprzyjemnych danych wejściowych: wycinek artykułu, przekierowany adres URL, stronę dwukolumnową, tabelę z przypisami oraz dwie wersje tego samego dokumentu. Sprawdź wynik wyekstrahowany przed oceną trafności wyszukiwania.

Szerszy proces oceny powinien odróżniać brak dowodów od słabej pozycjonowania oraz generacji bez podstaw. W przeciwnym razie problem z odzyskiwaniem informacji może skłonić cię do ponownego zadania pytania, podczas gdy rzeczywisty błąd pozostanie w bazie źródeł.

Pierwszy przydatny etap jest prosty: każdy rekord wyjaśnia, co jest dostępne i skąd pochodzi. Gdy to zostanie osiągnięte, dalsze ulepszenia będą łatwiejsze do zinterpretowania.