Dodaj strony WWW
Wykorzystaj treść własnej witryny jako bazę wiedzy — jedną podstronę, całą mapę strony albo wszystko, do czego crawler dotrze z podanego adresu.
Jak to działa
Po uruchomieniu importu Leezy:
- ustala listę podstron do pobrania (z linków, z mapy strony albo z podanego pojedynczego adresu),
- pobiera każdą podstronę i wydobywa główną treść, pomijając nawigację, panele boczne, stopki, reklamy i skrypty,
- dzieli tekst na fragmenty i tworzy embeddingi,
- udostępnia treść do odpowiedzi.
Tryby importu
Na stronie Sources agenta wybierz sposób importu:
Skanowanie linków
Podajesz adres, a crawler podąża za linkami z tej strony i odnajduje kolejne podstrony w tej samej witrynie.
- Sprawdza się przy centrach pomocy, dokumentacji i sekcjach produktowych
- Dokładna liczba podstron znana jest dopiero po zakończeniu, bo po drodze pojawiają się nowe linki, a część okazuje się nieprawidłowa
Mapa strony
Wskaż bezpośrednio plik sitemap.xml albo adres główny witryny — mapa zostanie wykryta automatycznie.
- Sprawdza się przy pełnym, przewidywalnym pokryciu własnej witryny
- Zwykle najszybsza droga do szerokiego pokrycia
Pojedynczy link
Pobierana jest dokładnie jedna podstrona.
- Sprawdza się przy pojedynczym FAQ, cenniku albo regulaminie
- Przydaje się do uzupełnienia bazy wiedzy bez ponownego skanowania całości
Limity skanowania
Obowiązują dwa limity, oba zależne od planu:
| Plan | Podstron na skan | Skanów dziennie |
|---|---|---|
| Free | 25 | 3 |
| Starter | 50 | 20 |
| Pro | 500 | 100 |
| Business | 5000 | 500 |
Limit dzienny odnawia się co 24 godziny. Strona „Sources" pokazuje, ile importów zostało na dziś.
Dodatkowo obowiązuje limit miejsca: skan kończy się wcześniej, jeśli kolejne podstrony przekroczyłyby dostępne miejsce.
Opcje zaawansowane (od planu Pro)
Panel Advanced options daje dwa dodatkowe ustawienia:
Reguły ścieżek
Ograniczają, które adresy trafiają do importu. Każda reguła korzysta z operatora:
| Operator | Przykład |
|---|---|
| Zaczyna się od | /blog |
| Kończy się na | .html |
| Zawiera | tutorial |
| Dokładne dopasowanie | /about |
| Znak wieloznaczny | https://example.com/blog/** |
Uwzględnij tylko ścieżki zawęża skan do pasujących adresów. Wyklucz ścieżki usuwa pasujące adresy z szerokiego skanu. Wykluczenia to typowy sposób, by trzymać changelogi, archiwa tagów i strony z paginacją poza bazą wiedzy.
Wolne skanowanie
Renderuje każdą podstronę w pełnej przeglądarce headless zamiast pobierać surowy HTML. Trwa dłużej, ale to właśnie dzięki temu poprawnie importują się strony oparte na JavaScripcie i aplikacje jednostronicowe.
:::tip Kiedy sięgnąć po wolne skanowanie Jeśli skan kończy się powodzeniem, ale zaimportowane podstrony są niemal puste, treść najprawdopodobniej renderuje się po stronie przeglądarki. Powtórz import z włączonym wolnym skanowaniem. :::
Dobre praktyki
Dobre adresy do importu
- artykuły FAQ i centra pomocy,
- dokumentacja,
- strony produktów i cenniki,
- regulaminy (zwroty, wysyłka, gwarancja).
Czego unikać
- podstron za logowaniem — crawler nie jest zalogowany,
- podstron złożonych głównie z obrazów lub wideo,
- stron tagów, kategorii i paginacji: dużo szumu, zero odpowiedzi.
Utrzymuj aktualność
Zaimportowane podstrony to zdjęcie stanu z chwili skanowania. Gdy witryna się zmienia, uruchom import ponownie. Zeskanowane podstrony są pogrupowane według przebiegu skanu, więc nieaktualny przebieg można usunąć i zaimportować od nowa.
Wymagania wobec adresów
- Publicznie dostępne, bez logowania
- Zwracają HTML
- Brak protokołu jest uzupełniany jako
https://
Rozwiązywanie problemów
Skanowanie nie powiodło się
Najczęstsze przyczyny: błędny adres, wymagane logowanie, witryna blokuje crawlery albo serwer przekroczył limit czasu.
Rozwiązanie: otwórz adres w oknie prywatnym, aby potwierdzić, że jest publiczny, a potem spróbuj innego punktu wejścia — import mapy strony często udaje się tam, gdzie skanowanie linków zawodzi.
Zaimportowano mało podstron albo żadnej
- Treść renderuje się w JavaScripcie — włącz wolne skanowanie
- Reguły ścieżek są zbyt wąskie — sprawdź reguły uwzględniania
- W trakcie skanu wyczerpał się limit dzienny albo miejsce
Za dużo nieistotnych podstron
Dodaj reguły wykluczające dla zaszumionych sekcji, usuń przebieg skanu i zaimportuj ponownie.
Następne kroki
- Dodaj pary pytanie–odpowiedź — precyzyjne odpowiedzi
- Wgraj dokumenty — treści z plików
- Połącz Notion — strony z workspace'u