CLF (Combined Log Format) to rozszerzony standard zapisu logów serwera WWW, który rejestruje szczegółowe informacje o każdym żądaniu HTTP kierowanym do serwera — od adresu IP odwiedzającego, przez datę i godzinę, po nagłówek User-Agent i stronę odsyłającą (Referer). Format ten stanowi rozwinięcie wcześniejszego Common Log Format o dwa dodatkowe pola i jest obsługiwany przez praktycznie wszystkie popularne serwery: Apache, Nginx, LiteSpeed oraz większość platform hostingowych.
- CLF to standard logowania żądań HTTP stosowany m.in. przez Apache i Nginx.
- Każda linia logu zawiera 9 pól: IP, identyfikator, użytkownik, data, żądanie, kod HTTP, rozmiar, Referer, User-Agent.
- Logi w tym formacie są podstawowym źródłem danych do analizy crawlowania strony przez Googlebot.
- Analiza CLF pozwala wykryć błędy 404, problemy z crawl budgetem i nieoczekiwane boty.
Jak CLF działa w praktyce
Struktura pojedynczego wpisu w logu
Każda linia logu CLF odpowiada jednemu żądaniu HTTP i składa się z dokładnie dziewięciu pól ułożonych w stałej kolejności. Poniżej przykładowy wpis i jego rozkład:
66.249.66.1 - - [12/Jul/2025:08:23:11 +0200] "GET /oferta/ HTTP/1.1" 200 4321 "https://webiti.pl/" "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)"
| Pole | Przykładowa wartość | Co oznacza |
|---|---|---|
| IP klienta | 66.249.66.1 | Adres IP odwiedzającego lub bota |
| Identyfikator | – | Ident klienta (zwykle pusty) |
| Użytkownik | – | Nazwa użytkownika (jeśli uwierzytelniony) |
| Data i czas | [12/Jul/2025:08:23:11 +0200] | Dokładny czas żądania ze strefą czasową |
| Żądanie HTTP | GET /oferta/ HTTP/1.1 | Metoda, ścieżka i wersja protokołu |
| Kod statusu | 200 | Odpowiedź serwera (200 OK, 404, 301 itd.) |
| Rozmiar odpowiedzi | 4321 | Liczba bajtów przesłanych do klienta |
| Referer | https://webiti.pl/ | Skąd użytkownik/bot przyszedł na stronę |
| User-Agent | Googlebot/2.1 | Przeglądarka lub bot, który wysłał żądanie |
Pola Referer i User-Agent odróżniają CLF od starszego Common Log Format — to właśnie one wnoszą największą wartość analityczną z perspektywy SEO.
Gdzie i jak logi CLF są zapisywane
Na serwerze Apache logi w formacie CLF konfiguruje się dyrektywą LogFormat w pliku httpd.conf lub .htaccess. Standardowy zapis wygląda następująco:
LogFormat "%h %l %u %t \\"%r\\" %>s %b \\"%{Referer}i\\" \\"%{User-agent}i\\"" combined
Nginx realizuje to samo przez dyrektywę log_format w bloku http. Pliki logów rosną szybko — serwer obsługujący 100 000 żądań dziennie generuje plik o objętości od kilkudziesięciu do kilkuset MB, dlatego większość hostingów stosuje automatyczną rotację logów (logrotate) co 24 godziny lub tygodniowo.
Narzędzia do analizy plików CLF
Surowy plik tekstowy z logami wymaga odpowiedniego narzędzia, żeby dało się z niego wyciągnąć cokolwiek przydatnego. Do najpopularniejszych rozwiązań należą:
- GoAccess — otwartoźródłowy analizator logów działający w czasie rzeczywistym, wyświetlający dane bezpośrednio w terminalu lub jako HTML.
- Screaming Frog Log File Analyser — desktopowe narzędzie SEO z przyjaznym interfejsem, idealne do jednorazowych audytów.
- Splunk / ELK Stack — zaawansowane platformy do ciągłego monitorowania logów w większych projektach.
- AWStats — klasyczne rozwiązanie serwerowe, generujące raporty HTML bezpośrednio na podstawie logów CLF.
Znaczenie CLF dla SEO i widoczności
Logi serwera w formacie CLF to jedno z niewielu źródeł danych, które pokazują aktywność botów Google bez pośrednictwa żadnego zewnętrznego narzędzia — to informacja prosto ze źródła. Google Search Console dostarcza danych o crawlowaniu, ale z opóźnieniem i w zagregowanej formie. Logi CLF pozwalają zobaczyć dokładnie, które URL-e Googlebot odwiedził o godzinie 03:47, ile czasu zajęło mu pobranie strony i czy otrzymał odpowiedź 200 czy 404.
Z perspektywy pozycjonowania stron analiza logów ma kilka praktycznych zastosowań. Pierwsza to kontrola crawl budgetu: jeśli Googlebot spędza nieproporcjonalnie dużo zasobów na stronach z parametrami URL, paginacji czy wersjach mobilnych, oznacza to marnotrawstwo limitu crawlowania. Drugie zastosowanie to wykrywanie błędów 404 i łańcuchów przekierowań 301/302, które obciążają serwer i utrudniają botowi indeksowanie. Trzecie — identyfikacja złośliwych botów i scraperów, które potrafią generować setki żądań na minutę i spowalniać serwer dla prawdziwych użytkowników.
Warto włączyć analizę logów CLF do regularnego audytu SEO. Dane z logów uzupełniają to, czego nie pokażą Google Analytics czy Search Console — zwłaszcza aktywność botów, zachowanie serwera pod obciążeniem i rzeczywisty czas odpowiedzi na poziomie poszczególnych zasobów.
FAQ
Czym różni się CLF od Common Log Format?
Common Log Format (CLF bez rozwinięcia “Combined”) zawiera tylko siedem pól i nie rejestruje nagłówków Referer ani User-Agent. Combined Log Format dodaje właśnie te dwa pola, co czyni go znacznie bardziej użytecznym do analizy źródeł ruchu i identyfikacji botów. Dziś praktycznie wszystkie serwery domyślnie stosują wariant Combined.
Jak uzyskać dostęp do logów serwera w formacie CLF?
Dostęp do logów zależy od rodzaju hostingu. Na serwerach VPS lub dedykowanych pliki logów znajdziesz zazwyczaj w katalogu /var/log/apache2/ lub /var/log/nginx/. Na hostingach współdzielonych logi są często dostępne przez panel cPanel w sekcji “Logi” lub “Raw Access Logs”. Jeśli twój hosting nie udostępnia logów, warto zapytać dostawcę o ich aktywowanie.
Czy logi CLF zawierają dane osobowe w rozumieniu RODO?
Adres IP zawarty w logu CLF jest uznawany za dane osobowe na gruncie RODO, ponieważ może umożliwiać identyfikację osoby fizycznej. Oznacza to obowiązek uwzględnienia logów serwera w polityce prywatności, określenia okresu przechowywania i podstawy prawnej przetwarzania. Standardowo przechowuje się logi przez 30–90 dni, choć w uzasadnionych przypadkach (bezpieczeństwo, audyt) okres ten może być dłuższy.
Kiedy warto analizować logi CLF zamiast polegać na Google Analytics?
Google Analytics nie rejestruje ruchu botów, żądań zablokowanych przez adblocki ani błędów po stronie serwera, które nigdy nie dotarły do przeglądarki użytkownika. Analiza logów CLF jest niezbędna wszędzie tam, gdzie chcesz zobaczyć pełny obraz aktywności na serwerze: crawlowanie, błędy 5xx, ataki DDoS czy wydajność ładowania poszczególnych zasobów statycznych (CSS, JS, obrazy).
Logi serwera jako fundament technicznego SEO
CLF to format pozornie techniczny, ale skrywający dane o praktycznym znaczeniu dla każdego projektu online. Regularna analiza logów pozwala reagować na problemy z crawlowaniem zanim odbije się to na widoczności w Google — a nie po fakcie, gdy pozycje już spadną. Jeśli chcesz sprawdzić, jak Googlebot widzi twoją stronę i czy crawl budget jest dobrze zagospodarowany, zespół Webiti chętnie pomoże przeprowadzić kompleksowy audyt techniczny.









