Wróć do słownika

Braki danych i imputacja

Braki danych są nieuniknionym elementem większości badań rynku, a imputacja danych pozwala uzupełnić część nieobserwowanych wartości w sposób kontrolowany i uzasadniony metodologicznie. Odpowiednio zastosowana zmniejsza ryzyko błędnych wniosków, ale nie zastępuje rzetelnego projektowania badania ani analizy przyczyn braków.

Co to są braki danych i imputacja?

Braki danych to sytuacje, w których dla co najmniej jednej zmiennej nie zarejestrowano wartości. W badaniach rynku mogą wynikać z pominięcia pytania przez respondenta, odmowy odpowiedzi, przerwania ankiety, błędu technicznego, niedostępności danych w źródle wtórnym lub niespójności przy łączeniu baz danych. Brak danych nie oznacza automatycznie błędu, lecz wymaga rozpoznania, ponieważ może wpływać na strukturę próby, wyniki analiz i decyzje biznesowe oparte na badaniu.

Imputacja danych to procedura zastępowania brakujących wartości wartościami oszacowanymi na podstawie dostępnych informacji. Jej celem nie jest odtworzenie faktycznej, nieznanej odpowiedzi konkretnej osoby, lecz ograniczenie strat analitycznych i zmniejszenie ryzyka zniekształcenia wyników. W praktyce imputacja opiera się na odpowiedziach tego samego respondenta, danych innych osób o podobnym profilu, modelach statystycznych albo wiedzy o strukturze populacji.

Znaczenie braków danych zależy przede wszystkim od ich mechanizmu. W metodologii wyróżnia się trzy podstawowe sytuacje:

  • Braki całkowicie losowe – ich występowanie nie zależy ani od obserwowanych cech respondentów, ani od brakującej wartości. Są najmniej problematyczne, choć nadal mogą zmniejszać precyzję analiz.
  • Braki losowe warunkowo – prawdopodobieństwo braku wiąże się z informacjami dostępnymi w zbiorze, na przykład młodsi respondenci częściej pomijają pytanie o dochód. W takich przypadkach imputacja danych może wykorzystywać te obserwowane zależności.
  • Braki nielosowe – brak odpowiedzi jest związany z samą nieobserwowaną wartością, na przykład osoby o bardzo wysokich dochodach częściej odmawiają ich podania. To sytuacja szczególnie wymagająca, ponieważ proste uzupełnianie danych może wzmacniać błąd.


Ocena mechanizmu braków jest ważniejsza niż sam odsetek pustych odpowiedzi. Nawet niewielka liczba braków może istotnie zniekształcić wnioski, jeśli dotyczy określonej grupy klientów, kluczowej zmiennej segmentacyjnej albo pytania wykorzystywanego do wyliczenia wskaźnika.

Zastosowanie braków danych i imputacji w praktyce

Braki danych i imputacja danych są stosowane przede wszystkim w badaniach ilościowych: ankietach CAWI, CATI, CAPI, panelach konsumenckich, pomiarach satysfakcji, badaniach marki oraz analizach baz CRM. Zagadnienie pojawia się również w projektach mixed-methods, gdy dane ankietowe są łączone z danymi behawioralnymi, transakcyjnymi lub jakościowymi.

W badaniu satysfakcji klientów brak odpowiedzi na pytanie o ocenę obsługi może wynikać z tego, że respondent nie korzystał z danego kanału kontaktu. Taki brak nie powinien być automatycznie zastępowany średnią oceną całej próby, ponieważ zmieniłoby to znaczenie pytania. Z kolei w badaniu wizerunku marki imputacja może być rozważona wtedy, gdy pojedyncze odpowiedzi brakuje w baterii podobnych pytań, a dostępne dane pozwalają wiarygodnie oszacować jej wartość.

W badaniach B2B braki danych często dotyczą obrotów, budżetów, liczby pracowników lub szczegółów procesu zakupowego. Respondenci mogą nie znać tych informacji, nie mieć uprawnień do ich ujawnienia albo celowo unikać odpowiedzi. W takim przypadku konieczne jest odróżnienie braku wiedzy od odmowy odpowiedzi. Te kategorie mają inne znaczenie analityczne i nie powinny być bezrefleksyjnie łączone.

Odpowiedź na pytanie, jak uzupełnić braki danych w badaniu ankietowym, zależy od celu analizy, rodzaju zmiennej, skali braków oraz mechanizmu ich powstawania. Przed wyborem metody należy wykonać kilka kroków:

  1. zidentyfikować, których pytań, grup respondentów i etapów badania dotyczą braki danych;
  2. sprawdzić, czy brak jest merytoryczny, techniczny czy wynika z logiki kwestionariusza;
  3. porównać respondentów z brakami i bez braków pod względem dostępnych cech;
  4. wybrać metodę postępowania adekwatną do planowanej analizy;
  5. udokumentować reguły imputacji danych oraz ocenić wpływ zastosowanej procedury na wyniki.


W projektach realizowanych przez Hume’s Institute analiza braków danych powinna być elementem kontroli jakości jeszcze przed przygotowaniem finalnych tabel, segmentacji lub modeli predykcyjnych. Dzięki temu można rozdzielić problem jakości danych od rzeczywistych różnic między badanymi grupami.

Braki danych i imputacja a powiązane metody

Braki danych i imputacja są powiązane z ważeniem danych, kontrolą jakości próby, kodowaniem odpowiedzi, analizą statystyczną i modelowaniem predykcyjnym. Nie są jednak tożsame z żadną z tych procedur.

Ważenie koryguje strukturę całej próby tak, aby lepiej odpowiadała znanym cechom populacji, na przykład strukturze klientów według regionu lub wielkości firmy. Nie uzupełnia brakującej odpowiedzi konkretnego respondenta. Imputacja danych uzupełnia wartość na poziomie rekordu, podczas gdy ważenie zmienia wpływ poszczególnych rekordów na wynik zbiorczy.

Usuwanie obserwacji niekompletnych, nazywane często analizą przypadków kompletnych, polega na wyłączeniu respondentów z brakami w analizowanych zmiennych. Jest to rozwiązanie proste, lecz może ograniczyć liczebność próby i prowadzić do obciążenia wyników, zwłaszcza gdy braki danych nie są całkowicie losowe.

Kodowanie odpowiedzi „nie wiem” lub „nie dotyczy” nie jest imputacją. Są to często pełnoprawne odpowiedzi o wartości interpretacyjnej. Na przykład wysoki udział odpowiedzi „nie znam marki” może być kluczową miarą jej świadomości. Takiej odpowiedzi nie należy traktować jak pustego pola wymagającego uzupełnienia.

Łączenie danych z CRM, systemów sprzedażowych, analityki internetowej lub źródeł zewnętrznych może zmniejszać skalę braków, lecz wymaga kontroli zgodności definicji zmiennych, okresów pomiaru i identyfikatorów. Dane z innego źródła nie są automatycznie prawidłową imputacją, jeśli opisują inną populację albo inny moment kontaktu z marką.

Metody imputacji danych i ich ograniczenia

Dobór metody imputacji danych powinien uwzględniać charakter zmiennej. Inaczej uzupełnia się brakującą kategorię odpowiedzi, inaczej wartość liczbową, a jeszcze inaczej dane wykorzystywane w modelu segmentacyjnym lub estymacji wielkości rynku.

Najczęściej stosowane metody obejmują:

  • Imputację stałą – zastąpienie braku z góry przyjętą wartością. W przypadku zmiennych kategorialnych może to być osobna kategoria „brak odpowiedzi”, gdy sam brak ma znaczenie informacyjne.
  • Imputację średnią, medianą lub dominantą – prostą technikę, która może być przydatna pomocniczo, ale zwykle zmniejsza naturalne zróżnicowanie danych i może osłabiać zależności między zmiennymi.
  • Imputację metodą najbliższych sąsiadów – przypisanie wartości na podstawie respondentów o podobnych cechach. Wymaga dobrze dobranych zmiennych opisowych.
  • Imputację regresyjną – oszacowanie brakującej wartości z wykorzystaniem modelu opartego na innych zmiennych. Jest bardziej analityczna, ale zależy od poprawności założeń modelu.
  • Wielokrotną imputację – utworzenie kilku prawdopodobnych wersji uzupełnionych danych, osobne przeprowadzenie analiz w każdym z nich i połączenie wyników w sposób uwzględniający niepewność imputacji. Jest szczególnie przydatna przy bardziej zaawansowanych analizach statystycznych.


Żadna metoda nie usuwa całkowicie ryzyka. Imputacja danych może poprawić użyteczność zbioru, ale może też stworzyć pozorną precyzję, jeśli opiera się na nieadekwatnych założeniach. Dlatego należy zachować oryginalne oznaczenia braków, dokumentować zastosowane reguły oraz sprawdzać, czy kluczowe wnioski pozostają stabilne przy różnych sposobach postępowania z brakującymi wartościami.