Wróć do słownika

Anonimizacja i pseudonimizacja danych

Anonimizacja danych i pseudonimizacja danych badawczych ograniczają ryzyko identyfikacji uczestników badań, lecz mają odmienny skutek prawny i operacyjny. Anonimizacja ma trwale uniemożliwić ustalenie tożsamości osoby, natomiast pseudonimizacja zastępuje dane identyfikujące kodem, zachowując możliwość połączenia rekordu z konkretną osobą przy użyciu odrębnych informacji.

Co to jest anonimizacja i pseudonimizacja danych?

Anonimizacja danych to proces nieodwracalnego przekształcenia danych osobowych w taki sposób, aby identyfikacja osoby, której dane dotyczą, nie była możliwa ani bezpośrednio, ani pośrednio przy użyciu środków, których można racjonalnie oczekiwać. Zanonimizowany zbiór przestaje być zbiorem danych osobowych, o ile ryzyko ponownej identyfikacji zostało skutecznie wyeliminowane.

Pseudonimizacja danych badawczych polega natomiast na zastąpieniu identyfikatorów, takich jak imię, nazwisko, adres e-mail, numer telefonu czy identyfikator klienta, pseudonimem lub kodem. Przykładowo respondent może otrzymać oznaczenie „R-104”, a tabela łącząca ten kod z jego danymi kontaktowymi jest przechowywana oddzielnie i objęta dodatkowymi zabezpieczeniami. Osoba posiadająca dostęp do klucza może ponownie przypisać rekord do respondenta, dlatego dane pseudonimizowane nadal są danymi osobowymi.

Rozróżnienie to wynika wprost z RODO. Definicję pseudonimizacji zawiera art. 4 pkt 5 rozporządzenia, natomiast motyw 26 wskazuje, że zasad ochrony danych nie stosuje się do informacji anonimowych, czyli takich, które nie odnoszą się do zidentyfikowanej lub możliwej do zidentyfikowania osoby fizycznej. W praktyce anonimizacja a pseudonimizacja danych w RODO różnią się przede wszystkim tym, czy nadal istnieje realna możliwość powiązania danych z konkretnym człowiekiem.

W badaniach rynku rozróżnienie ma szczególne znaczenie, ponieważ materiał badawczy często zawiera dane ujawniane poza standardowym formularzem kontaktowym. Mogą to być odpowiedzi otwarte, nagrania wywiadów, transkrypcje, dane o lokalizacji, stanowisku zawodowym, zachowaniach zakupowych lub specyficznych doświadczeniach. Nawet po usunięciu imienia i nazwiska zestaw takich informacji może umożliwić identyfikację uczestnika, zwłaszcza w małej grupie zawodowej lub lokalnej społeczności.

Zastosowanie anonimizacji i pseudonimizacji danych w praktyce

Anonimizacja danych i pseudonimizacja danych badawczych są stosowane na różnych etapach projektu: podczas rekrutacji respondentów, zbierania odpowiedzi, analizy, raportowania, archiwizacji oraz przekazywania wyników klientowi. Dobór rozwiązania zależy od celu projektu, potrzeby kontaktu z uczestnikiem i charakteru analiz.

Pseudonimizację stosuje się wtedy, gdy zachowanie ciągłości rekordu jest potrzebne. Dotyczy to zwłaszcza badań trackingowych, paneli konsumenckich, badań satysfakcji klientów, projektów customer experience czy badań B2B, w których konieczne może być uzupełnienie odpowiedzi, kontrola jakości lub ponowny kontakt z respondentem.

Typowe zastosowania pseudonimizacji obejmują:

  • łączenie odpowiedzi z kilku fal badania bez ujawniania analitykom danych kontaktowych uczestników,
  • oddzielenie bazy rekrutacyjnej od zbioru odpowiedzi ankietowych,
  • kontrolę duplikatów i jakości wywiadów w badaniach ilościowych,
  • przechowywanie nagrań oraz transkrypcji wywiadów jakościowych pod kodami respondentów,
  • realizację projektów mixed-methods, w których dane ankietowe są łączone z pogłębionymi wywiadami.


Anonimizacja danych jest właściwa przede wszystkim wtedy, gdy dalsze powiązanie odpowiedzi z konkretną osobą nie jest potrzebne. Przykładem może być przekazanie klientowi tabel wynikowych, zbiorczych segmentów konsumentów, zanonimizowanych cytatów z wywiadów lub bazy odpowiedzi otwartych po usunięciu identyfikatorów i informacji umożliwiających rozpoznanie autora.

W badaniach B2B szczególnej ostrożności wymagają dane o stanowisku, firmie, branży i lokalizacji. Wąska kombinacja cech, na przykład dyrektor określonego obszaru w firmie działającej na konkretnym rynku, może pozwolić na identyfikację nawet bez wskazania nazwy organizacji. Dlatego anonimizacja danych nie może ograniczać się do usunięcia pól typu „imię” lub „e-mail”. Wymaga oceny całego kontekstu zbioru.

Anonimizacja i pseudonimizacja danych a powiązane metody

Anonimizacja danych i pseudonimizacja danych badawczych są elementami zarządzania danymi, ale nie są tożsame z szyfrowaniem, agregacją ani zwykłym usunięciem części zmiennych. Każde z tych działań może wzmacniać ochronę informacji, lecz realizuje inną funkcję.

Najważniejsze różnice można ująć następująco:

  • Szyfrowanie chroni dane przed nieuprawnionym odczytem. Zaszyfrowane dane mogą jednak zostać odszyfrowane przy użyciu klucza, dlatego nadal mogą być danymi osobowymi.
  • Maskowanie danych ukrywa fragment wartości, na przykład część adresu e-mail lub numeru telefonu. Nie musi usuwać możliwości identyfikacji, więc samo w sobie nie przesądza o anonimizacji.
  • Agregacja przedstawia dane na poziomie grup, na przykład segmentów klientów lub kategorii odpowiedzi. Ogranicza ujawnianie informacji jednostkowych, ale przy bardzo małych grupach nadal może stwarzać ryzyko identyfikacji.
  • Minimalizacja danych oznacza zbieranie wyłącznie informacji potrzebnych do określonego celu badawczego. Jest zasadą ograniczającą ryzyko już na etapie projektowania badania, a nie techniką przekształcania istniejącego zbioru.
  • Deidentyfikacja jest pojęciem szerszym, używanym dla działań zmniejszających możliwość identyfikacji. W zależności od zastosowanej metody może prowadzić do pseudonimizacji albo do rzeczywistej anonimizacji.


W projektach ilościowych anonimizacja danych często łączy się z raportowaniem wyników na poziomie segmentów oraz z ograniczaniem prezentacji małych grup. W badaniach jakościowych istotne jest redagowanie cytatów, nazw firm, miejsc, produktów i szczegółów biograficznych. Z kolei w projektach mixed-methods pseudonimizacja umożliwia łączenie źródeł danych przy zachowaniu kontroli nad tym, kto może odtworzyć tożsamość respondenta.

Warunki skutecznej anonimizacji danych badawczych

Skuteczna anonimizacja danych wymaga oceny ryzyka ponownej identyfikacji, a nie wyłącznie technicznego usunięcia bezpośrednich identyfikatorów. Ocena powinna uwzględniać, jakie dodatkowe dane mogą być dostępne odbiorcy zbioru, jak łatwo można łączyć rekordy z innymi źródłami oraz czy nietypowe cechy respondentów nie ujawniają ich tożsamości.

W praktyce stosuje się między innymi usuwanie identyfikatorów bezpośrednich, uogólnianie kategorii, łączenie rzadkich odpowiedzi w szersze grupy, ograniczanie precyzji danych geograficznych oraz redakcję fragmentów tekstowych. Każda z tych technik zmniejsza jednak szczegółowość materiału, dlatego należy równoważyć wartość analityczną danych z ochroną uczestników.

Pseudonimizacja danych badawczych wymaga natomiast kontroli dostępu do klucza identyfikującego, rozdzielenia ról w zespole projektowym oraz jasnego określenia okresu przechowywania danych. Dobra praktyka obejmuje także dokumentowanie przepływu informacji od rekrutacji do raportu końcowego. Takie podejście pozwala zachować użyteczność danych dla analizy rynku, jednocześnie ograniczając ryzyko naruszenia prywatności respondentów.