Wróć do słownika

Analiza dyskryminacyjna

Analiza dyskryminacyjna to metoda statystyczna służąca do rozróżniania wcześniej zdefiniowanych grup na podstawie zestawu cech oraz do przypisywania nowych przypadków do najbardziej prawdopodobnej grupy. W badaniach rynku pozwala wyjaśnić, które zmienne najlepiej odróżniają na przykład lojalnych klientów od osób rezygnujących z marki, segmenty konsumentów lub grupy o różnym potencjale zakupowym.

Co to jest analiza dyskryminacyjna?

Analiza dyskryminacyjna, określana po angielsku jako discriminant analysis, jest metodą wielowymiarowej analizy danych stosowaną wtedy, gdy badane obiekty należą już do znanych kategorii. Jej celem jest znalezienie kombinacji zmiennych, która jak najlepiej rozróżnia te kategorie, a następnie wykorzystanie tego modelu do klasyfikacji kolejnych obserwacji.

W badaniach rynku obiektem analizy może być respondent, klient, punkt sprzedaży, firma lub produkt. Zmienną grupującą może być na przykład status klienta, wybór marki, poziom satysfakcji określony kategoriami, przynależność do segmentu albo decyzja o zakupie. Zmienne wyjaśniające opisują cechy, które potencjalnie różnicują te grupy, takie jak oceny marki, częstotliwość korzystania z produktu, postawy zakupowe, cechy demograficzne czy parametry współpracy B2B.

Podstawą analizy dyskryminacyjnej są funkcje dyskryminacyjne. Są to równania łączące wiele zmiennych w taki sposób, aby odległość między grupami była możliwie duża, a zróżnicowanie przypadków wewnątrz tych samych grup możliwie małe. W rezultacie można ustalić zarówno siłę rozróżniania poszczególnych zmiennych, jak i trafność klasyfikacji przypadków.

Metoda wymaga, aby grupy były znane przed rozpoczęciem modelowania. Nie służy więc przede wszystkim do samodzielnego odkrywania segmentów w danych, lecz do analizy różnic między grupami określonymi na podstawie kryterium biznesowego lub badawczego. Przykładowo można badać, czym różnią się nabywcy marki od nabywców produktów konkurencyjnych, jeśli informacja o wyborze marki została zebrana w ankiecie.

Zastosowanie analizy dyskryminacyjnej w praktyce

Analiza dyskryminacyjna znajduje zastosowanie przede wszystkim w badaniach ilościowych, w których dostępna jest odpowiednio liczna baza obserwacji oraz zestaw ustrukturyzowanych zmiennych. Jest użyteczna, gdy potrzebne jest nie tylko stwierdzenie, że grupy różnią się między sobą, ale także określenie, które czynniki mają największe znaczenie dla tego rozróżnienia.

W praktyce badawczej metoda może wspierać między innymi:

  • identyfikację cech odróżniających klientów lojalnych od klientów zagrożonych odejściem,
  • analizę profilu nabywców różnych marek lub wariantów produktu,
  • ocenę czynników odróżniających użytkowników intensywnych od okazjonalnych,
  • klasyfikację leadów sprzedażowych według prawdopodobieństwa konwersji,
  • rozpoznanie cech przedsiębiorstw należących do grup o różnym potencjale zakupowym,
  • weryfikację, czy zestaw wskaźników wizerunkowych pozwala poprawnie rozróżniać grupy klientów.


W sektorze FMCG analiza dyskryminacyjna może wskazać, które atrybuty produktu i marki najsilniej odróżniają konsumentów kupujących markę własną sieci od kupujących markę producenta. W telekomunikacji może być wykorzystywana do analizy różnic między klientami przedłużającymi umowę i rezygnującymi z usług. W projektach B2B pomaga porównywać profile firm korzystających z różnych modeli współpracy, poziomów obsługi lub rozwiązań technologicznych.

Wyniki powinny być interpretowane łącznie z wiedzą o rynku i konstrukcją badania. Wysoki udział danej zmiennej w funkcji dyskryminacyjnej nie przesądza o związku przyczynowym. Oznacza natomiast, że zmienna skutecznie odróżnia analizowane grupy w badanej próbie. Dlatego analiza dyskryminacyjna jest szczególnie wartościowa jako narzędzie wspierające diagnozę, targetowanie komunikacji i budowę reguł klasyfikacyjnych.

Analiza dyskryminacyjna a powiązane metody

Analiza dyskryminacyjna należy do metod klasyfikacyjnych, ale jej zastosowanie i założenia różnią się od innych narzędzi używanych w analityce marketingowej. Dobór metody zależy przede wszystkim od typu zmiennej zależnej, struktury danych, celu analizy oraz stopnia spełnienia założeń statystycznych.

Najczęściej porównuje się ją z następującymi podejściami:

  • Regresja logistyczna – podobnie jak analiza dyskryminacyjna, umożliwia przewidywanie przynależności do grup. Regresja logistyczna modeluje jednak prawdopodobieństwo wystąpienia kategorii i zwykle jest bardziej elastyczna wobec rozkładów zmiennych oraz współzmienności w grupach.
  • Analiza skupień – służy do odkrywania grup w danych, gdy segmenty nie są wcześniej znane. Analiza dyskryminacyjna może zostać zastosowana po analizie skupień, aby opisać i klasyfikować wyodrębnione segmenty.
  • Drzewa decyzyjne – budują reguły klasyfikacji w formie kolejnych podziałów danych. Są często łatwiejsze do komunikowania użytkownikom biznesowym, natomiast analiza dyskryminacyjna lepiej pokazuje łączny wpływ wielu zmiennych w ramach funkcji liniowej.
  • Analiza czynnikowa – redukuje liczbę zmiennych i identyfikuje ukryte wymiary postaw lub ocen. Nie klasyfikuje przypadków, ale jej wyniki mogą zostać wykorzystane jako zmienne wejściowe w analizie dyskryminacyjnej.


W praktyce pytanie „analiza dyskryminacyjna a regresja logistyczna różnice” dotyczy przede wszystkim warunków stosowania i interpretacji wyników. Klasyczna liniowa analiza dyskryminacyjna zakłada w przybliżeniu wielowymiarowy rozkład normalny zmiennych w grupach oraz podobieństwo macierzy wariancji i kowariancji tych grup. Regresja logistyczna nie wymaga tych samych założeń, dlatego często jest preferowana przy danych ankietowych, w których warunki te nie są spełnione. Z kolei analiza dyskryminacyjna może być szczególnie użyteczna, gdy założenia są akceptowalne, a celem jest wyraźne opisanie wymiarów rozróżniających grupy.

Ograniczenia i warunki poprawnego zastosowania

Aby analiza dyskryminacyjna dostarczała wiarygodnych wyników, konieczne jest odpowiednie przygotowanie danych. Szczególne znaczenie ma jakość zmiennych wejściowych, sposób zdefiniowania grup oraz sprawdzenie, czy model klasyfikuje przypadki trafnie także poza zbiorem użytym do jego zbudowania.

W analizie należy zwrócić uwagę na kilka kwestii metodologicznych:

  • grupy powinny być zdefiniowane na podstawie uzasadnionego kryterium biznesowego lub badawczego,
  • zmienne wyjaśniające powinny mieć charakter ilościowy lub być zakodowane w sposób umożliwiający poprawne modelowanie,
  • silna współliniowość między zmiennymi może utrudniać interpretację funkcji dyskryminacyjnych,
  • nierówny udział grup w próbie może wpływać na wyniki klasyfikacji,
  • trafność modelu powinna być weryfikowana na danych walidacyjnych albo z użyciem procedur walidacji krzyżowej.


Analiza dyskryminacyjna nie zastępuje interpretacji biznesowej ani jakościowej diagnozy potrzeb klientów. Może jednak stanowić wartościowy element projektów mixed-methods, gdy wyniki ilościowe wskazują grupy i czynniki różnicujące, a badania jakościowe pomagają wyjaśnić mechanizmy stojące za tymi różnicami. Dzięki temu klasyfikacja statystyczna może zostać przełożona na użyteczne decyzje dotyczące segmentacji, oferty, komunikacji i obsługi klienta.