Analiza koszykowa: jak reguły asocjacyjne pokazują, co klienci kupują razem?

Monika

Masz w bazie miliony paragonów i pytanie od zarządu: które produkty naprawdę sprzedają się razem, a które tylko wyglądają na powiązane, bo oba są bestsellerami? Analiza koszykowa odpowiada na to pytanie językiem trzech miar – wsparcia, ufności i liftu – i to właśnie ich poprawna interpretacja decyduje, czy wynik trafi do planogramu, czy do kosza. Poniżej opis warsztatu: jak przygotować dane transakcyjne, jak wygenerować reguły asocjacyjne i jak odróżnić wzorzec od szumu.

Czym jest analiza koszykowa i kiedy warto po nią sięgnąć?

Analiza koszykowa (ang. market basket analysis) to technika data mining, która na podstawie zbioru transakcji wyszukuje zestawy produktów współwystępujących w tym samym koszyku. Ich związek z niezależną sprzedażą można ocenić m.in. za pomocą liftu. Formalnym wynikiem są reguły asocjacyjne zapisywane jako implikacja: jeśli w koszyku znajduje się produkt A (poprzednik), to z określonym prawdopodobieństwem znajduje się w nim również produkt B (następnik).

Metoda nie wymaga ankiety, panelu ani deklaracji respondenta. Pracuje na śladzie faktycznego zachowania – rekordzie kasowym, zamówieniu e-commerce, koszyku aplikacji mobilnej. To odróżnia ją od badań deklaratywnych: klient nie musi pamiętać ani umieć uzasadnić, dlaczego dołożył do koszyka drugi produkt. Wystarczy, że to zrobił, i że zrobił to dostatecznie wiele razy.

Analiza koszykowa staje się użyteczna w kilku typowych sytuacjach operacyjnych. Poniżej zestawienie kontekstów, w których pytanie badawcze naturalnie prowadzi do reguł asocjacyjnych:

  • Układ asortymentu i sąsiedztwo kategorii – gdy trzeba sprawdzić, które grupy produktów realnie migrują razem przez koszyk, a nie tylko wydają się pokrewne kategoriowo.
  • Projektowanie mechanik cross-sellingu – rekomendacje „kupowane razem”, zestawy promocyjne, sugestie w koszyku e-commerce.
  • Ocena kanibalizacji i komplementarności – reguły z liftem poniżej jedności wskazują pary, które rzadziej trafiają do jednego koszyka, niż wynikałoby z niezależności; może to być przesłanka do dalszej analizy substytucji.
  • Diagnostyka misji zakupowej – koszyk „szybkie uzupełnienie”, „duże zakupy tygodniowe” i „okazja konsumpcyjna” mogą mieć odmienne struktury współwystępowania.
  • Wsparcie kategorii nowo wprowadzanych – identyfikacja produktów, z którymi nowość pojawia się w koszyku w pierwszych tygodniach obecności na półce.


Warto zaznaczyć granicę interpretacyjną. Analiza koszykowa opisuje współwystępowanie, nie przyczynowość. Reguła „pieluchy → chusteczki nawilżane” nie oznacza, że zakup pieluch wywołuje zakup chusteczek. Może odzwierciedlać wspólną misję zakupową, promocję, ekspozycję lub inne czynniki. Wnioskowanie przyczynowe wymaga eksperymentu – testu na wydzielonych sklepach, testu A/B rekomendacji lub analizy quasi-eksperymentalnej z grupą kontrolną.

Jak liczy się wsparcie, ufność i lift w praktyce projektowej?

Rdzeniem metody są trzy miary. Każda odpowiada na inne pytanie i żadna z nich samodzielnie nie wystarcza do oceny reguły.

Wsparcie (support) to udział transakcji zawierających dany zestaw produktów w całkowitej liczbie transakcji. Odpowiada na pytanie: jak często w ogóle zdarza się ten koszyk? Wsparcie jest miarą skali. Reguła o znikomym wsparciu, nawet jeśli statystycznie wygląda efektownie, dotyczy garstki paragonów i rzadko przekłada się na decyzję operacyjną o zmianie ekspozycji.

Ufność (confidence) to prawdopodobieństwo warunkowe: jaki odsetek koszyków zawierających produkt A zawiera również produkt B. Odpowiada na pytanie: jak pewna jest implikacja? Ufność ma jednak istotną wadę – jest zawyżana przez popularność następnika. Jeśli mleko trafia do większości koszyków w sieci, to niemal każda reguła „cokolwiek → mleko” będzie miała wysoką ufność, choć nie niesie żadnej informacji o ponadprzeciętnym powiązaniu.

Lift koryguje tę słabość. Jest ilorazem ufności reguły i wsparcia samego następnika, czyli porównuje obserwowane współwystępowanie z sytuacją pełnej niezależności produktów. Lift równy jedności oznacza brak powiązania w analizowanych danych. Powyżej jedności – produkty pojawiają się razem częściej niż wynikałoby z niezależności. Poniżej – rzadziej, co może być sygnałem substytucji, ale także skutkiem innych różnic między transakcjami.

W praktyce projektowej te trzy miary stosuje się sekwencyjnie: najpierw filtr wsparcia odsiewa reguły marginalne, potem ufność i lift porządkują pozostałe. Progi warto ustalić przed analizą potwierdzającą lub jasno opisać jako eksploracyjne, aby ograniczyć ryzyko dopasowywania kryteriów do z góry upatrzonej tezy.

Wysoki lift przy niewielkiej liczbie transakcji może być efektem losowej fluktuacji, dlatego progi wsparcia warto ustalać przed analizą, a wyniki sprawdzać na niezależnym okresie lub próbie. Reguła o lifcie kilkukrotnie przewyższającym jedność, oparta na kilkudziesięciu paragonach z bazy liczonej w milionach, wymaga szczególnej ostrożności i walidacji przed wykorzystaniem operacyjnym.

Jakie kroki obejmuje przygotowanie danych transakcyjnych?

Największa część nakładu pracy w analizie koszykowej przypada nie na algorytm, lecz na przygotowanie danych. Poniżej typowa sekwencja działań w projekcie:

  1. Definicja jednostki transakcji. Czy koszykiem jest pojedynczy paragon, czy suma zakupów klienta w danym dniu? W e-commerce – zamówienie czy sesja? Odpowiedź zmienia strukturę wyników.
  2. Wybór poziomu agregacji produktu. Reguły na poziomie SKU są precyzyjne, ale rozdrabniają wsparcie i generują tysiące trudnych do interpretacji zależności. Poziom podkategorii lub marki daje reguły stabilniejsze i łatwiejsze do wdrożenia.
  3. Oczyszczenie zbioru. Usunięcie zwrotów, korekt kasowych, transakcji testowych, zakupów służbowych i pozycji niebędących produktami (opłaty, opakowania, torby).
  4. Binaryzacja koszyka. Klasyczne reguły asocjacyjne operują na obecności produktu, nie na ilości ani wartości. Ilość analizuje się osobno, na etapie wyceny potencjału reguły.
  5. Ustalenie progów. Minimalne wsparcie, minimalna ufność i minimalny lift definiowane przed uruchomieniem analizy potwierdzającej, z uzasadnieniem opartym na wielkości bazy i celu analizy.
  6. Generowanie reguł. Najczęściej algorytmem Apriori lub FP-Growth, zależnie od rozmiaru zbioru i liczby unikalnych pozycji.
  7. Walidacja czasowa. Sprawdzenie, czy reguła utrzymuje się w kolejnych oknach czasowych, czy zniknęła wraz z zakończeniem promocji.


Ostatni krok bywa pomijany, a odpowiada za znaczną część różnicy między analizą wartościową a listą ciekawostek. Reguła obecna w danych ze stycznia, lutego i marca jest bardziej wiarygodnym kandydatem na stabilny wzorzec niż reguła widoczna wyłącznie w tygodniu gazetki promocyjnej. Ta druga może opisywać mechanikę promocji, a nie trwałe zachowanie zakupowe.

Jakie błędy najczęściej wypaczają wyniki analizy koszykowej?

Analiza koszykowa jest metodą technicznie prostą i przez to podatną na nadinterpretację. Poniżej pułapki spotykane najczęściej w projektach na danych transakcyjnych.

  • Odkrywanie oczywistości. Algorytm może wskazać, że pieczywo kupuje się z nabiałem, a szampon z odżywką. Reguły o wysokim wsparciu i wysokiej ufności bywają trywialne. Wartość analityczna może zaczynać się tam, gdzie lift jest wyraźnie podwyższony przy średnim wsparciu – to obszar powiązań nieoczywistych, ale dostatecznie licznych.
  • Ignorowanie efektu promocji. Współwystępowanie wywołane zestawem promocyjnym lub ekspozycją na końcówce regału opisuje działanie marketingu, nie musi zaś odzwierciedlać trwałej preferencji klienta. Bez oznaczenia okresów promocyjnych w danych reguły mogą stać się autoportretem własnych działań handlowych.
  • Efekt wielokrotnego testowania. Przy kilku tysiącach produktów liczba możliwych par idzie w miliony. Część reguł przekroczy zadane progi wyłącznie z powodu losowości. Odpowiedzią jest odpowiedni próg wsparcia, walidacja na niezależnym oknie czasowym oraz, w razie potrzeby, ocena niepewności statystycznej.
  • Mieszanie kanałów i formatów. Koszyk w sklepie convenience, w hipermarkecie i w kanale online rządzi się inną logiką. Łączenie ich w jeden zbiór może generować reguły uśrednione, nieadekwatne dla poszczególnych formatów.
  • Asymetria reguł. Reguła A → B i reguła B → A mają identyczne wsparcie i lift, ale różną ufność. Pominięcie tej różnicy może prowadzić do nietrafnego wyboru kierunku rekomendacji, choć nie oznacza kierunku przyczynowego.
  • Brak przełożenia na wartość. Reguła o wysokim lifcie może dotyczyć produktów o marginalnej marży lub rotacji. Ocena użyteczności reguły wymaga zestawienia jej z danymi wartościowymi, czego same miary asocjacyjne nie dostarczają.

Czym analiza koszykowa różni się od segmentacji i badań deklaratywnych?

Analiza koszykowa opisuje strukturę pojedynczej transakcji. Segmentacja klientów opisuje profil osoby na przestrzeni wielu transakcji. To dwa różne poziomy obserwacji i często dają odmienne obrazy. Ten sam klient może w poniedziałek realizować misję „szybkie uzupełnienie”, a w sobotę „duże zakupy” – reguły asocjacyjne wyłapią różnicę między koszykami, a segmentacja może przypisać go do jednego lub kilku profili, zależnie od zastosowanej metody.

Badania deklaratywne z kolei mogą dostarczać deklarowanych wyjaśnień motywacji. Analiza koszykowa pokazuje, że dwa produkty pojawiają się razem, ale nie wyjaśnia motywacji. Dlatego w projektach mixed-methods reguły asocjacyjne pełnią funkcję hipotezotwórczą: wskazują pary warte pogłębienia w wywiadzie, w badaniu shopperowym lub w teście w punkcie sprzedaży. Najbardziej użyteczne wnioski mogą powstawać wtedy, gdy wynik ilościowy z danych transakcyjnych zderzy się z obserwacją zachowania przy półce.

Uzupełniającą perspektywę daje pomiar detaliczny, który pokazuje dostępność produktu i warunki ekspozycji. Bez tej warstwy łatwo zinterpretować brak reguły jako brak zainteresowania, podczas gdy przyczyną mogła być zwykła luka na półce w analizowanym okresie.

Jak ocenić, czy reguła nadaje się do wdrożenia?

Nie każda statystycznie poprawna reguła jest użyteczna operacyjnie. Przed przekazaniem wyników do działu handlowego warto przejść listę kontrolną.

  • Skala. Czy wsparcie reguły odpowiada liczbie transakcji, przy której zmiana ekspozycji lub rekomendacji ma szansę dać mierzalny efekt?
  • Stabilność. Czy reguła utrzymuje się w co najmniej kilku niezależnych oknach czasowych i, jeśli ma być wdrażana szeroko, w odpowiednich formatach sklepu?
  • Nieoczywistość. Czy reguła wnosi informację, której nie dostarczałaby prosta wiedza kategoriowa?
  • Kierunkowość. Czy sprawdzono ufność w obie strony i wybrano kierunek rekomendacji adekwatny do celu biznesowego?
  • Czystość od promocji. Czy okres analizy nie był zdominowany przez mechanikę zestawów lub gazetkę?
  • Testowalność. Czy reguła daje się przełożyć na hipotezę weryfikowalną eksperymentem w części sklepów lub testem A/B w kanale online?


Ostatni punkt jest najważniejszy metodologicznie. Analiza koszykowa generuje hipotezy; dowodu skuteczności wdrożenia dostarcza dopiero test. Traktowanie listy reguł jako gotowego zbioru wniosków pomija ten krok i przenosi ryzyko błędnej interpretacji na wdrożenie.

Najczęściej zadawane pytania

Czym jest analiza koszykowa?

Analiza koszykowa to technika data mining wyszukująca w zbiorze transakcji produkty współwystępujące w tym samym koszyku. Wynikiem są reguły asocjacyjne o postaci „jeśli A, to prawdopodobnie również B”, opisane miarami wsparcia, ufności i liftu. Metoda pracuje na zarejestrowanym zachowaniu zakupowym, nie na deklaracjach, i opisuje współwystępowanie, a nie związek przyczynowy.

Co oznaczają wsparcie, ufność i lift?

Wsparcie to udział transakcji zawierających dany zestaw produktów w całej bazie – mierzy skalę zjawiska. Ufność to prawdopodobieństwo warunkowe pojawienia się następnika w koszykach zawierających poprzednik – mierzy siłę implikacji, ale jest zawyżana przez popularne produkty. Lift porównuje obserwowane współwystępowanie z sytuacją pełnej niezależności: wartość powyżej jedności wskazuje dodatnie powiązanie w analizowanych danych, równa jedności brak takiego powiązania, a poniżej jedności ujemne powiązanie, które może, lecz nie musi, oznaczać substytucji.

Jakie dane są potrzebne do analizy koszykowej?

Minimum to identyfikator transakcji i lista pozycji w niej zawartych, z jednolitym słownikiem produktów oraz spójną hierarchią kategorii. Przydatne uzupełnienia to data i godzina transakcji, identyfikator sklepu i formatu, oznaczenie okresów promocyjnych oraz wartość i ilość pozycji – pozwalają uwzględnić efekty mechanik handlowych i wycenić potencjał reguły. Identyfikator klienta z programu lojalnościowego nie jest wymagany, ale umożliwia połączenie reguł z profilem kupującego.

Zapytaj o analizę koszykową na danych Twojego sklepu lub sieci

Zapytaj o analizę koszykową na danych Twojego sklepu lub sieci – Hume’s Institute przygotuje zakres analizy, ustali progi miar adekwatne do wielkości bazy i zaproponuje sposób walidacji wyników. Skontaktuj się, aby omówić strukturę dostępnych danych transakcyjnych.