Pytanie „czy nasza prognoza jest wystarczająco dobra?” prawie zawsze sprowadza się do innego: czy metoda została dobrana do danych, którymi faktycznie dysponujemy. Prognozowanie popytu na trzydziestu miesięcznych obserwacjach i na pięciu latach tygodniowych danych transakcyjnych to dwa różne zadania analityczne, mimo że decyzja biznesowa może być identyczna. Poniżej opisano, jak rozstrzygnąć wybór między wygładzaniem wykładniczym a modelem ARIMA – i jak zweryfikować, że wybór był trafny.
Kiedy prognozowanie popytu wymaga prostego modelu, a kiedy złożonego?
Punktem wyjścia nie jest ambicja analityczna, lecz inwentaryzacja danych. Prognozowanie popytu opiera się na szeregu czasowym, a wybór metod zależy przede wszystkim od długości historii, częstotliwości obserwacji, sezonowości, jakości danych i poziomu szumu.
Długość historii. Metody wymagające estymacji wielu parametrów potrzebują odpowiednio długiego szeregu. Przy kilkunastu-dwudziestu kilku obserwacjach miesięcznych realnie da się wiarygodnie oszacować poziom i – ostrożnie – trend. Próba dopasowania rozbudowanego modelu autoregresyjnego do tak krótkiego szeregu może prowadzić do przeuczenia: model dobrze opisuje przeszłość, ale błądzi w przyszłości. Jeżeli szereg zawiera wzorzec powtarzalny w cyklu rocznym, do jego rzetelnej estymacji potrzebne są co najmniej dwa-trzy pełne cykle, a przy danych tygodniowych zwykle odpowiednio dłuższa historia.
Częstotliwość obserwacji. Dane roczne dają mało punktów i zwykle nie pozwalają na nic więcej niż model poziomu z trendem. Dane miesięczne to standardowy grunt dla obu rodzin metod. Dane tygodniowe i dzienne wprowadzają dodatkową strukturę (kalendarz, efekty dni tygodnia, święta ruchome), której klasyczne wygładzanie wykładnicze nie uwzględni bez rozszerzenia o model regresyjny, a model ARIMA uwzględni wyłącznie po rozszerzeniu o zmienne zewnętrzne.
Poziom szumu i charakter popytu. Szereg gładki, z wyraźnym kierunkiem i regularnym wzorcem, to naturalne środowisko dla metod wygładzających. Szereg z silną autokorelacją reszt, z inercją reakcji na wcześniejsze wartości, z przesunięciami w czasie – to środowisko dla klasy ARIMA. Osobną kategorią jest popyt przerywany, z dużą liczbą okresów zerowych, typowy dla części zamiennych i produktów niskorotacyjnych; tam ani jedna, ani druga metoda często nie jest właściwym narzędziem i stosuje się podejścia dedykowane popytowi sporadycznemu.
W praktyce projektowej decyzja o metodzie zapada po diagnostyce, nie przed nią. Analiza obejmuje dekompozycję szeregu, sprawdzenie stacjonarności, obejrzenie funkcji autokorelacji i autokorelacji cząstkowej oraz identyfikację obserwacji odstających wynikających z akcji promocyjnych, zmian dystrybucji czy jednorazowych zdarzeń. Dopiero ten materiał mówi, czy prognozowanie sprzedaży w danym przypadku wymaga modelu lepiej opisującego autokorelację, czy wystarczy mechanizm adaptacyjnie aktualizujący poziom i trend.
Jak wybrać metodę prognozowania popytu w praktyce?
Wygładzanie wykładnicze to rodzina metod, w której prognoza jest ważoną średnią przeszłych obserwacji, a wagi maleją wykładniczo wraz z oddalaniem się w przeszłość. Najprostszy wariant modeluje wyłącznie poziom. Wariant z trendem (Holt) dodaje składową kierunku. Wariant Holta-Wintersa obejmuje poziom, trend i składową powtarzalnego wzorca sezonowego. Współczesne ujęcie tej rodziny to modele przestrzeni stanów ETS, w których wybór kombinacji składowych i ich charakteru (addytywny lub multiplikatywny) odbywa się w oparciu o kryteria informacyjne.
Model ARIMA działa inaczej: opisuje szereg przez zależność wartości bieżącej od wartości opóźnionych (część autoregresyjna), od przeszłych błędów prognozy (część średniej ruchomej) oraz przez różnicowanie, które może usuwać niestacjonarność. Wariant SARIMA dodaje analogiczne składowe na poziomie sezonowym, a wariant z regresorami (ARIMAX, SARIMAX) pozwala uwzględnić czynniki zewnętrzne: cenę, intensywność promocji, liczbę punktów sprzedaży, temperaturę, kalendarz świąt.
Praktyczne kryteria wyboru można ułożyć w kolejność. Poniżej zestaw pytań, które w projektach prognostycznych rozstrzygają sprawę najczęściej:
- Ile mam obserwacji? Szereg krótki – wygładzanie wykładnicze lub model naiwny z korektą. Szereg długi – otwiera się przestrzeń dla ARIMA.
- Czy reszty prostego modelu są losowe? Jeśli po dopasowaniu wygładzania wykładniczego w resztach zostaje wyraźna struktura autokorelacyjna, prosty model nie wyczerpał informacji zawartej w danych i klasa ARIMA może mieć czym pracować.
- Czy chcę uwzględnić zmienne objaśniające? Klasyczne wygładzanie wykładnicze nie przyjmuje regresorów. Jeżeli prognoza ma reagować na planowane obniżki cen lub zmiany dystrybucji, potrzebny jest model z częścią regresyjną.
- Jaki jest horyzont prognozy? Na krótkim horyzoncie różnice trafności między metodami często okazują się niewielkie. Na dłuższym horyzoncie znaczenie zyskuje poprawna specyfikacja trendu i jego tłumienia.
- Ile szeregów prognozuję? Przy setkach SKU liczy się automatyzacja i stabilność. Rodzina ETS jest łatwiejsza w masowym, automatycznym stosowaniu; automatyczna identyfikacja ARIMA również jest możliwa, ale wymaga ostrzejszej kontroli wyników.
- Kto będzie utrzymywał model? Model, którego zespół nie rozumie i nie potrafi przeliczyć, przestaje być używany po kilku miesiącach.
Rozstrzygnięcie nie następuje jednak na etapie diagnostyki, a na etapie walidacji. Standardem jest podział szeregu na część treningową i testową, przy czym – w odróżnieniu od danych przekrojowych – podział musi respektować kolejność czasową. Bardziej wymagającym i bardziej informatywnym podejściem jest walidacja krocząca: model jest wielokrotnie estymowany na coraz dłuższym oknie historii i oceniany na kolejnych okresach, których nie widział. Otrzymuje się wtedy rozkład błędów, a nie jeden przypadkowy wynik.
Jak podkreślają eksperci Hume’s Institute, bardziej złożony model nie gwarantuje lepszej prognozy – o wyborze decyduje test na danych, których model nie widział. Dopasowanie w próbie treningowej zwykle poprawia się wraz z dodawaniem parametrów, więc porównywanie metod wyłącznie na tej podstawie sprzyja wyborowi modeli przeuczonych.
Porównanie musi być domknięte punktem odniesienia. W prognozowaniu szeregów czasowych rolę tę pełnią modele naiwne: prognoza równa ostatniej obserwacji, prognoza równa wartości z analogicznego okresu poprzedniego sezonu, średnia ruchoma. Jeżeli ani wygładzanie wykładnicze, ani ARIMA nie poprawiają wyniku względem modelu sezonowo naiwnego, oznacza to, że nie wykorzystują dostępnej struktury lepiej niż prosty punkt odniesienia. Warto wtedy sprawdzić specyfikację modeli, jakość danych i możliwość uwzględnienia istotnych zmiennych zewnętrznych. Dobór miary błędu i interpretacja jej wartości to osobne zagadnienie, szerzej opisane w materiale o tym, co naprawdę mówi MAPE i pozostałe miary błędu.
Jakie błędy najczęściej psują prognozowanie popytu?
Większość nietrafionych prognoz nie wynika z wyboru złej rodziny modeli, lecz z błędów popełnionych wcześniej – na danych – albo z błędnej procedury oceny. Poniżej pułapki spotykane najczęściej w projektach prognostycznych.
- Mylenie sprzedaży z popytem. Dane sprzedażowe mogą być ograniczone przez dostępność towaru. Okres braku na półce może zapisywać się jako niski popyt, a model uczy się fałszywego spadku. Bez korekty o stany magazynowe i dostępność prognozowanie popytu może zamienić się w prognozowanie ograniczeń podażowych.
- Nieoznaczone zdarzenia jednorazowe. Akcja promocyjna, listing u nowego detalisty, jednorazowe zamówienie hurtowe, zmiana opakowania – każde z tych zdarzeń zaburza szereg. Jeśli nie zostaną oznaczone jako regresory lub obserwacje odstające, model może rozprowadzić ich efekt na całą historię.
- Ocena modelu na danych treningowych. Jeden z najczęstszych błędów metodologicznych. Model z większą liczbą parametrów zwykle osiąga lepsze dopasowanie w próbie, na której był estymowany, co nie przesądza o jego jakości poza nią.
- Pominięcie modelu odniesienia. Bez porównania z prognozą naiwną nie da się powiedzieć, czy model coś wnosi. Informacja, że błąd wynosi kilka procent, sama w sobie nie mówi nic o jakości metody.
- Różnicowanie na wyczucie. W klasie ARIMA nadmierne różnicowanie podnosi wariancję prognozy i może pogarszać wyniki na dłuższym horyzoncie. Stopień integracji powinien wynikać z diagnostyki szeregu, a nie z przyzwyczajenia.
- Prognoza punktowa bez przedziału. Pojedyncza liczba sugeruje pewność, której nie ma. Przedział prognozy jest częścią wyniku, nie dodatkiem, i jego szerokość jest informacją o tym, na ile szereg jest przewidywalny.
- Brak odświeżania modelu. Struktura szeregu zmienia się wraz z rynkiem. Model estymowany raz i używany latami stopniowo traci trafność, a proces reestymacji powinien być zaplanowany od początku.
- Prognozowanie na złym poziomie agregacji. Szeregi pojedynczych SKU są zwykle bardziej zaszumione niż szeregi kategorii. Często stabilniejszy wynik daje prognoza na poziomie zagregowanym i rozłożenie jej na pozycje niższego poziomu w oparciu o udziały, niż niezależne modelowanie każdej pozycji osobno.
Warto też uczciwie nazwać ograniczenia obu rodzin metod. Wygładzanie wykładnicze i ARIMA to metody prognozowania oparte przede wszystkim na wewnętrznej strukturze szeregu, a warianty z regresorami zależą dodatkowo od dostępności wiarygodnych danych o zmiennych objaśniających. Nie przewidzą wejścia nowego konkurenta, zmiany regulacyjnej ani nagłej zmiany zachowań konsumenckich, jeśli informacje o tych zdarzeniach nie zostaną wprowadzone do modelu. Nie prognozują też produktów bez historii – tam podstawą są dane analogiczne, badania intencji zakupowych i modele testowania koncepcji, a prognozowanie szeregów czasowych wchodzi do gry dopiero po zebraniu pierwszych okresów sprzedaży.
Czym różnią się typowe przypadki użycia obu metod?
Poniżej zestawienie sytuacji, w których wybór jest zwykle jednoznaczny. Nie jest to reguła bezwyjątkowa, lecz punkt startowy do walidacji.
- Krótka historia, dane miesięczne lub kwartalne, jeden produkt. Wygładzanie wykładnicze w wariancie z trendem tłumionym. Rozbudowana ARIMA może być zbyt niestabilna do wiarygodnej estymacji.
- Kilka lat danych miesięcznych, wyraźny powtarzalny wzorzec roczny, brak zmiennych zewnętrznych. Holt-Winters lub ETS jako pierwszy wybór, SARIMA jako kandydat konkurencyjny. Rozstrzyga walidacja krocząca.
- Kilka lat danych tygodniowych, intensywna aktywność promocyjna. SARIMAX z regresorami opisującymi promocje i kalendarz. Klasyczne metody wygładzające nie wykorzystają tych informacji bez rozszerzenia o część regresyjną.
- Setki SKU, prognoza odświeżana co miesiąc, ograniczony zespół analityczny. Automatyczny ETS z kontrolą jakości i modelem naiwnym jako punktem odniesienia.
- Szereg z silną inercją, reakcją opóźnioną, zależnością od wcześniejszych odchyleń. Klasa ARIMA jako naturalny kandydat, bo opisuje taką strukturę.
- Popyt przerywany, wiele okresów zerowych. Metody dedykowane popytowi sporadycznemu, nie ETS i nie ARIMA.
W projektach Hume’s Institute obserwuje się, że najbardziej użyteczne prognozowanie popytu powstaje wtedy, gdy zamiast jednego „najlepszego” modelu testuje się kilku kandydatów na wspólnym schemacie walidacji, a wynikiem jest nie tylko liczba, ale też opis niepewności i lista czynników, których model nie obejmuje.
Najczęściej zadawane pytania
Jakie są metody prognozowania popytu?
Dzielą się na trzy grupy: metody ilościowe oparte na szeregach czasowych (modele naiwne, średnie ruchome, wygładzanie wykładnicze i rodzina ETS, ARIMA i SARIMA, modele dedykowane popytowi sporadycznemu), metody przyczynowo-skutkowe wiążące popyt ze zmiennymi objaśniającymi (regresja, ARIMAX, modele uczenia maszynowego) oraz metody jakościowe stosowane przy braku historii (badania intencji zakupowych, testy koncepcji, panele ekspertów, metoda delficka). W praktyce łączy się je: prognoza ilościowa stanowi bazę, a wiedza jakościowa koryguje ją o zdarzenia nieobecne w danych.
Czym różni się model ARIMA od wygładzania wykładniczego?
Wygładzanie wykładnicze buduje prognozę jako ważoną średnią przeszłych obserwacji z wagami malejącymi wykładniczo i jawnie modeluje składowe poziomu, trendu oraz powtarzalnego wzorca sezonowego. Model ARIMA opisuje szereg przez zależność od wartości opóźnionych, od przeszłych błędów prognozy oraz przez różnicowanie, które może usuwać niestacjonarność. Praktyczne konsekwencje: ARIMA może lepiej radzić sobie z autokorelacją, a jej warianty z regresorami przyjmują zmienne zewnętrzne. Wygładzanie wykładnicze jest natomiast często łatwiejsze do automatycznego stosowania na wielu szeregach.
Ile danych historycznych potrzeba do prognozy popytu?
Minimum zależy od tego, jakie składowe mają być modelowane, od częstotliwości danych i horyzontu prognozy. Dla prognozy poziomu i trendu na danych miesięcznych około dwóch lat obserwacji może być rozsądnym punktem startowym, ale krótsza historia również może wystarczyć w prostych przypadkach. Jeżeli szereg zawiera powtarzalny wzorzec roczny, potrzebne są co najmniej dwa-trzy pełne cykle, a dla stabilnej estymacji SARIMA na danych tygodniowych – wyraźnie więcej. Poza długością liczy się kompletność: luki, zmiany definicji pomiaru i nieoznaczone zdarzenia jednorazowe obniżają użyteczność historii bardziej niż jej długość.
Zapytaj o prognozę popytu dla Twojej kategorii
Jeśli potrzebna jest ocena, czy posiadane dane pozwalają na wiarygodną prognozę i która metoda będzie dla nich właściwa, Hume’s Institute przygotuje diagnostykę szeregu i porównanie modeli na walidacji zewnętrznej. Wystarczy kontakt z Instytutem Hume’a z krótkim opisem danych i horyzontu prognozy.