Błąd przeżywalności powstaje, gdy analizujemy wyłącznie obiekty, które przetrwały do końca badanego okresu, a pomijamy te, które wcześniej zniknęły. W inwestowaniu dotyczy to między innymi wycofanych z giełdy spółek, zamkniętych funduszy, historycznie usuniętych składników indeksu oraz strategii, których autorzy przestali publikować wyniki.

Skutek nie ogranicza się do zawyżonej średniej stopy zwrotu. Próba złożona wyłącznie z ocalałych może również pokazywać płytszy drawdown, niższą zmienność, wyższy wskaźnik Sharpe’a i pozornie większą stabilność parametrów. Backtest wygląda wtedy wiarygodnie, choć odpowiada na pytanie, którego inwestor w przeszłości nie mógł zadać: „co by było, gdybym wcześniej wybrał aktywa, o których dziś wiem, że przetrwały?”.

Prosty przykład

Załóżmy, że dzisiejszy indeks zawiera 100 spółek. Cofamy ich obecny skład o dziesięć lat i testujemy strategię. Problem polega na tym, że dziesięć lat temu inwestor nie znał przyszłych członków indeksu. Nie widzimy firm, które wypadły ze składu, zbankrutowały, zostały wycofane z obrotu albo utraciły znaczenie. Jednocześnie uwzględniamy firmy, które do indeksu weszły dopiero później.

Taki test wykorzystuje informację o przyszłym przetrwaniu i przyszłej kwalifikacji do indeksu. W praktyce łączy błąd przeżywalności z przeciekiem informacji. Poprawny test musi odtworzyć zbiór instrumentów dostępny w każdej historycznej dacie, a nie zastosować dzisiejszą listę do całej przeszłości.

Universe backtestu musi odpowiadać temu, co naprawdę było znane i możliwe do kupienia w chwili podejmowania decyzji.

Gdzie najczęściej ukrywa się survivorship bias?

  • Akcje. Baza zawiera tylko obecnie notowane spółki albo nie dostarcza końcowych stóp zwrotu po delistingu.
  • Indeksy. Test wykorzystuje aktualny skład indeksu zamiast historycznych dat wejścia i wyjścia poszczególnych firm.
  • Fundusze. Porównanie obejmuje wyłącznie produkty działające dzisiaj, pomijając fundusze zamknięte lub połączone po słabych wynikach.
  • Strategie i zarządzający. Ranking pokazuje systemy, które nadal publikują wyniki, lecz nie archiwizuje tych wyłączonych po stratach.
  • Kryptowaluty i kontrakty. Zbiór powstaje z aktywów notowanych na obecnej giełdzie, bez tokenów wycofanych z obrotu albo wygasłych rynków.
  • Dostawcy danych. Historia symbolu może zaczynać się dopiero po zmianie nazwy, fuzji lub migracji, a wcześniejszy instrument pozostaje poza próbą.

Nie każde zniknięcie oznacza stratę. Spółka może opuścić giełdę po korzystnym przejęciu, a fundusz może zostać połączony z powodów operacyjnych. Problemem jest systematyczne odrzucenie całej grupy, której wynik różni się od wyniku ocalałych. Kierunku i skali zniekształcenia nie wolno zakładać — trzeba je zmierzyć.

Co pokazują badania?

Stephen Brown, William Goetzmann, Roger Ibbotson i Stephen Ross wykazali, że selekcja próby przez przetrwanie może tworzyć pozorną zależność pomiędzy zmiennością i wynikiem oraz prowadzić do wrażenia przewidywalności rezultatów. Oznacza to, że survivor bias może zmienić nie tylko poziom wyniku, lecz także wniosek o tym, jakie cechy strategii rzekomo działają.

Edwin Elton, Martin Gruber i Christopher Blake zbadali ten problem na danych funduszy inwestycyjnych. Ich praca pokazuje, dlaczego do oceny historycznej potrzebne są zarówno aktywne, jak i nieaktywne fundusze. Właśnie z tego powodu bazy badawcze typu CRSP przechowują historię produktów, które przestały istnieć, zamiast usuwać je wraz z zamknięciem.

Nie istnieje jedna uniwersalna korekta procentowa. Wielkość błędu zależy od rynku, epoki, długości testu, reguł wyboru i jakości danych. Dodanie stałego „rabatu” do wyniku nie naprawia wadliwej próby.

Błąd przeżywalności a inne błędy testu

Pojęcia często występują razem, lecz nie są tożsame:

  1. Survivorship bias usuwa z obserwacji podmioty, które nie dotrwały do końca próby.
  2. Look-ahead bias wykorzystuje informację, która w chwili decyzji nie była jeszcze dostępna.
  3. Selection bias wynika z reguły doboru próby, która nie reprezentuje populacji potrzebnej do odpowiedzi na pytanie badawcze.

Test oparty na dzisiejszym składzie indeksu może zawierać wszystkie trzy problemy. Wybiera obecnych członków, pomija usuniętych i używa przyszłej wiedzy o tym, kto znajdzie się w indeksie.

Jak zbudować dane point-in-time?

Podstawą jest zasada point-in-time: dla każdej daty system powinien odtworzyć dokładnie taki stan informacji, jaki był wtedy dostępny. W praktyce potrzebne są:

  • stałe identyfikatory instrumentów, niezależne od zmian tickerów i nazw,
  • daty rozpoczęcia i zakończenia notowań oraz przyczyna zakończenia,
  • historyczne członkostwo w indeksach z datami wejścia i wyjścia,
  • ceny, dywidendy, splity i zwroty związane z delistingiem,
  • historia zamkniętych i połączonych funduszy,
  • znacznik czasu publikacji danych fundamentalnych i rewizji,
  • jasna reguła postępowania z brakującą końcową wyceną.

Sam plik cenowy nie wystarcza. Potrzebna jest tabela instrumentów i osobna historia ich statusu. Wtedy silnik backtestu może zapytać nie „jakie spółki istnieją dziś?”, lecz „jakie instrumenty spełniały kryteria dokładnie w dniu decyzji?”.

Test kontrolny: dwie wersje universe

Praktycznym audytem jest uruchomienie tego samego modelu na dwóch zbiorach. Pierwszy wykorzystuje aktualnie żyjące instrumenty. Drugi — pełne historyczne universe point-in-time. Następnie porównujemy roczną stopę zwrotu, drawdown, Sharpe’a, liczbę pozycji, obrót oraz koncentrację wyniku.

Duża różnica nie musi automatycznie unieważniać całej hipotezy. Pokazuje jednak, że część historycznej przewagi pochodziła z konstrukcji danych, a nie z reguły inwestycyjnej. Taką różnicę należy traktować jak błąd modelu, nie jak konserwatywny margines.

Lista kontrolna przed zaakceptowaniem backtestu

  1. Czy baza zawiera instrumenty nieaktywne i usunięte?
  2. Czy universe jest rekonstruowane osobno dla każdej daty?
  3. Czy zmiany tickerów, fuzje i delistingi zachowują ciągłość identyfikatora?
  4. Czy końcowe zwroty i wypłaty po delistingu są uwzględnione?
  5. Czy wyniki funduszy obejmują produkty zamknięte i połączone?
  6. Czy test używa dat faktycznej dostępności informacji, a nie ich późniejszej wersji?
  7. Czy dokumentacja dostawcy danych wyjaśnia zasady usuwania i korygowania rekordów?

Najważniejsze wnioski

Błąd przeżywalności jest problemem danych, który potrafi wyglądać jak przewaga inwestycyjna. Nie naprawi go bardziej złożony model ani dodatkowa optymalizacja. Najpierw trzeba odtworzyć pełną historyczną populację i stan wiedzy dostępny w każdej dacie.

Wiarygodny backtest nie wybiera zwycięzców z perspektywy końca próby. Uwzględnia również tych, którzy wypadli z rynku, i pozwala strategii podejmować decyzje wyłącznie na podstawie ówczesnych informacji. Dopiero taki test może być podstawą dalszej walidacji poza próbą i kontrolowanego wdrożenia.

Źródła

Zastrzeżenie edukacyjne: materiał ma charakter wyłącznie edukacyjny i informacyjny. Nie stanowi rekomendacji inwestycyjnej, porady finansowej ani oferty nabycia lub sprzedaży instrumentów finansowych. Wyniki historyczne, także po korekcie błędu przeżywalności, nie gwarantują przyszłych rezultatów.