Błąd przeżywalności powstaje, gdy analizujemy wyłącznie obiekty, które przetrwały do końca badanego okresu, a pomijamy te, które wcześniej zniknęły. W inwestowaniu dotyczy to między innymi wycofanych z giełdy spółek, zamkniętych funduszy, historycznie usuniętych składników indeksu oraz strategii, których autorzy przestali publikować wyniki.
Skutek nie ogranicza się do zawyżonej średniej stopy zwrotu. Próba złożona wyłącznie z ocalałych może również pokazywać płytszy drawdown, niższą zmienność, wyższy wskaźnik Sharpe’a i pozornie większą stabilność parametrów. Backtest wygląda wtedy wiarygodnie, choć odpowiada na pytanie, którego inwestor w przeszłości nie mógł zadać: „co by było, gdybym wcześniej wybrał aktywa, o których dziś wiem, że przetrwały?”.
Prosty przykład
Załóżmy, że dzisiejszy indeks zawiera 100 spółek. Cofamy ich obecny skład o dziesięć lat i testujemy strategię. Problem polega na tym, że dziesięć lat temu inwestor nie znał przyszłych członków indeksu. Nie widzimy firm, które wypadły ze składu, zbankrutowały, zostały wycofane z obrotu albo utraciły znaczenie. Jednocześnie uwzględniamy firmy, które do indeksu weszły dopiero później.
Taki test wykorzystuje informację o przyszłym przetrwaniu i przyszłej kwalifikacji do indeksu. W praktyce łączy błąd przeżywalności z przeciekiem informacji. Poprawny test musi odtworzyć zbiór instrumentów dostępny w każdej historycznej dacie, a nie zastosować dzisiejszą listę do całej przeszłości.
Universe backtestu musi odpowiadać temu, co naprawdę było znane i możliwe do kupienia w chwili podejmowania decyzji.
Gdzie najczęściej ukrywa się survivorship bias?
- Akcje. Baza zawiera tylko obecnie notowane spółki albo nie dostarcza końcowych stóp zwrotu po delistingu.
- Indeksy. Test wykorzystuje aktualny skład indeksu zamiast historycznych dat wejścia i wyjścia poszczególnych firm.
- Fundusze. Porównanie obejmuje wyłącznie produkty działające dzisiaj, pomijając fundusze zamknięte lub połączone po słabych wynikach.
- Strategie i zarządzający. Ranking pokazuje systemy, które nadal publikują wyniki, lecz nie archiwizuje tych wyłączonych po stratach.
- Kryptowaluty i kontrakty. Zbiór powstaje z aktywów notowanych na obecnej giełdzie, bez tokenów wycofanych z obrotu albo wygasłych rynków.
- Dostawcy danych. Historia symbolu może zaczynać się dopiero po zmianie nazwy, fuzji lub migracji, a wcześniejszy instrument pozostaje poza próbą.
Nie każde zniknięcie oznacza stratę. Spółka może opuścić giełdę po korzystnym przejęciu, a fundusz może zostać połączony z powodów operacyjnych. Problemem jest systematyczne odrzucenie całej grupy, której wynik różni się od wyniku ocalałych. Kierunku i skali zniekształcenia nie wolno zakładać — trzeba je zmierzyć.
Co pokazują badania?
Stephen Brown, William Goetzmann, Roger Ibbotson i Stephen Ross wykazali, że selekcja próby przez przetrwanie może tworzyć pozorną zależność pomiędzy zmiennością i wynikiem oraz prowadzić do wrażenia przewidywalności rezultatów. Oznacza to, że survivor bias może zmienić nie tylko poziom wyniku, lecz także wniosek o tym, jakie cechy strategii rzekomo działają.
Edwin Elton, Martin Gruber i Christopher Blake zbadali ten problem na danych funduszy inwestycyjnych. Ich praca pokazuje, dlaczego do oceny historycznej potrzebne są zarówno aktywne, jak i nieaktywne fundusze. Właśnie z tego powodu bazy badawcze typu CRSP przechowują historię produktów, które przestały istnieć, zamiast usuwać je wraz z zamknięciem.
Nie istnieje jedna uniwersalna korekta procentowa. Wielkość błędu zależy od rynku, epoki, długości testu, reguł wyboru i jakości danych. Dodanie stałego „rabatu” do wyniku nie naprawia wadliwej próby.
Błąd przeżywalności a inne błędy testu
Pojęcia często występują razem, lecz nie są tożsame:
- Survivorship bias usuwa z obserwacji podmioty, które nie dotrwały do końca próby.
- Look-ahead bias wykorzystuje informację, która w chwili decyzji nie była jeszcze dostępna.
- Selection bias wynika z reguły doboru próby, która nie reprezentuje populacji potrzebnej do odpowiedzi na pytanie badawcze.
Test oparty na dzisiejszym składzie indeksu może zawierać wszystkie trzy problemy. Wybiera obecnych członków, pomija usuniętych i używa przyszłej wiedzy o tym, kto znajdzie się w indeksie.
Jak zbudować dane point-in-time?
Podstawą jest zasada point-in-time: dla każdej daty system powinien odtworzyć dokładnie taki stan informacji, jaki był wtedy dostępny. W praktyce potrzebne są:
- stałe identyfikatory instrumentów, niezależne od zmian tickerów i nazw,
- daty rozpoczęcia i zakończenia notowań oraz przyczyna zakończenia,
- historyczne członkostwo w indeksach z datami wejścia i wyjścia,
- ceny, dywidendy, splity i zwroty związane z delistingiem,
- historia zamkniętych i połączonych funduszy,
- znacznik czasu publikacji danych fundamentalnych i rewizji,
- jasna reguła postępowania z brakującą końcową wyceną.
Sam plik cenowy nie wystarcza. Potrzebna jest tabela instrumentów i osobna historia ich statusu. Wtedy silnik backtestu może zapytać nie „jakie spółki istnieją dziś?”, lecz „jakie instrumenty spełniały kryteria dokładnie w dniu decyzji?”.
Test kontrolny: dwie wersje universe
Praktycznym audytem jest uruchomienie tego samego modelu na dwóch zbiorach. Pierwszy wykorzystuje aktualnie żyjące instrumenty. Drugi — pełne historyczne universe point-in-time. Następnie porównujemy roczną stopę zwrotu, drawdown, Sharpe’a, liczbę pozycji, obrót oraz koncentrację wyniku.
Duża różnica nie musi automatycznie unieważniać całej hipotezy. Pokazuje jednak, że część historycznej przewagi pochodziła z konstrukcji danych, a nie z reguły inwestycyjnej. Taką różnicę należy traktować jak błąd modelu, nie jak konserwatywny margines.
Lista kontrolna przed zaakceptowaniem backtestu
- Czy baza zawiera instrumenty nieaktywne i usunięte?
- Czy universe jest rekonstruowane osobno dla każdej daty?
- Czy zmiany tickerów, fuzje i delistingi zachowują ciągłość identyfikatora?
- Czy końcowe zwroty i wypłaty po delistingu są uwzględnione?
- Czy wyniki funduszy obejmują produkty zamknięte i połączone?
- Czy test używa dat faktycznej dostępności informacji, a nie ich późniejszej wersji?
- Czy dokumentacja dostawcy danych wyjaśnia zasady usuwania i korygowania rekordów?
Najważniejsze wnioski
Błąd przeżywalności jest problemem danych, który potrafi wyglądać jak przewaga inwestycyjna. Nie naprawi go bardziej złożony model ani dodatkowa optymalizacja. Najpierw trzeba odtworzyć pełną historyczną populację i stan wiedzy dostępny w każdej dacie.
Wiarygodny backtest nie wybiera zwycięzców z perspektywy końca próby. Uwzględnia również tych, którzy wypadli z rynku, i pozwala strategii podejmować decyzje wyłącznie na podstawie ówczesnych informacji. Dopiero taki test może być podstawą dalszej walidacji poza próbą i kontrolowanego wdrożenia.
Źródła
- Stephen J. Brown, William N. Goetzmann, Roger G. Ibbotson, Stephen A. Ross, Survivorship Bias in Performance Studies, 1992 — wpływ selekcji przez przetrwanie na ocenę wyników i pozorną przewidywalność.
- Edwin J. Elton, Martin J. Gruber, Christopher R. Blake, Survivorship Bias and Mutual Fund Performance, 1996 — analiza nieaktywnych funduszy i zniekształcenia oceny wyników.
- Center for Research in Security Prices, CRSP Survivor-Bias-Free US Mutual Fund Database Guide — struktura bazy zachowującej historię aktywnych i nieaktywnych funduszy.
