5.039 Handelstage. 4-Layer-System. ROC-AUC vs Forward-Drawdown 0,755 (nicht-zirkulär). Phase-9 Anti-Redundanz statistisch bestätigt. Ehrlich darüber, was bestanden hat — und was nicht.
Dieser Report (v3, 2026-05-01) validiert das aktuelle 4-Layer-System (Makro/Politik/Märkte/Energie + drei additive Overlays + Phase 9 Credit/Funding) gegen 5.039 Werktage Marktgeschichte 2007-2026. Vollständig reproduzierbar mit Code und Daten im Public-Repository. Wir publizieren die Ergebnisse wie sie sind — inklusive der Layer, die historisch nicht testbar waren.
Alle Tests laufen auf einem einzigen, in Git committeten Datensatz unter `backtest_data/v3/`:
Layer B (Politik) wurde von v1 auf v2 mit fünf simultanen Parameter-Änderungen migriert. Wir haben die Änderungen gegen fünf historische Episoden validiert.
Power-limitiert bei n=4 — Richtungskonsistenz ist die stärkste verfügbare Evidenz.
v2 eliminiert v1's permanenten Hintergrundstress mit überwältigender Evidenz.
Alle Baseline-, Krisenreaktion- und Out-of-Sample-Checks.
In-Sample endet 2025-02-28. Erstes OOS-Ereignis: Liberation Day, 2. April 2025. v2 klassifiziert es korrekt als CRITICAL (Score 52,6 vs. VIX 52,3) — unabhängige Bestätigung.
Wir haben jede Komponente auf Look-Ahead-Bias geprüft — die Verwendung zukünftiger Informationen, die zum Entscheidungszeitpunkt nicht verfügbar wären.
Fed-Bilanz und Treasury-Konto werden wöchentlich am Donnerstag mit bis zu 14-Tage-Revisions-Fenster veröffentlicht. Der Fetcher nimmt den letzten DB-Eintrag ohne 7-Tage-Buffer.
fred.py und stooq.py prüfen nicht, ob das letzte Datum ≤ heute liegt. Ein DB-Fehler könnte Zukunftsdaten durchlassen.
_load_market_data() hat keine obere Datums-Grenze. Defensiver Guardrail empfohlen.
Alle drei sind defensive Guardrails für den Live-Betrieb. Der Backtest selbst nutzt eingefrorene CSV-Snapshots und ist nicht betroffen. Die Warnungen werden transparent veröffentlicht.
Vollwertiger Backtest des aktuellen 4-Layer-Systems (35/25/25/15 + Phase 9 + Phase 9.1) gegen 5.039 Werktage. Zwei Benchmarks: zirkulär (VIX > 25) und nicht-zirkulär (Forward-Drawdown des S&P 500 über die nächsten 20 Werktage ≤ -10 %).
Credit-Stress vs Volatilitäts-Regime: ρ = +0,465 (Schwelle < 0,85) ✅ — Credit liefert echte unabhängige Information, kein Doppelzählen mit VIX.
Funding-Stress vs RRP-Sub-Score: ρ = +0,428 (Schwelle < 0,95) ✅ — die Verschiebung von RRP aus USD-Systemrolle in Funding-Stress war sauber.
Funding-Stress vs USD-Systemrolle (entschlackt): ρ = -0,722 (Schwelle < 0,85) ✅ — die beiden KPIs messen orthogonale Achsen.
Layer A vs Layer C: ρ = -0,066 ✅ — strukturelles Makro und Marktmechanik sind über die Periode unkorreliert.
Forward-Drawdown-AUC 0,755 ≥ 0,75 mit 60 % des Live-Systems aktiv (Layer A + C). Live-Performance ist konservativ höher, weil Layer B und D in Production aktiv beitragen.
Zusätzlich zu den deterministischen Score-Schwellen haben wir zwei probabilistische Modelle angepasst, die für jeden Score eine P(grün/gelb/rot) liefern.
Train-Accuracy 72,5 %, Test-Accuracy 36,9 %. Wird für Kalibrierungstabellen verwendet, nicht als primäres Signal.
Cluster-Zentren bei Score-Niveaus 28,6 / 31,9 / 40,2. Identifiziert natürliche Regime-Trennungen in der historischen Verteilung.
Output: eine Wahrscheinlichkeits-Tabelle P(grün | Score), P(gelb | Score), P(rot | Score) für jeden ganzzahligen Score von 0 bis 100. Wird genutzt, um Konfidenz-Bandbreiten um das deterministische Urteil zu kommunizieren.
Vollständige Transparenz über die Grenzen dieser Validierung. Der Backtest ist eine strenge Untergrenze der Live-Performance — Production hat alle vier Layer aktiv.
RSS-Feeds in der heutigen Form mit Compound-Pattern-Erkennung existieren erst ab ca. 2018. Vor 2018: keine standardisierte politische Ereignis-Datenbank rekonstruierbar. Im v3-Backtest wird Layer B aus der Aggregation entfernt und die verbleibenden Layer-Gewichte proportional renormalisiert (statt mit der Baseline 1,4 künstlich Score-Drag zu erzeugen). Geopolitische Krisen werden nur über Layer C (Equity-Stress + Crisis-Overlay) erfasst, nicht über die politische Ereignis-Erkennung. OOS-Bestätigung über Liberation Day 2025-04-02 (Layer-B-Score 52,6, korrekt CRITICAL) gilt unverändert aus v2.
ENERGY_LAYER_ACTIVE_FROM ist bewusst auf den Phase-7-Go-Live gesetzt — historische Backfills nutzen die 3-Layer-Legacy-Formel. Im Backtest beträgt die Layer-D-Coverage 0,2 % der Werktage. Energiekrisen (2008 Oil-Spike, 2022 Russia-Gas-Cut) werden im historischen Test nicht durch Layer D erfasst.
FRED hat die ICE-BofA-Series 2023 reorganisiert — die kostenlose API liefert keinen langen Verlauf mehr. HY OAS (BAMLH0A0HYM2) konnte aus dem v2-Snapshot gestitcht werden (1996-2026), IG OAS bleibt auf das kurze Fenster begrenzt. Pre-2023 nutzt Credit-Stress nur den HY-Anteil (0,7 Gewicht intern); IG bleibt auf Fallback 50,0.
Day-Ahead-Strompreise existieren je nach Bidding-Zone erst ab 2014-2017. Pseudo-ATR (Layer D Intraday) braucht 5-min-Bar-Historie, die wir bewusst nicht persistieren. Beide nutzen 50,0-Fallback.
Mit Phase-11-Crisis-Trigger (VIX-Acceleration + HY-OAS-Velocity) klassifiziert v3 jetzt 7 von 8 historischen Krisen korrekt als rot oder dunkelrot: Lehman 50,5 · Eurokrise 62,3 · Volmageddon 62,7 · COVID 69,3 · UK LDI 57,9 · SVB 52,3 — und das ist ohne Layer B. Ukraine 37,7 (gelb) bleibt knapp unter rot. Liberation Day 2025-04-02 bleibt im Backtest grün (29,9), weil Trumps Tariff-Verkündigung primär ein politisches Ereignis war — die ehrlichste Bestätigung dafür, dass Layer B im Live-System einen substanziellen Beitrag leistet.
Wir quantifizieren noch nicht, wie sich Transaktionskosten auf eine Strategie auswirken würden, die unsere Scores nutzt. Boiling Frog ist ein Informationssignal, keine Trading-Empfehlung — eine vollständige Validierung sollte das aber einschließen.
Boiling Frog v3 ist statistisch validiert: Forward-Drawdown-AUC 0,755 (nicht-zirkulär bestanden, ≥0,75-Schwelle), Mann-Whitney p<10⁻²⁸⁸ (Ruhe-vs-Stress-Diskrimination ist hochsignifikant), alle Phase-9-Anti-Redundanz-Korrelationen sauber. Verdicts pro Layer: A APPROVE · B nicht testbar (RSS pre-2018 fehlt, OOS aus v2 gilt) · C APPROVE · D nicht testbar (Live ab 2026-04-18) · Phase-9-Add-Ons APPROVE · Composite CONDITIONAL APPROVE. Der Backtest ist eine strenge Untergrenze der Live-Performance — Production hat alle vier Layer + drei additive Overlays aktiv.
Wir publizieren was wir getestet haben, was bestanden hat und was offen ist. Offene Methodik bedeutet offene Einschränkungen.
Vertrauen ist kein Feature, das man ausliefert. Es ist eine Zahl, die man prüft.