# SIL Hypoteser > "Vilka hypoteser försöker vi falsifiera?" --- ## H1: SIL minskar regressionsfel med minst 20% **Mätning:** - Baseline: Regressionsfrekvens utan SIL (vecka 1-2) - Med SIL: Regressionsfrekvens med SIL (vecka 3-8) - Jämför: (baseline - med_SIL) / baseline **Falsifiering:** - Om regressionsfrekvens INTE minskar med ≥20% → H1 falsifierad **Konsekvens:** - Om falsifierad: SIL:s impact-analysis är för svag. Förbättra graf eller regler. --- ## H2: SIL upptäcker fler arkitekturöverträdelser än traditionell code review **Mätning:** - Räkna överträdelser som hittades av code review men INTE av SIL - Räkna överträdelser som hittades av SIL men INTE av code review - Jämför antal **Falsifiering:** - Om code review hittar fler överträdelser än SIL → H2 falsifierad **Konsekvens:** - Om falsifierad: Arkitekturpolicyerna är för svaga eller för få. --- ## H3: SIL hittar fler beroenden än en senior utvecklare **Mätning:** - Jämför SIL:s förutsägelser med senior utvecklares manuell analys - Räkna true positives, false positives, false negatives **Falsifiering:** - Om senior utvecklare har högre recall än SIL → H3 falsifierad **Konsekvens:** - Om falsifierad: Grafen saknar relationer eller fil-mappning är felaktig. --- ## H4: Confidence korrelerar med faktisk korrekthet **Mätning:** - Bin confidence i intervall (0.5-0.6, 0.6-0.7, etc.) - För varje bin: beräkna faktisk accuracy - Jämför: |förväntad_confidence - faktisk_accuracy| < 10% **Falsifiering:** - Om kalibreringsfelet > 10% i flera bin → H4 falsifierad **Konsekvens:** - Om falsifierad: Confidence-modellen är felkalibrerad. Justera algoritm. --- ## H5: UNKNOWN används när systemet faktiskt saknar tillräcklig evidens **Mätning:** - När SIL säger UNKNOWN: verifiera om det verkligen saknades evidens - När SIL säger CERTAIN men har fel: hade det saknats evidens? **Falsifiering:** - Om UNKNOWN används när det fanns tillräcklig evidens → H5 falsifierad - Om CERTAIN används när evidens saknades → H5 falsifierad **Konsekvens:** - Om falsifierad: Osäkerhetsmodellen är för konservativ eller för aggressiv. --- ## Experimentdesign ### Vecka 1-2: Baseline - Kör utan SIL (eller med SIL i skuggläge utan att visa resultat) - Samla data för H1, H2, H3 ### Vecka 3-6: Med SIL - Aktivera SIL för utvecklare (opt-in) - Samla samma data - Jämför ### Vecka 7-8: Analys - Beräkna alla hypoteser - Klassificera fel (Failure Review) - Kalibrera confidence ### Vecka 9: Beslut - Go/no-go för full aktivering - Prioritera förbättringar baserat på falsifierade hypoteser --- *"Det är en stor mental skillnad att fråga 'Vilka hypoteser försöker vi falsifiera?' istället för 'Vad kan vi bygga mer?'"*