Files
boc/SIL/HYPOTHESES.md
T
Bernt 05ed037fe8 pilot.landvex.com: HTTPS + Full Stack Verified
- DNS: pilot.landvex.com -> 16.170.83.169
- TLS: Let's Encrypt certificate (expires 2026-09-30)
- Nginx: reverse proxy with SSL termination
- API: https://pilot.landvex.com/api/v1/missions
- UI: https://pilot.landvex.com/
- Upload: POST /api/v1/missions/import (multipart/form-data)

Verified:
 https://pilot.landvex.com/health
 https://pilot.landvex.com/version
 https://pilot.landvex.com/api/v1/missions (list)
 https://pilot.landvex.com/api/v1/missions/:id (get)
 POST /api/v1/missions/import (video upload)
 UI loads with title 'LandveX Intelligence Lab'

Next: Pilot 001 — Break the system!
2026-07-02 17:34:19 +00:00

104 lines
2.7 KiB
Markdown

# SIL Hypoteser
> "Vilka hypoteser försöker vi falsifiera?"
---
## H1: SIL minskar regressionsfel med minst 20%
**Mätning:**
- Baseline: Regressionsfrekvens utan SIL (vecka 1-2)
- Med SIL: Regressionsfrekvens med SIL (vecka 3-8)
- Jämför: (baseline - med_SIL) / baseline
**Falsifiering:**
- Om regressionsfrekvens INTE minskar med ≥20% → H1 falsifierad
**Konsekvens:**
- Om falsifierad: SIL:s impact-analysis är för svag. Förbättra graf eller regler.
---
## H2: SIL upptäcker fler arkitekturöverträdelser än traditionell code review
**Mätning:**
- Räkna överträdelser som hittades av code review men INTE av SIL
- Räkna överträdelser som hittades av SIL men INTE av code review
- Jämför antal
**Falsifiering:**
- Om code review hittar fler överträdelser än SIL → H2 falsifierad
**Konsekvens:**
- Om falsifierad: Arkitekturpolicyerna är för svaga eller för få.
---
## H3: SIL hittar fler beroenden än en senior utvecklare
**Mätning:**
- Jämför SIL:s förutsägelser med senior utvecklares manuell analys
- Räkna true positives, false positives, false negatives
**Falsifiering:**
- Om senior utvecklare har högre recall än SIL → H3 falsifierad
**Konsekvens:**
- Om falsifierad: Grafen saknar relationer eller fil-mappning är felaktig.
---
## H4: Confidence korrelerar med faktisk korrekthet
**Mätning:**
- Bin confidence i intervall (0.5-0.6, 0.6-0.7, etc.)
- För varje bin: beräkna faktisk accuracy
- Jämför: |förväntad_confidence - faktisk_accuracy| < 10%
**Falsifiering:**
- Om kalibreringsfelet > 10% i flera bin → H4 falsifierad
**Konsekvens:**
- Om falsifierad: Confidence-modellen är felkalibrerad. Justera algoritm.
---
## H5: UNKNOWN används när systemet faktiskt saknar tillräcklig evidens
**Mätning:**
- När SIL säger UNKNOWN: verifiera om det verkligen saknades evidens
- När SIL säger CERTAIN men har fel: hade det saknats evidens?
**Falsifiering:**
- Om UNKNOWN används när det fanns tillräcklig evidens → H5 falsifierad
- Om CERTAIN används när evidens saknades → H5 falsifierad
**Konsekvens:**
- Om falsifierad: Osäkerhetsmodellen är för konservativ eller för aggressiv.
---
## Experimentdesign
### Vecka 1-2: Baseline
- Kör utan SIL (eller med SIL i skuggläge utan att visa resultat)
- Samla data för H1, H2, H3
### Vecka 3-6: Med SIL
- Aktivera SIL för utvecklare (opt-in)
- Samla samma data
- Jämför
### Vecka 7-8: Analys
- Beräkna alla hypoteser
- Klassificera fel (Failure Review)
- Kalibrera confidence
### Vecka 9: Beslut
- Go/no-go för full aktivering
- Prioritera förbättringar baserat på falsifierade hypoteser
---
*"Det är en stor mental skillnad att fråga 'Vilka hypoteser försöker vi falsifiera?' istället för 'Vad kan vi bygga mer?'"*