05ed037fe8
- DNS: pilot.landvex.com -> 16.170.83.169 - TLS: Let's Encrypt certificate (expires 2026-09-30) - Nginx: reverse proxy with SSL termination - API: https://pilot.landvex.com/api/v1/missions - UI: https://pilot.landvex.com/ - Upload: POST /api/v1/missions/import (multipart/form-data) Verified: ✅ https://pilot.landvex.com/health ✅ https://pilot.landvex.com/version ✅ https://pilot.landvex.com/api/v1/missions (list) ✅ https://pilot.landvex.com/api/v1/missions/:id (get) ✅ POST /api/v1/missions/import (video upload) ✅ UI loads with title 'LandveX Intelligence Lab' Next: Pilot 001 — Break the system!
2.7 KiB
2.7 KiB
SIL Hypoteser
"Vilka hypoteser försöker vi falsifiera?"
H1: SIL minskar regressionsfel med minst 20%
Mätning:
- Baseline: Regressionsfrekvens utan SIL (vecka 1-2)
- Med SIL: Regressionsfrekvens med SIL (vecka 3-8)
- Jämför: (baseline - med_SIL) / baseline
Falsifiering:
- Om regressionsfrekvens INTE minskar med ≥20% → H1 falsifierad
Konsekvens:
- Om falsifierad: SIL:s impact-analysis är för svag. Förbättra graf eller regler.
H2: SIL upptäcker fler arkitekturöverträdelser än traditionell code review
Mätning:
- Räkna överträdelser som hittades av code review men INTE av SIL
- Räkna överträdelser som hittades av SIL men INTE av code review
- Jämför antal
Falsifiering:
- Om code review hittar fler överträdelser än SIL → H2 falsifierad
Konsekvens:
- Om falsifierad: Arkitekturpolicyerna är för svaga eller för få.
H3: SIL hittar fler beroenden än en senior utvecklare
Mätning:
- Jämför SIL:s förutsägelser med senior utvecklares manuell analys
- Räkna true positives, false positives, false negatives
Falsifiering:
- Om senior utvecklare har högre recall än SIL → H3 falsifierad
Konsekvens:
- Om falsifierad: Grafen saknar relationer eller fil-mappning är felaktig.
H4: Confidence korrelerar med faktisk korrekthet
Mätning:
- Bin confidence i intervall (0.5-0.6, 0.6-0.7, etc.)
- För varje bin: beräkna faktisk accuracy
- Jämför: |förväntad_confidence - faktisk_accuracy| < 10%
Falsifiering:
- Om kalibreringsfelet > 10% i flera bin → H4 falsifierad
Konsekvens:
- Om falsifierad: Confidence-modellen är felkalibrerad. Justera algoritm.
H5: UNKNOWN används när systemet faktiskt saknar tillräcklig evidens
Mätning:
- När SIL säger UNKNOWN: verifiera om det verkligen saknades evidens
- När SIL säger CERTAIN men har fel: hade det saknats evidens?
Falsifiering:
- Om UNKNOWN används när det fanns tillräcklig evidens → H5 falsifierad
- Om CERTAIN används när evidens saknades → H5 falsifierad
Konsekvens:
- Om falsifierad: Osäkerhetsmodellen är för konservativ eller för aggressiv.
Experimentdesign
Vecka 1-2: Baseline
- Kör utan SIL (eller med SIL i skuggläge utan att visa resultat)
- Samla data för H1, H2, H3
Vecka 3-6: Med SIL
- Aktivera SIL för utvecklare (opt-in)
- Samla samma data
- Jämför
Vecka 7-8: Analys
- Beräkna alla hypoteser
- Klassificera fel (Failure Review)
- Kalibrera confidence
Vecka 9: Beslut
- Go/no-go för full aktivering
- Prioritera förbättringar baserat på falsifierade hypoteser
"Det är en stor mental skillnad att fråga 'Vilka hypoteser försöker vi falsifiera?' istället för 'Vad kan vi bygga mer?'"