Vad vi läser i cyberresiliensförordningen — och vad vi upptäcker om hur maskingenererat arbete utvärderas. Daterat, källbelagt och skriftligt korrigerat när vi har fel.
Att hitta har blivit billigt; resten av livscykeln inte. En genomgång steg för steg (identifiera, bedöma, besluta, åtgärda, rapportera, bevara) med det som EU:s Cyber Resilience Act kräver i varje steg, och platsen där en oberoende adversariell granskning sitter: i stegen efter det första.
TypeSafe AI:s Jev är en ny sorts modell: den skriver aldrig text, den returnerar bara typade beslut med sannolikheter. Dess riktmärke bedömer den mot genomsnittet av två andra AI-modeller. Vi öppnade de fall TypeSafe publicerar och räknade. I 8 av de 19 fall där båda bedömarna svarade var bedömarna oense med varandra. Vart och ett av de fyra fall TypeSafe publicerar under etiketten ”alla tre missar referensen” är ett fall där referensen själv var omtvistad. En anteckning på klarspråk om vad det betyder för hur vi bedömer AI.
Två förregistrerade, blindbedömda jämförelser mellan vår fulla granskningsapparat och en enda billig genomgång, med publicerade professionella revisioner som facit. Apparaten förlorade ett mål rakt av; på det andra utlöste den sin egen precisionströskel bara genom att radera de fynd revisorn hade bedömt som verkliga (0–1 av 4, beroende på bedömare). Vad vi ändrade, vad vi mätte om, och hålen som en senare revision fann i själva mätningen.
Uttrycket täcker numera fyra praktiker, från kritikerprompten till huset av människor med angriparblick. Var och en ger angriparens frågeställning; ingen ger på egen hand en undertecknad akt från granskare som är oberoende av er kods författare, graderad efter den bevisnivå varje fynd nådde. Vad vi levererar, vad en andra modell inte kan, och vad vi säger er före köpet.
AI kan numera generera tusentals sårbarhetsfynd på en eftermiddag. Ett fynd är ett vittne, inte en dom — och det enda fält ingen kan kontrollera är det alla blåser upp. Så läser man floden utan att drunkna i den.
Tre oberoende studier, tre olika metoder — en riktad sårbarhetsstudie, en kontrollerad jämförelse människa–modell och ett års observation av verkliga kodförråd — konvergerar mot samma fynd: AI-genererad kod bär en mätbar kvalitetskostnad som överlever produktivitetsvinsten den kom med.
AI har fått kostnaden för att hitta sårbarheter att kollapsa. I Bitcoins open source-ekosystem anlände den kollisionen denna månad — och Bryssel har satt en klocka på vad som händer härnäst.
Ett ändringsförslag skulle skjuta CRA:s standarder för sårbarhetshantering framåt. Artikel 14 rör sig inte — vilket lämnar tillverkare att dokumentera en skyldighet vars måttstock fortfarande håller på att skrivas.