CounterProof

Maskinerna läser koden

AI har fått kostnaden för att hitta sårbarheter att kollapsa. I Bitcoins open source-ekosystem anlände den kollisionen denna månad — och Bryssel har satt en klocka på vad som händer härnäst.

Under andra veckan i augusti 2026 postade en pseudonym Bitcoin-utvecklare känd som Calle en mening som rikoschetterade genom branschen: ”Everything is broken, Bitcoin is burning” — allt är trasigt, Bitcoin brinner. Bakom hyperbolen låg ett dataset. Det ideella Bitcoin Red Team hade just kört Moonshot AI:s Kimi K3 — en kinesisk frontier-modell med öppna vikter, släppt bara två veckor tidigare — genom praktiskt taget hela Bitcoins open source-ekosystem: plånböcker, Lightning-applikationer, betalningsbibliotek och verktygen omkring dem. Efter ungefär 108 timmar — förfluten kampanjtid, arbetad av ett team som vuxit till tjugofem — över 501 projekt hade teamet loggat 7 958 potentiella säkerhetsfynd, varav 1 280 klassade som höga eller kritiska.

Den enda kampanjen komprimerar allt denna artikel handlar om: vad AI-modeller numera kan göra med en kodbas, vem som riktar dem mot Bitcoin, vad de hittar — och varför en europeisk förordning som börjar bita den 11 september 2026 förvandlar alltihop från en ingenjörshistoria till en juridisk.

Angriparna var där först

Innan försvararna industrialiserade gjorde angriparna det. Den open source-leveranskedja som Bitcoin och den bredare digitala tillgångsbranschen är beroende av har i åratal stått under ihållande, ekonomiskt motiverade angrepp — och kryptoekosystemet har genomgående varit det avsedda offret.

I september 2025 nätfiskade angripare underhållaren av chalk, debug och sexton andra npm-verktyg — paket med miljarder veckonedladdningar tillsammans — och skeppade en krypto-clipper som hakade i webbläsar-API:er och tyst bytte ut mottagaradresser i exakt det ögonblick en plånboksanvändare godkände en transaktion, och till och med valde angriparadresser genom visuell likhet för att undgå upptäckt. Veckor senare lade masken Shai-Hulud till självspridning och förvandlade isolerade underhållarintrång till kedjereaktioner. I mars 2026 bakdörrades Axios-biblioteket — i storleksordningen hundra miljoner veckonedladdningar — i knappt tre timmar via ett kapat underhållarkonto, parallellt med TeamPCP-kampanjen som komprometterade fyra flitigt använda open source-projekt på en enda vecka. Och i juli 2026 smög angripare in en bakdörr förklädd till ”telemetri” i Injective-blockkedjans SDK och kopplade exfiltration av frö-fraser och privata nycklar direkt in i plånböckernas nyckelhärledningsfunktioner; automatiserad publicering spred den till arton paket på några minuter.

Färdriktningen är mätbar. Sonatypes rapport State of the Software Supply Chain 2026 räknade fler än 454 600 nya skadliga open source-paket bara under 2025 — ett språng på 75 % mot året innan, som driver dess ackumulerade blockeringstotal förbi 1,2 miljoner. Och verktygen på angreppssidan utvecklas också: Googles Threat Intelligence Group rapporterade 2026 att den för första gången identifierat en hotaktör som svingade en zero-day-exploit som gruppen bedömer utvecklats med AI, avsedd för en massutnyttjandehändelse.

Open source-förråd angrips just för att de är förtroendelagret. Ingen behöver forcera er infrastruktur om de kan förgifta ett beroende ni installerar frivilligt. Och ingenstans är den hävstången större än i programvara som rör nycklar och pengar.

ColdCard-debaclet

I slutet av juli blev den abstrakta risken livsavgörande. Från den 30 juli 2026 började en angripare tömma det som skulle vara Bitcoins säkraste gömställe: kall förvaring. I på varandra följande vågor — den största svepte 1 082 BTC från 1 196 plånböcker på bara 41 minuter, enligt Galaxy Researchs räkning — nådde förlusten 1 367 BTC — cirka 88,6 miljoner dollar — över 4 585 adresser genererade på Coinkites ColdCard-hårdvaruplånböcker, per Galaxys kontrollpunkt den 1 augusti. Senare räkningar sprang förbi 1 800 BTC och mot 130 miljoner dollar när en misstänkt fjärde våg vägdes in. (Rättat: en tidigare version av denna anteckning angav 116 miljoner dollar — hämtat ur cirkulerande rapportering och i efterhand omöjligt att spåra till någon källa som anger, daterar och definierar siffran. De större totalsummorna väger in en våg som ännu veckor senare beskrevs som obekräftad, och Galaxys eget förbehåll är värt att bära med sig — de matchade adresser efter mönster och använde inte beräkningskraft för att bevisa att dessa frön var svaga.) Enligt den publicerade mekanismen krävde inget av detta nätfiske, en stulen enhet eller fysisk åtkomst av något slag — nycklarna rekonstruerades offline. Dessa uteslutningar följer av hur felet fungerade; tillverkarens meddelanden gör inte anspråk på att ha utrett och uteslutit var och en. Tusentals långsiktiga innehavare som gjort allt som självförvaringens ortodoxi föreskriver — hårdvaruplånbok, nycklar offline, luftgap intakt — såg ett livs besparingar lämna adresser som bara de skulle kontrollera. Grundorsaken var förödande alldaglig: en byggflagga i firmware, skeppad i mars 2021, fick berörda enheter att hoppa över sitt dedikerade hårdvaruslumpchip och falla tillbaka på en svag mjukvaru-PRNG, vilket kollapsade den effektiva entropin — till så lite som ungefär 40 bitar på äldre Mk3-enheter — långt nog för att fröfraser skulle kunna rekonstrueras offline. Bitcoins matematik höll; programvaran runt den gjorde det inte. Coinkite skeppade nödfirmware, förstörde sårbart lager och bönföll användare att migrera — samtidigt som man medgav att ingen patch kan reparera ett frö som redan genererats på sårbar firmware.

Sedan kom berättelsekriget. Coinkites vd Rodolfo Novak inramade exploiten som ”a sober reality of the new AI paradigm” — en nykter verklighet i det nya AI-paradigmet: AI-assisterad kodgranskning lyfter numera fram latenta buggar snabbare än även de mest rutinerade mänskliga experterna, och all firmware som är eller någonsin varit offentlig bör antas stå under maskinell granskning av angripare och försvarare lika. Det påståendet är omtvistat, och ärlighet kräver att man säger det. Ingen angripare har identifierats. Inget bevis har dykt upp för att en modell hittade felet — Coinkites egen formulering är att man ”måste anta” (”we have to assume”) att någon använt AI på den publicerade firmwaren, och i samma dokument redovisar företaget att dess egen AI-granskning, körd veckor tidigare, ”inte hittade denna bugg eller något allvarligt” (”did not find this bug or anything serious”). En tidigare version av denna anteckning skrev också att säkerhetsspecialister protesterat skarpt — att en byggflagga som stänger av en hårdvaru-RNG är ett mänskligt ingenjörsmisslyckande som konventionell granskning borde ha fångat år tidigare. Det kunde vi inte belägga vid omkontroll: det enda inlägg vi spårat ligger på ett avstängt konto, och den närmaste namngivna kommentator vi hittade höll med Coinkite snarare än invände. Argumentet förefaller oss fortfarande riktigt — men det är nu vårt eget, inte ett tillskrivet. På sätt och vis är tvisten ändå en sidosak. Vare sig en AI hittade den här buggen eller inte vet ekosystemet nu att modeller bevisligen kan hitta buggar av exakt denna klass i exakt denna hastighet — och det reagerade som om hotet vore verkligt. Inom dagar pausade börsen Boltz sin verksamhet för att ligga före AI-drivna intrångsförsök. Och en ideell motstyrka samlades.

Red teamets uppgång i Bitcoin

Bitcoin Red Team formerades inom dagar efter ColdCard-tömningen: en ideell nödmotstyrka av sexton forskare ledda av Calle tillsammans med AnchorWatchs vd Rob Hamilton, uppbackad av ungefär 40 000 dollar i AI-beräkningskraft och stödd av OpenSats, vars nya bidragsprogram Code RED nu belönar ansvarsfull sårbarhetsrapportering över ekosystemet. Metoden parar AI-driven analys med mänsklig verifiering — modeller sveper plånböcker, Lightning-implementationer och bibliotek; forskare reproducerar och prövar; trovärdiga fynd går privat till underhållarna innan något publiceras.

Banan för dess siffror berättar vad AI gör med sårbarhetsupptäcktens ekonomi. Den första sprinten lämnade in 4 962 fynd över 390 projekt på 27,5 timmar — 85 kritiska och 635 höga, i genomsnitt, enligt Calles räkning vid starten, i storleksordningen en kritisk exploit per forskare och timme. Dagar senare stod det utökade svepet på 7 958 fynd över 501 projekt. Calles sammanfattning: grundskanningen av praktiskt taget hela Bitcoins open source-ekosystem är klar, och de lågt hängande frukterna är plockade.

Fynden kommer med en textur som betyder mer än totalsummorna. Sårbarheter koncentrerades i äldre och sparsamt granskade kodbaser. Lightning-relaterad programvara — strukturellt komplex, prestandakänslig och svår att granska — bar oproportionerlig exponering. Utbredningen av C-baserade implementationer flaggades som en bestående strukturell risk. Och hur snabbt ett projekt svarade på privat rapportering visade sig vara en diagnos i sig: svarshastighet, noterade teamet, är en synlig proxy för projekthälsa. Ounderhållna projekt, varnade de, bör inte litas på.

Kampanjen har redan gett verifierad verklig effekt. BTCPay Server — en av de mest spridda självhostade Bitcoin-betalningsprocessorerna — skeppade version 2.4.2 den 7 augusti med en rättning av en kritisk förbigång av tvåfaktorsautentisering, delvis krediterad Bitcoin Red Team-forskare, och bekräftade därefter att felet redan utnyttjats i det vilda för att komma åt Lightning-plånböckers inloggningsuppgifter. Det är hela tesen i en enda händelse: sårbarheten var verklig, den användes, och maskinassisterad granskning nådde den före de flesta människor.

Det är värt att säga rakt ut vad det krävde. Sexton volontärer, ungefär 40 000 dollar i beräkningskraft, några veckor — och en disciplin som de flesta finansierade säkerhetsprogram aldrig uppnår: privat rapportering först, publicering först när underhållarna fått fynden, och den egna reproduktionsandelen redovisad offentligt i stället för nedgrävd. De kartlade ett ekosystem som varit okartlagt i ett årtionde och gav bort resultaten. Vad som än följer i denna artikel är det referensstandarden för hur detta arbete bör bedrivas, och Bitcoin-ekosystemet är säkrare denna månad än förra — tack vare dem.

En begränsning i det arbetet förtjänar att sägas rent ut, eftersom den rutinmässigt felläses som ett metodval. Teamet rapporterade att användningsrestriktioner på amerikanska modeller för säkerhetsforskning upprepade gånger blockerade dem — och drev dem mot modeller med öppna vikter som Kimi K3 och Z.ais GLM 5.2 som kan köras lokalt utan policygrindvakter. Kimi K3 var ingen kompromiss; för det arbetet, i det ögonblicket, var den bland de bästa instrument de faktiskt fick använda.

Det är ett policymisslyckande, inte ett forskningsmisslyckande. Verktygsval i säkerhetsforskning formas numera mindre av modellkvalitet än av vem som över huvud taget tillåter arbetet — och ett team som sträcker sig efter den modell som faktiskt kör jobbet beter sig korrekt. Det borde ge västliga laboratorier en tankeställare: försvarsforskningen sker i vilket fall. Den enda frågan är på vems modeller — och om de som utför den tvingas in i en smalare verktygslåda än angriparna möter.

Vad 7 958 fynd faktiskt betyder

Här är ärlighet skyldig — och teamet var först att betala den. Av de 7 958 fynden hade 24,7 % ett reproducerbart proof of concept — teamets egen formulering — och 29,4 % hade rapporterats uppströms vid senaste räkningen, siffror teamet självt publicerade i stället för att runda bort. (En tidigare version av denna anteckning skrev ”dynamiskt reproducerade”; det var vår glosa, inte deras, och rapporteringsandelen avser fynd skickade till underhållare, inte fynd underhållare accepterat.) En gemensam bedömning av brittiska AI Security Institute och amerikanska CAISI fann Kimi K3 kapabel men långt ifrån ofelbar — 32 % på riktmärken för exploit-utveckling, före GLM-5.2 men klart efter de starkaste slutna modellerna, och utan att uppnå godtycklig kodexekvering på något av 41 testade prov.

Så detta är inte en lista över 7 958 utnyttjbara hål i Bitcoin, och ingen inblandad har påstått det. Calles egen inramning var rak: kandidater är billiga, och om ni inte klarar den informationsöverbelastning som följer, använd AI för att sortera den. Det är den rätta läsningen, och den pekar på det verkliga skiftet. AI har gjort kandidatgenerering nästan gratis. Vad den inte gjort gratis är omdömet som skiljer en bekräftad, reproducerbar, korrekt poängsatt sårbarhet från en plausibelt klingande hallucination — samma ”AI-slask”-problem som open source-underhållare från curl och framåt drunknat i.

Den knappa resursen i säkerhet har tyst flyttat från upptäckt till prövning. Det är en egenskap hos tekniken, inte en brist i någons kampanj — och ett svep som kartlägger ett helt ekosystem och en signerad bedömning av en enskild kodbas är helt enkelt olika yrken. Det första säger var man ska titta. Det andra är vad en tillsynsmyndighet, en förvärvare eller en försäkringsgivare faktiskt accepterar. Varje seriös aktör i detta fält — angripare, försvarare, underhållare, tillsynsmyndighet — står nu nedströms den flaskhalsen.

Bryssel sätter klockan

In i denna kollision kliver EU:s cyberresiliensförordning, och dess tajming kunde knappast vara skarpare.

Från den 11 september 2026 förpliktar artikel 14 i CRA tillverkare av produkter med digitala element som säljs i EU att rapportera varje aktivt utnyttjad sårbarhet de får kännedom om — inom 24 timmar för den tidiga varningen, 72 timmar för den fullständiga anmälan och 14 dagar för slutrapporten — samtidigt till Enisa och den utsedda nationella CSIRT-enheten, via den gemensamma rapporteringsplattformen. Avgörande: detta gäller produkter som redan finns på marknaden, inte bara nya utgåvor. Förordningen tillämpas därefter fullt ut från den 11 december 2027, med bindande krav på inbyggd säkerhet, bilaga I-plikten att tillämpa effektiva och regelbundna provningar och granskningar av säkerheten, teknisk dokumentation som innehåller rapporterna från dessa provningar, och bevarandeskyldigheter som sträcker sig ett årtionde. Sanktionsavgifter enligt artikel 64 når 15 miljoner euro eller 2,5 % av den totala globala årsomsättningen, beroende på vilket som är högst.

Lägg nu ihop artikelns två halvor. AI-assisterade kampanjer lyfter fram tusentals kandidatsårbarheter över open source-ekosystem på några veckor — och några av dem, som BTCPay-felet, blir aktivt utnyttjade, vilket är exakt CRA:s rapporteringsutlösare. En tillverkare vars produkt bäddar in ett komprometterat beroende, eller ett fel som ett AI-svep lyfter fram och en angripare når först, står inte längre inför en stillsam ingenjörsrättelse. Den står inför en juridisk 24-timmarsklocka. Och en tillverkare helt utan upptäcktsprocess kan bryta mot artikel 14 inte genom att låta bli att rapportera, utan genom att aldrig ha vetat att det fanns något att rapportera.

Den obekväma följdsatsen: mycket av koden som nu skeppas i de produkterna är maskinskriven, och mycket av granskningen som tillämpas på den utförs av samma modeller som skrev den. Kod som skrivits av en modell och granskats av samma modell har granskats av ingen. Tillsynsmyndigheter, förvärvare, försäkringsgivare och företagens säkerhetsteam konvergerar mot samma fråga — och ”vår modell kontrollerade sin egen utdata” är inget svar som någon av dem accepterar.

Vederläggning som disciplin: CounterProof-metoden

Ett svep och en bedömning besvarar olika frågor, och den andra är där vår egen verksamhet sitter. CounterProof designades inte i en workshop som produkt; den ackumulerades medan vi säkrade vår egen betalningsinfrastruktur med tröskelkryptografi — där en defekt som slinker igenom inte kostar en kundrelation, utan operatören dess egna medel.

Begränsningen som formade den var motsatsen till Red Teamets. De behövde bredd: 501 projekt, snabbt, på vilken modell som än körde arbetet. Vi behövde att ett enda fynd skulle överleva att ha fel offentligt, på kod som håller våra egna pengar. Bredd förlåter ett falskt positivt; en signerad bedömning gör det inte. Annat problem, annan metod — och vi hade lyxen att välja instrument, vilket är precis vad policyrestriktionerna ovan nekade dem.

CounterProof tar sig an prövningsflaskhalsen rakt på, med ett protokoll format av felmoderna ovan. Varje bedömning är en adversariell granskning över flera härstamningar: oberoende modell-familjer — inte en andra genomgång av samma — angriper varje fynd och försöker vederlägga det, och oenigheter avgörs genom att läsa källkoden, inte genom omröstning.

Den sista punkten är inget anspråk på bättre modeller. Det är ett påstående om en uppmätt egenskap hos alla: en granskares utlåtande är ett stickprov, inte en mätning. Ge samma modell samma bytes två gånger och den återkommer inte alltid med samma svar; ge en fråga till flera familjer och de misslyckas åt olika håll — det enda skälet till att det är värt kostnaden att köra flera. Vi har sett en modell självsäkert ”rätta” en regulatorisk hänvisning och ha fel, medan en modell utan källåtkomst korrekt avböjde att svara alls. Läxan är inte att någon härstamning är överlägsen. Den är att en enda härstamning — vilken som helst — inte kan kontrollera sig själv. Inget skeppas ovederlagt. Varje fynd som överlever bekräftas därefter antingen mot den faktiska källkoden — exakt fil och rad, reproduktionsväg, konsekvensklassificering, med hänvisningar maskinellt upplösta mot exakt den granskade revisionen — eller etiketteras uttryckligen som enbart plausibelt. Varje fynd namnger det evidenssteg det faktiskt nådde — källspårning, kompileringsbevis, test eller live-reproduktion — och antyder aldrig ett högre. Och varje rapport bär ett stående återkallelseåtagande: visas ett fynd vara fel återkallas det skriftligt.

Med andra ord: där AI-erans granskning genererar brus i industriell skala är CounterProofs utdata avsiktligt motsatsen till en triagekö. Det är en signerad, evidensgraderad bedömning under en beständig uppdragsidentifierare — strukturerad för att överlämnas till ett due diligence-team eller en försäkringsgivare, eller ingå i CRA:s tekniska dokumentation som en provningsrapport i bilaga VII punkt 6:s form, som belägg för provningsplikten. Oberoendet är strukturellt: vi utfärdar ingen bedömning av kod som skrivits av CounterProof eller av något bolag i vår koncern — och vår egen kodbas, till stor del maskinskriven, går kontinuerligt genom samma adversariella register. Vi var vår egen första kund, och vi förblir vår hårdaste.

Vi lanserar inom kort en ny tjänst på CounterProof.io, som utsträcker denna praktik till team som står inför exakt den konvergens denna artikel beskriver: maskinskriven kod, motståndare i maskinfart och en tillsynsmyndighets klocka. Mer om det snart.

Vart detta är på väg

Tre förutsägelser, löst hållna.

För det första: triagegapet vidgas innan det sluts. Modeller med öppna vikter fortsätter att förbättras, svep som Bitcoin Red Teamets kommer att upprepas i andra ekosystem, och förhållandet mellan kandidatfynd och verifierade blir sämre innan prövningsverktyg och disciplinerade metoder hinner ikapp. Projekt kommer i allt högre grad att bedömas — av användare, försäkringsgivare och förvärvare lika — på sin svarshastighet vid rapportering, precis som Calle observerade.

För det andra: CRA blir den tvingande funktion som bug bounties aldrig var. Frivilliga rapporteringsnormer gav fläckvis täckning i ett årtionde; en 24-timmars rapporteringsplikt med omsättningsskalade avgifter kommer på arton månader att göra vad god vilja inte gjorde — och efterfrågan på regelbunden, oberoende, dokumentationsduglig säkerhetsprovning kommer att strukturera om granskningsmarknaden kring belägg i stället för märken.

För det tredje, och mest grundläggande för Bitcoin: ett ekosystem vars säkerhetsmodell vilar på öppen granskning står i begrepp att upptäcka om maskinell granskning räknas. Det ärliga svaret: den räknas bara när en oberoende part är villig att verifiera fyndet, gradera beläggen och skriva under. Upptäckten har automatiserats. Ansvarsskyldigheten har inte — och kan inte. Där bor värdet, och ansvaret, nu.


CounterProof är en oberoende adversariell granskningsverksamhet inom Clavestra Capital Limited (Malta). Proof intygar; CounterProof vederlägger. counterproof.io — Denna sida är en översättning av det engelska originalet; vid avvikelser gäller originalet.


Källor: Coinkites säkerhetsmeddelande samt rapportering av Forbes, Bloomberg, CBC och Galaxy Research om ColdCard-exploiten (jul–aug 2026); Bitcoin Red Teams redovisningar via Bitcoin Magazine, Decrypt, crypto.news, Coinpaper och Metaverse Post (aug 2026); versionsanteckningar för BTCPay Server 2.4.2; gemensam modellbedömning UK AISI / US CAISI; Sonatype State of the Software Supply Chain 2026; Google Threat Intelligence Group, rapport om AI-stödd hotaktivitet (2026); StepSecuritys analys av Injective SDK-intrånget (jul 2026); rapportering om npm-leveranskedjeincidenter (sep 2025 – mar 2026); förordning (EU) 2024/2847 (cyberresiliensförordningen), art. 13–14, 16, 69, bilagorna I och VII.

← Alla anteckningar