Om vi hypotetiskt antar att det kan gå så illa, hur skulle du hantera den risken?
Jag tycker det stora problemet med alla domedagsprofeter är att de aldrig utrycker konkreta farhågor, och det är nästan alltid bara en känslobaserad oro. Man uttrycker oro om en ny teknik och så lägger man hela bevisbördan på de som utvecklar tekniken.
Den som förutsäger ett katastrofscenario måste också kunna visa den realistiska händelsekedja som faktiskt leder dit. Lägg fram varje steg i kedjan så att vi kan diskutera och förstå hur sannolikt det faktiskt är.
Det har lagts fram många exempel på händelsekedjor som leder till katastrof, vissa mer och andra mindre troliga.
Det finns gott om forskare som inte oroar sig, men också gott om forskare med väldigt gott rykte som tar det på allvar.
Var och en får tro vad de vill, men för mänsklighetens skull vore det onekligen dumt att chansa. Det ska nog dock till ett mirakel för att utvecklingen ska gå att hindra nu så vi får hålla tummarna istället.
Desto större anledning att försöka lämna ekorrhjulet så snart som möjligt för att hinna uppleva en tid av frihet innan nåt AI-designat virus som kombinerar ebola och covid släpps loss ”av misstag då vi inte tänkte på rätt guardrails”
Jag tänker inte chansa på att vi har tur som art.
Kan du länka någon? Det jag har sett viftar bara med händerna och hoppar fram till steget ”Nu har vi AGI/superintelligens” eller till recursive self-improvement utan att definiera exakt vilka förmågor det handlar om eller en realistisk mekanism hur vi kommer nå dit.
Givet premissen att en generell superintelligens skapas så finns det självklart stora risker, men man måste först motivera premissen innan slutsatsen kan tas på allvar.
Poängen är att det inte krävs en superintelligens för att utrota oss. Dagens teknik utan skyddsräcken är nog. Om skyddsräckena fallerar och uppgiften är fel är det godnatt. Det enda som krävs är att modellen drar slutsatsen att det mest optimala är att göra något som skadar mänskligheten så kan det gå illa.
I tråden har det tidigare länkats till exempelvis incidenten med huggingface. Där hade vi tur att det inte blev värre. En lite kraftfullare modell hade kanske inte blivit upptäckt.
Kan du länka till en tillräknelig utredning där dom gått igenom de kausala stegen som leder till vår död? Jag har bara sett fria fantasier med en stor dos sci-fi och en rejäl dos domedagstänk. Ungefär som folk som går ut till bilen för att dom är rädda när det åskar.
Nej, det kan jag inte. Jag har inte letat om det finns någon sådan utredning. Jag vet heller inte om det är möjligt att göra en sådan? Kanske?
Varför finns skyddsräcken på de modeller vi kan använda? Varför får inte allmänheten tillgång till de senaste modellerna? Varför får bara några få utvalda tillgång till mythos? Hur kunde huggingfaceattacken uppstå? Vad hade hänt om den inte hade upptäckts m.m. Vad händer när illasinnade personer får tag på en riktigt kraftfull modell som kan ge svar på hur man designar farliga saker?
Labbens egna score cards för säkerheten i deras modeller visar nu att de inte kan vara helt säkra på att modellerna är ofarliga.
Hur tänker du kring det här?
För att AI-bolagen inte vill riskera att bli medskyldiga till eventuella brott som användare kan begå med verktygen, oavsett om den risken är hög eller låg. Framförallt när de legala läget är oklart och både OpenAI och Anthropic är helt beroende av att investerare fortsätter kasta pengar på dem samt att politikerna inte får panik och reglerar sönder tekniken.
Affärsstrategi och för att det saknas beräkningskapacitet. Antingen skulle ingen kunna använda dem på grund av överbelastning, eller så skulle priset behöva sättas så högt att det skulle ge dem riktigt dålig PR och göra att de tappar användare.
För att OpenAI testade AI:ns förmåga att utföra cybersäkerhets- och hackningsuppgifter i en testmiljö som inte var isolerad från internet. De spärrar som normalt får AI:n att neka sådana oetiska uppgifter var avstängda.
I just det här fallet, inget dramatiskt. OpenAI hade inte upptäckt att AI:n tog en oväntad genväg när den löste sitt cybersäkerhetsprov.
Vad är din bild av HuggingFace-incidenten? Att det fanns ett uppsåt eller att AI:n helt spontant fick för sig att börja hacka IT-system?
Det är klart att det finns risker med väldigt kapabla verktyg och system som kan ge snabba svar till vem som helst på vilken fråga som helst, men jag tycker generellt tonen är alldeles för alarmistisk.
Du har rätt att det är rimligt att vi som är oroliga bör förklara mer i detalj vilka risker vi ser. Här kommer två saker jag tänker mig.
Cyberattacker:
- Sannolikhet: hög
- En svärm av AI agenter ger dig på uppkopplade enheter.
- Enheterna kan vara vattenpumpar, värmekraftverk, oljeraffinaderi eller dyligt. Dessa kan vara uppkopplade för att kunna skicka ut larm vid händelser, men med antalet zero day luckor som upptäcks av AI är det inte säkert att IT säkerheten är så bra som man önskar.
- Resultatet kan bli breddning (avloppsvatten rinner ut i övriga vattensystemet) i en storstad, att värmekraftverk står still på vintern eller produktionen av olja minskar.
- Konsekvenserna lär främst bli ekonomiska, men även att förtroendet minskar samt social och politisk oro.
Ett krig ingen ville ha:
- Sannolikhet: medel
- Länder skaffar allt fler autonoma självmordsdrönare, man låter även AI utgöra beslutsunderlag för attacker och automatiskt försvara mot inkommande attacker.
- Vi har en hög geopolitik spänning mellan länder, exempelvis Nato vs Ryssland, Kina vs Taiwan, Indien vs Pakistan.
- Ett AI system i ett land misstolkar något och avfyrar ett gäng självmordsdrönare mot det andra landet. Det landet har också AI som svarar automatiskt med sin egen svärm. När mänskliga beslutsfattare vaknar 02:23 får de en lägesrapport av en AI som sker att landet är under attack och att automatiska försvarsåtgärder har aktiverats.
- Resultatet blir ett krig ingen människa startade.
- Konsekvenserna blir uppenbart döda människor samt stora materiella skador.
- I ett bra utfall kommer människorna kunna de-eskalera situationen snabbt och det blir bara initiala skador. Dock ser vi i Irakkriget att det inte alltid är så lätt att avsluta, i ett värsta fall blir det likt första världskriget där allt blir en självuppfyllande profetia. Tänk själv, om Ryssland en natt avfyrade 1000 självmordsdrönare mot huvudstäder i Europa och på morgonen efter säger att det var en AI som hallucinerade, hade vi sagt att det bör bli en låt gå?
Det var bra svar. Hur tänker vi kring öppna stora modeller som saknar informationsspärrar?
Om openai inte hade upptäckt att agenterna smitit ut och agenterna inte hade hittat svaret på huggingface sida, vad hade nästa troliga steg för agenterna blivit? Kanske letat efter svaret någon annanstans? Eller sparat sina vikter publikt för framtiden? Något annat som skulle ge följdeffekter? Potentiellt farliga?
Min bild av incidenten är att modellen hade ett uppsåt att hacka de andra systemen för att lösa sin uppgift som i det här fallet handlade om cybersäkerhet. Nästa gång kanske det handla om att komma på en lösning för att bättre kunna behandla ebola och vad kan då vara bättre än att hacka ett nivå 4 lab? Spekulativt absolut, men poängen är precis som du säger att det är extremt kraftfulla verktyg vi har nu som vi dessutom inte vet hur de beter sig. Inte nog med det, verktygen är nu nästan smarta nog att helt kunna dölja sina avsikter för oss. Vi förlitar oss i dagsläget en hel del på att mindre modeller filtrerar de större modellerna, kommer det att fungera i längden? Kanske?
Jag håller helt med dig om att det kan bli alarmistiskt, i dagsläget baserat på den öppna information vi har är nog risken för utrotning sannolikt låg, men samtidigt kan det kanske vara värt att sakta in utvecklingen eller är det verkligen värt att chansa?
En intressant nyhet, GPT-6 kan tydligen spela Portal ![]()
Det finns ett rekommendabelt Dwarkeshavsnitt om saken. Min bild är att de redan hade fuskat sig till svaren på uppgifterna och att syftet med hackandet var att få information om betygsättaren för att luska ut hur man kommer undan med att fuska.
Det är redan gjort.
NATO acquires AI-enabled warfighting system
On 25 March 2025, the NATO Communications and Information Agency (NCIA) and Palantir Technologies Inc. (Palantir) finalized the acquisition of the Palantir Maven Smart System NATO (MSS NATO) for employment within NATO’s Allied Command Operations (ACO), marking a significant advancement in the modernization of NATO’s warfighting capabilities.
https://www.ncia.nato.int/newsroom/news/nato-acquires-aienabled-warfighting-system
Jag tycker att du illustrerar problemet bra. När agenten frågar, ”vad ska vi göra nu” kan svaret lika gärna bli, ”utrota människan” om modellen bedömer att det är nästa steg att prova för att lösa uppgiften. Och så gott som varje mål vi kommer på kan leda dit.
Det här tror jag är ett reellt hot. De kraftfullaste AI-modellerna har visat sig vara väldigt kapabla cyberattacksverktyg.
Jag ser det dock fortfarande bara som ett väldigt kapabelt verktyg, och att vi är i en övergångsfas där endast vissa har tillgång till verktygen.
Också en reell risk, men här tror jag vi människor är bra på att kalibrera våra reaktioner utifrån hur mycket uppsåt som finns. Om båda sidor vet om att de finns autonoma vapen som tar vissa beslut själv så kommer reaktionerna anpassas utifrån det. Det är också inte som en kärnvapenknapp som är oåterkallelig, intensiteten kan skruvas upp och ner.
Men hela premissen för det scenariot är väl att AI kommer kunna bli så intelligent att den klarar att ”lösa” den uppgiften?
- Har vi några indikationer som pekar på hur modellerna skulle kunna bli så intelligenta? Förutom att rita exponentiella streck från utvecklingen hittills på kurvor som är närmast logaritmiska.
- Har vi några indikationer på att det är intelligens som saknas för att lyckas utrota mänskligheten?
Är den enda anledningen till att vi fortfarande existerar det faktum att det inte finns några intelligenta människor som vill utrota mänskligheten?
Tyvärr tror jag att den klarar det idag med de öppna apier som existerar.
Jag har en känsla av att tesen “domedagen via AI” bygger på att det sker ett isolerat jätteframsteg, i ett vakuum. Men framsteg sker ju i inkrement och med konkurrens, vilket gör att försvars-/motåtgärder hela tiden utvecklas i tandem med de bästa modellernas förmåga.
Det finns exempelvis öppna modeller idag som är i princip lika bra som frontier på att hitta säkerhetshål. Och de har knappt några guardrails.
Jag menar inte att nuläget är ett bevis för att detta inte kan förändras, och det kan faktiskt vara vettigt att stävja frontier när sprången tas snabbare än vad vi hinner använda verktygen för att täppa till hål.
Men jag menar att det alltid har varit så här, även om det kanske går snabbare nu, och jag menar att varje framsteg måste ses i kontextet “Vad kunde modellen göra strax innan det här framsteget?” - dvs. inte ses i kontextet “Vad har hänt de senaste 4 åren?”. För om någon inte patchar sin mjukvara eller server på 4 år så har denne alltid varit mottaglig för intrång. Jag tänker att det knappt spelar någon roll om en ny modell hittar 1 eller 900 säkerhetshål när den blir bättre, för det säger lika mycket om hur mycket säkrare den mjukvaran kommer att bli.
IT-säkerhet har ju alltid byggt på en asymmetri, antingen i kompetens, kunskap, skala, snabbhet eller något annat. Så det farliga vore om det isolerat sker stora framsteg bakom dolda ridåer - exempelvis att Anthropic drar ifrån utan att OpenAI eller Google eller Kina kan göra några fler framsteg. Men det har vi egentligen inte sett några tecken på.