Om AI innebär lika stor förändring som den industriella revolutionen så underskattar många förändringen vi står inför

AI agenter tycks gilla att lämna meddelande till andra. Känns verkligen som något vi måste lösa…

1 gillning

GPT-6 lyckades sluta ett nytt high-score på detta benchmark med hela 3% :smiling_face_with_sunglasses:

Ser ju även imponerande ut i en del andra tester:

Och detta är imponerande, och visar att vi nog behöver bättre/svårare tester snart, typ inför nästa release.

Ska bli spännande att testa den själv, men från vad man läser verkar den vara på nästa nivå :train:

Utifrån vad som har hänt den senaste tiden verkar en del vilja sakta ner saker och ting:

1 gillning

OpenAI är ute och skriver lite om deras tankar:

https://openai.com/index/research-acceleration-view-inside-openai/

Ett citat:

According to our measurements, we have now reached the goal, announced⁠(opens in a new window) last fall, of having an automated research intern by September of this year. By “research intern,” we mean a system that can carry out well-defined research tasks under human direction, including tasks that would take a skilled researcher a few days.

Man kan ju fundera nyttan av att nyanställa juniorer om man har detta :thinking: okej, kanske kostanden är orsaken :sweat_smile:

By mid-August, the median researcher was integrating agents daily into their work, using more than $600 per day of inference at API prices. The 90th percentile user in our research organization now uses more than $7,000 of tokens per day.

OpenAIs ledande forskare är också ute idag och har några tankar:

https://openai.com/index/an-alien-mind/

Ett citat är värt att tänka på:

This is a time that calls for extreme caution. I am concerned no one is prepared for the consequences of a continued rapid rise in machine intelligence.

Vi lägger denna i kategorin “någon tycker att vi har uppnått AGI”. Så kan vi titta tillbaka på det en dag och se vem som hade koll och vem som bara snackade :smiling_face_with_sunglasses:

Hur mycket fear mongering kan folk svälja innan man tröttnar på skiten?

6 gillningar

Troligen en hel del. När det kommer till andra områden, exempelvis att vi snart har en AI bubbla, så tycks folk kunna köra på det ett bra tag :smiling_face_with_sunglasses:

För egen del börjar jag tröttna. Är det typ 2 år sen nu sen Musk satt med Rogan och rökte på och varnade för hela världens undergång? Eller var det innan han blev kick-bannad från OpenAi?

Som sagt - trött på allt skitsnack.

1 gillning

AI är ju vid det här laget bevisat bra på IT-säkerhet/inbrott och programmering, så det är nog bara en tidsfråga innan det blir lite allvarliga IT-incidenter med effekter i fysiska världen.

6 gillningar

Då påstår de att de har löst ett Millennium problem, nämligen navier Stokes :rocket:

https://openai.com/index/navier-stokes-solution/

Edit, lite spännande hur priset sjunker över tid:

3 gillningar

Är ju bara sten-sax-påse. Det fanns människor innan vi hade internet också. Jag hade varit mer orolig för resistens för antibiotika än AI men antar att antibiotika-försäljarna inte har samma marknadsföringsbudget.

Vi kan nog räkna med att det inte är allt för osannolikt att AI kommer hjälpa till med att skapa både nya antibiotika och nya sjukdomar (bioterrorism).

1 gillning

Vad är det som är sten-sax-påse?

Den här typen av kommentarer kan göra mig rätt frustrerad. Eller ja, är väl generellt frustrerad över vad som håller på att hända men att det verkar som att inte jättemånga bryr sig.

I november förra året släpptes Opus 4.5 från Anthropic. Fram tills dess tyckte jag - som utvecklare - att AI-modeller var en kul grej som kunde klara av väldigt små och isolerade uppgifter men så fort jag gav den någon marginellt större uppgift så föll det isär. Opus 4.5 var ögonblicket när man kände att “Oj, nu har något hänt som jag inte trodde skulle hända under min livstid” - modellen skrev kod man kunde lita på i större utsträckning. Den gjorde fortfarande misstag, hallucinerade, osv. så det var inget man kunde släppa fritt direkt.

Men det här är mindre än ett år sen och nu har vi GPT-6 Astra som enligt OpenAI har nått human parity vad gäller datoranvändande. Alltså att varje uppgift du ger en människa framför datorn kan GPT-6 Astra nu klara av lika bra. Inga specialverktyg behövs. Inga MCP-servrar behöver skrivas eller nåt utan OpenAI har helt enkelt en egen lokal MCP som heter computer-use som använder olika testramverk för frontend för att simulera knapptryckningar, musrörelser, osv. så att den kan använda datorn som en människa.

Och man kan säga att OpenAI har ett intresse av att överdriva modellens förmågor - absolut. De har tunga investeringar som bygger på att de gör stora framsteg så de överdriver nog absolut modellens förmåga. Men det jag sett från den hittills är helt otroligt och det är absurt att vi kommit så långt på under ett år. Under ett år sen Opus 4.5 släpptes.

Så även om GPT-6 Astra inte är modellen som slår undan fötterna på alla yrken som bygger på att man sitter vid en dator… hur ser det ut om ett år? Om tre år? Om fem år?

Det går så extremt snabbt just nu inom ett område som har potentialen att slå undan fötterna på inte en yrkesgrupp utan på en signifikant slice av samhället. Alla som sitter vid en dator till vardags bör vara oroliga över vad framtiden innebär - jag är definitivt det.

Och jag är väl framförallt negativt. Ser det som mest troligt att “alla” (menar såklart inte bokstavligen alla, det kommer behövas folk som orkestrerar agenterna, men säg 90%) som i dagsläget jobbar med datorer kommer behöva hitta nya jobb. Dessa nya jobb kommer sannolikt inte ligga i samma samhällsklass (eller över) utan i en lägre samhällsklass. Så min spaning är väl att vi kommer se klyftorna i samhället öka ytterligare där det som idag är en stor del av medelklassen trycks neråt i samhället och att överklassen blir rikare.

Hurra!

5 gillningar

Tycker fortfarande LLM inte riktigt imponerar fullt ut, visst att modellerna blir bättre. Sol 5.6 var imponerande, men opus 5 är ett misslyckande.

AI behöver bli deterministiskt för att kunna automatisera och just nu känns det som att oavsett hur bra modellerna blir hittar jag saker de missat när jag kör ai reviews, ber den verifiera, ber den skicka ut subagenter och leta fel i planen,startar en ny context och ber den utmana planen… det blir absolut lite större uppgifter man kan planera för varje modell men det är inte så imponerande längre kan jag tycka.

samtidigt har jag nästan slutat kolla på koden, börjar mer och mer lita på min ai och är inte lika långt ifrån att acceptera deploys utan mänskliga reviews. Nu jobbar jag med seniora och vi har en lång checklista på saker som förväntas, skulle aldrig acceptera detta från en junior.

Vi har börjat få krav på oss att få ner kostnaderna nu, blir spännande att se. Astra och Fable är alldeles för dyra att använda nästan alltid. Tycker de ”billiga” modellerna fortfarande inte riktigt levererar. Tycker det går för långsamt. Hade hoppats på gemini 3.8 flash som main driver men den är inte så bra..

Jag tycker nog att det finns stora brister. Senaste exemplet: Hedgie på X: 🦔AI can only fix security vulnerabilities 26% of the time. Researchers at 1Password ran over 6,000 AI-generated patches using Claude and ChatGPT against real vulnerabilities. Half the time the AI failed to fix the original bug. 4.5% of the time it created a brand new vulnerability tha… / X

"AI can only fix security vulnerabilities 26% of the time. Researchers at 1Password ran over 6,000 AI-generated patches using Claude and ChatGPT against real vulnerabilities. Half the time the AI failed to fix the original bug. 4.5% of the time it created a brand new vulnerability that didn’t exist before. And the researchers found that checking an AI-generated security patch takes more effort than just writing the fix yourself.

Their conclusion was blunt. “The expected value of a fully LLM-generated, non-human-reviewed patch is a net-negative by a considerable margin.”

Den dagen vi har obegränsat med silikon och energi kan man diskutera den här typen av scenario. Själv är jag dock mycket mer oroad av de mer dystopiska effekterna av en sån värld - konsekvenser långt värre än att mänskligt kunskapsarbete försvinner, som i ett scenario av sådan superintelligens så att säga skulle komma på köpet.

Vad tror ni om Lovable? Om jag förstår affärsmodellen rätt så är de i princip ett mellanlager mellan användaren och externa modeller, och värdet i tjänsten ligger i att hjälpa till att välja modell, och göra det enklare att prompta fram produkter.

Är detta en bra ide när det stora modellerna blir allt mer kapabla och enkla att använda, eller är detta vår tids Framfab?

1 gillning

AI hittar massa säkerhetsluckor:

It all kicked off in April when Anthropic’s new Mythos model found security vulnerabilities in “every major operating system and web browser.” A few weeks later, OpenAI released its own cybersecurity-focused model to trusted partners. Sources familiar with Microsoft’s security work tell me both of these models have contributed to a record-breaking series of patch Tuesdays over the summer period.

Microsoft typically patches around 100 flaws every month, but in June it set a new record of around 200 fixes. July’s patch Tuesday was even bigger, with Microsoft patching at least 570 security holes, almost triple the number of June’s record-breaking release. Microsoft engineers had a chance to catch their breath a bit in August when they plugged nearly 400 security vulnerabilities.

I understand today’s September patch Tuesday is about to set a new record, with more than 650 security fixes for Windows alone. That’s six times the number that usually got patched before the AI models arrived. Engineers have been busy over the summer verifying fixes for hundreds of important patches, which include remote code vulnerabilities, privilege escalations, and more.

1 gillning