Om AI innebär lika stor förändring som den industriella revolutionen så underskattar många förändringen vi står inför

Du använder en ”proxy” med uppgift att hitta känslig data och anonymisera. Så exempelvis företagsnamn behöver bytas ut eller personnummer. Ingen aning hur de löser det i praktiken. Mycket kan nog fixas med regex, de kanske kör en ML model/LLM lokalt också :thinking:

Anthropic gör en del intressant forskning :smiling_face_with_sunglasses:

1 gillning

Nu när det spekuleras mycket om nästa generations modeller, Mythos från Anthropic och Spud från OpenAI, så sitter jag här och känner att AI idag till stor del är ett race med 3 huvudspelare, Anthropic, OpenAI och Google. För mig känns det som ska andra bolag ligger en generation eller mer bakom dessa. Är det någon som känner annorlunda?

Tittar vi på Meta som har köpt in både ett stort/dyrt team och gott om grafikkort/datakraft så ser jag inte längre något nämnvärt. Grok 5 skulle komma ut i slutet av förra året, men var inte lika bra som Claude och vi fick istället Grok 4.2. Även bolag från Kina som DeepSeek, Kimi och Qwen känns som ett steg bakom. Kan någon annan hitta något bra exempel på motsatsen?

Frågan är om det är en tillfällig formsvacka eller vi från och med nu kommer ha en värld där dessa 3 bolag ligger framför konkurrenterna permanent? :thinking:

1 gillning

Svårt att inte till stor del hålla med efter att ha börjat använda Claude Code, men problemet är vad det kostar att ha denna verifiering.

Idealfallet är implementation av “business logic” isolerat till en specifik tjänst, med tester som snabb kan säga “rätt” eller “fel”. När folk tror att mjukvaruutveckling är “löst” så är det nog det här dom pratar om.

Jag vågar dock säga att denna bra verifiering slutar existerar i dom flesta mjukvarusystem så fort du lämnar “unit test” nivån. Och då verifieras bara själva logiken, inte prestanda, resursläckor, osv.

En del företag är kanske lite bättre och har någon sorts systemtester. Man kanske spinner upp några containrar och någon databas, och gör anrop mot dessa.

Ännu färre har omfattande end-to-end tester när en feature sträcker sig över säg 3+ olika tjänster. Man förlitar sig istället på staging/canary deployments, gradvisa utrullningar, tester i produktion mot “friendly customers”, osv. Eftersom det är fett jobbigt och dyrt att uveckla snabba bra tester på den skalan.

Jag har verkligen märkt det här själv när jag jobbat med Claude Code under Q1 2026. I vissa uppgifter går det verkligen 10x+ snabbare. Något som förmodligen tagit några timmar tidigare kan gå på en kvart, och jag litar på resultatet. Andra uppgifter går inte snabbare alls eftersom precis som tidigare tvingas jag in i kostsamma (i tid) manuella verifieringar, planeringar av utrullningar, osv.

Tror du missar kineserna, de ligger såpass nära med gamma, deepseek och qwen och de är opensource. Nånstans börjar modellerna bli så bra nu och priserna är fortfarande dyra att det börjar löna sig att köpa hårdvara. De flesta utvecklarna på mitt jobb som använder claude mycket lägger ju åtminstone 3000 usd i månaden på ai. Ta det gånger några hundra utvecklare och de kan tyvärr bli en diskussion om att sänka dessa kostnader.

Jag tror verkligen på det där med att spegla trafik och låta en agent kontrollera utrullningen och hitta sätt att sluta göra så mycket reviews. Kan man hitta sätt att gå till ship show istället för reviews utan att sänka kvaliteten? Tar emot för mig dock.

1 gillning

Jag tycker att det är en bra strategi för utrullning i allmänhet (någon sorts kombination av canary och blue/green?) men hur verifierar agenten korrektheten?

Man får väl definera success metrics per service? Sen kan den även ha tillgång till loggar och liknande utöver metrics? Lurigt, man får nog göra lite trial and error gissar jag. Föreläsaren hade ganska tydlig success metric så kanske inte fungerar för allt.

Jo precis, och jag tycker att det är en bra idé generellt att övervaka/larma på metrics efter utrullningar (automatisk revert, gärna!), men att en tjänst inte spottar ur sig flera 500or än vanligt och inte error loggar massor betyder ju inte att allt fungerar som det ska, nödvändigtvis.

1 gillning

Korslänkning:

Är det din upplevelse eller något du hört? Själv tycker jag mig inte se det. Ja, det finns både ekonomiska och säkerhetsaspekter, men tycker ofta jag ser saker som detta:

Även när jag tittar på dessa benchmarks:

När jag själv jobbar tycker jag ofta att jag kommer tillbaka till Claude, det är något med dens “smak” som jag gillar.

1 gillning

Har inte prövat de kinesiska modellerna själv, är våra ai ”experter” som labbar massa. Tycker codex och opus är helt annan nivå än gemini. Får ofta stort värde av codex som sparring partner, men gemini är fan trash alltså

1 gillning

jag tycker att Gemini har roligast personlighet för chattande. den är helt galet positiv till allt man säger till skillnad från tråkmånsarna från Anthropic. givetvis är detta bara lämpligt i vissa sammanhang :joy:

1 gillning

Gemini hittar ibland buggar som både codex och opus missar så använder fortfarande gemini för reviews, men vid planning främst opus och codex.

Just nu verkar folk beredda att betala för Claude, de har ökat omsättningen men 3x på 3 månader, låter galet :rocket:

3 gillningar

Från vad och till vad? Och hur ser marginalen ut?

1 gillning

Det står såhär:

Demand from Claude customers has accelerated in 2026. Our run-rate revenue has now surpassed $30 billion—up from approximately $9 billion at the end of 2025.

Troligen så är marginalen negativ, men har ingen siffra.

1 gillning

Nu börjar Anthropic få så bra AI att de vill vänta med att släppa den, iaf enligt den själva :train: deras nya Mythos verkar iaf vara bra på hitta säkerhetshål i IT:

Over the past few weeks, we have used Claude Mythos Preview to identify thousands of zero-day vulnerabilities (that is, flaws that were previously unknown to the software’s developers), many of them critical, in every major operating system and every major web browser, along with a range of other important pieces of software.

Även några benchmarks det bra ut:

Länk:

3 gillningar

Så desto mer dom skalar upp - desto mer förlorar dom ännu mer pengar? Borde du inte skrivit det isf i ditt andra inlägg?

1 gillning

Tror gamebooken är att de finansierar nuvarande utveckling innan gpu, modeller osv blir billigare. De har ju lock in på deras setup. De satsar på storkunder. Tror inte det är så lätt att ersätta dem när man byggt massor kring deras system. De är även de enda bolaget som erbjuder något som påminner om det utvecklarna använder för icke tekniska. Voi tjänar ju pengar idag. Är väl en vanlig playbook?

2 gillningar

Du missar lite trenden inom ai, kostnaden för att träna modeller går kraftigt ner. Användandet går kraftigt uppåt, fler och fler usecase hittas osv. Vi är ett bolag med några tusen anställda och våra ai kostnader har ökat med 10x senaste 6månaderna. Kommer nog öka en del till innan alla är med på tåget. Tror marginalerna kommer dyka upp snart hos antrophic. Just nu behöver de inte fokusera på marginaler då de badar i investeringar. Användardata är också väldigt användbart.

OpenAI framstår som rätt desperata nu då de börjar bygga tooling för claude code och härma dem, bygga migrering tooling osv. De är desperata när de kontaktar oss. Samma sak med copilot, de märker att de tappar enterprise kunderna.