Om AI innebär lika stor förändring som den industriella revolutionen så underskattar många förändringen vi står inför

Modellen lär sig metoden för att lösa typen av frågor, och då konstruerar de nya typer som den inte kan metoden för än.

Det går att lära sig att bli bra även på IQ-test; det finns mycket intressant att läsa om tveksamheterna med IQ-test (och den rasism som låg bakom ursprungliga skapandet).

Modellerna lär sig i träningsfasen och använder kunskapen i genereringsfasen, de ”lär” sig inget när de genererar, så nya förmågor kommer med träning = ny modell/nya vikter. När det börjar tränas på den nya typen av frågor och det kommer nya modeller baserat på det så kan de ha chansen att klara de nya testerna med.

Kärnfrågan är om denna nya kunskap faktiskt är breddning av modellens intelligens och att nya förmågan går att applicera vidare än att bara svara på testfrågorna eller om det är smal kunskap som inte går att använda till annat (och därmed inte gjort modellen mer användbar).

1 gillning

Det tycker jag inte, då de testar olika saker. Om vi jämför det med olika test för människor så är det inte garanterat att en person som är bra på ett textbaserat test är bra på ett bildbaserat test.

De olika typerna av ARC-AGI testar lite olika saker. Första testar att se mönster i bilder, det senaste är ett test för att förstå reglerna i ett nytt spel.

Jag älskar denna tråden, den är min goto på morgonen, eftermiddagen och kvällen. Keep up the good work!

9 gillningar

Ja, för det är precis det som är syftet med Chollets forskning. Att titta på var forskningsfronten ligger idag, och sedan hitta utmaningar som är så ortogonala som möjligt mot deras förmågor, för att driva utveckling i den riktningen. Att dagens modellstrukturer har svårt att lära nytt/generalisera under användande är precis det som är kruxet/forskningsfronten/testet. När ARC-AGI 2 släpptes för ett år sedan hade toppmodeller någon enstaka procent i resultat då de hade bristande visuell styrka samt inte resonerade tillräckligt väl och nu börjar de närma sig 90%, och sålunda är det dags skapa ny utmaningar.

1 gillning

Det jag tycker är lite dåligt med ARC-AGI 3 är att många likt mig tycker att poängsystemet är lite svårbegripligt, varför räknas felet i kvadrat :thinking: om en AI for 2x sämre än människor blir det inte 50% utan 25%, men det kanske finns något jag inte vet hur man mäter likande saker.

Det jag gillar är att de faktiskt mäter något relevant och viktigt för att AI agenter ska nå nästa nivå. De mäter hur fort en AI lär sig spelregler i en ny uppsättning, och det är väldigt viktigt i många situationer på jobbet.

  • Hur fungerar detta nya IT system?
  • Denna nya produkt?
  • Vår nya process?
  • Detta nya kodbibliotek?
  • En nya fabrik?

Jag tror att vi kommer se nästa nivå på AI agenter när en generell modell får ett bra resultat på version 3 :train:

Absolut! Det köper jag. Därför köper jag inte all AGI hype, det är uppenbart att riktig AGI skulle kunna generalisera och att vi ännu inte har hittat rätt modeller för att uppnå detta :+1:

LLM:er är bra verktyg men uppenbart inte intelligenta (ännu)

1 gillning

Mitt påstående är att det beror på hur man ser på intelligens, jag anser inte att det är binärt utan en skala. Skulle jag rangordna intelligens så skulle det nog bli såhär:

Människa > hund > råtta > groda > myra > sten.

Jag skulle även påstå att dagens bästa AI har passerat en råtta men ännu inte nått en människa.

Jag skulle på samma sätt påstå att generalisera inte är binärt, det går att generalisera nära det man sett tidigare, och mer långt ifrån.

2 gillningar

16 min video om DeepSeek och deras senaste innovation, intressant och se att de hela tiden hittar små sätt att göra LLMs lite mer effektiva :smiling_face_with_sunglasses:

En robot är i farten :robot:

1 gillning

Gemma 4 är bra ut, en del har hänt sedan 3an för ungefär 1 år sedan :smiling_face_with_sunglasses:

Länk:

1 gillning

En liten uppdatering hur några tror att det går med AGI. (Korta svaret, efter det gått lite långsamt har det börjat gå lite fortare igen.)

En spännande resa framför oss :popcorn:

AI verkar inte ha någon rädsla för kärnvapenkrig:

4 gillningar

Av allt att döma tycks AI fortsätta bli bättre på hitta hål i IT säkerhet :train:

Citat:

The best current models achieve 50% success on tasks that take human experts 3.2h, roughly half a working day of professional offensive security work.

Länk:

En tanke, att hitta hål i IT säkerhet är ett område där det inte gör något om AIn misslyckas 50% eller mer, då ett hål är alltid något. Detta lär sänka tröskeln för IT attacker, och ännu mer om man blandar det med att en del personer vibe-codar och checkar in utan att läsa koden :popcorn:

1 gillning

Vi hade en duktig föreläsare från ett bolag i framkant. Hans syn var ”allting som går att verifiera går att automatisera med LLM” kändes rätt skrämmande att se ett stort bolag som var så långt fram. Försöker nu klura på hur jag ska verifiera mer och låta AI göra mer.

2 gillningar

De hade börjat använda ai för att göra excel, slides och göra saker utanför bara utvecklare. Det är ett känt bolag som är stort i norden och funnits länge. Det var alltså inte ett hypeat tech bolag.

Har hört det sedan vi fick dessa resoneringsmodeller. Kommer nog bli allt fler saker om det visar sig stämma, vilket jag tror :train:

Spännande, personligen har jag inte sett det än, men lär nog komma någon gång snart.

Det jag såg som coolast var hur de gör en deploy med en mirroring av trafiken, sen gör de en gradual rollout där en agent tar beslut om den ska rullas tillbaka eller öka utrullningen.

Vi försöker få ok på att rulla ut claude cowork. Det kommer bli spännande. Idag sitter folk i vscode med claude code vilket känns sisådär.

1 gillning

En detalj som är väldigt intressant med detta är att det är en ”känslig sektor” så de har alltså löst en proxy lösning så att de kan skicka känslig data och deras data anonymiseras. De har även byggt en egen variant av claude cowork. Så de kör inte yolo mode som många bolag gör.

1 gillning

Från Claude Code Found a Linux Vulnerability Hidden for 23 Years · mtlynch.io

3 gillningar

Hur företag löser det här med att deras uppgifter inte skickas raka vägen till amerikat övergår mitt förstånd.