Modellen lär sig metoden för att lösa typen av frågor, och då konstruerar de nya typer som den inte kan metoden för än.
Det går att lära sig att bli bra även på IQ-test; det finns mycket intressant att läsa om tveksamheterna med IQ-test (och den rasism som låg bakom ursprungliga skapandet).
Modellerna lär sig i träningsfasen och använder kunskapen i genereringsfasen, de ”lär” sig inget när de genererar, så nya förmågor kommer med träning = ny modell/nya vikter. När det börjar tränas på den nya typen av frågor och det kommer nya modeller baserat på det så kan de ha chansen att klara de nya testerna med.
Kärnfrågan är om denna nya kunskap faktiskt är breddning av modellens intelligens och att nya förmågan går att applicera vidare än att bara svara på testfrågorna eller om det är smal kunskap som inte går att använda till annat (och därmed inte gjort modellen mer användbar).
Det tycker jag inte, då de testar olika saker. Om vi jämför det med olika test för människor så är det inte garanterat att en person som är bra på ett textbaserat test är bra på ett bildbaserat test.
De olika typerna av ARC-AGI testar lite olika saker. Första testar att se mönster i bilder, det senaste är ett test för att förstå reglerna i ett nytt spel.
Ja, för det är precis det som är syftet med Chollets forskning. Att titta på var forskningsfronten ligger idag, och sedan hitta utmaningar som är så ortogonala som möjligt mot deras förmågor, för att driva utveckling i den riktningen. Att dagens modellstrukturer har svårt att lära nytt/generalisera under användande är precis det som är kruxet/forskningsfronten/testet. När ARC-AGI 2 släpptes för ett år sedan hade toppmodeller någon enstaka procent i resultat då de hade bristande visuell styrka samt inte resonerade tillräckligt väl och nu börjar de närma sig 90%, och sålunda är det dags skapa ny utmaningar.
Det jag tycker är lite dåligt med ARC-AGI 3 är att många likt mig tycker att poängsystemet är lite svårbegripligt, varför räknas felet i kvadrat om en AI for 2x sämre än människor blir det inte 50% utan 25%, men det kanske finns något jag inte vet hur man mäter likande saker.
Det jag gillar är att de faktiskt mäter något relevant och viktigt för att AI agenter ska nå nästa nivå. De mäter hur fort en AI lär sig spelregler i en ny uppsättning, och det är väldigt viktigt i många situationer på jobbet.
Hur fungerar detta nya IT system?
Denna nya produkt?
Vår nya process?
Detta nya kodbibliotek?
En nya fabrik?
Jag tror att vi kommer se nästa nivå på AI agenter när en generell modell får ett bra resultat på version 3
Absolut! Det köper jag. Därför köper jag inte all AGI hype, det är uppenbart att riktig AGI skulle kunna generalisera och att vi ännu inte har hittat rätt modeller för att uppnå detta
LLM:er är bra verktyg men uppenbart inte intelligenta (ännu)
Mitt påstående är att det beror på hur man ser på intelligens, jag anser inte att det är binärt utan en skala. Skulle jag rangordna intelligens så skulle det nog bli såhär:
Människa > hund > råtta > groda > myra > sten.
Jag skulle även påstå att dagens bästa AI har passerat en råtta men ännu inte nått en människa.
Jag skulle på samma sätt påstå att generalisera inte är binärt, det går att generalisera nära det man sett tidigare, och mer långt ifrån.
The best current models achieve 50% success on tasks that take human experts 3.2h, roughly half a working day of professional offensive security work.
Länk:
En tanke, att hitta hål i IT säkerhet är ett område där det inte gör något om AIn misslyckas 50% eller mer, då ett hål är alltid något. Detta lär sänka tröskeln för IT attacker, och ännu mer om man blandar det med att en del personer vibe-codar och checkar in utan att läsa koden
Vi hade en duktig föreläsare från ett bolag i framkant. Hans syn var ”allting som går att verifiera går att automatisera med LLM” kändes rätt skrämmande att se ett stort bolag som var så långt fram. Försöker nu klura på hur jag ska verifiera mer och låta AI göra mer.
De hade börjat använda ai för att göra excel, slides och göra saker utanför bara utvecklare. Det är ett känt bolag som är stort i norden och funnits länge. Det var alltså inte ett hypeat tech bolag.
Det jag såg som coolast var hur de gör en deploy med en mirroring av trafiken, sen gör de en gradual rollout där en agent tar beslut om den ska rullas tillbaka eller öka utrullningen.
Vi försöker få ok på att rulla ut claude cowork. Det kommer bli spännande. Idag sitter folk i vscode med claude code vilket känns sisådär.
En detalj som är väldigt intressant med detta är att det är en ”känslig sektor” så de har alltså löst en proxy lösning så att de kan skicka känslig data och deras data anonymiseras. De har även byggt en egen variant av claude cowork. Så de kör inte yolo mode som många bolag gör.