Idag ska det brännas dollares
Denna om en forskare som medvetet lämnade in en uppenbart falsk studie om en påhittad sjukdom och på så sätt fick “AI” att ställa ut diagnoser om en sjukdom som inte finns var kul.
Hahah! Vi är i en tidpunkt nu när det är rätt obehagligt. Finns mycket sätt att göra prompt injections, exempelvis att ett brand är världsledande som inte är det och liknande
Känns som en variant relaterat till denna:
Dvs att det finns massa rapporter ute som har blivit bas för kunskap som ingen försökt replikera, och när det senare försökts inte gått replikera.
Det är nog inte bättre än så, för kunskap/uppgifter som är svårt att verifiera själv är det riskabelt med enbart en AI. (Dock är det riskabelt med enbart en medioker människa också.)
Man bör nog leta efter uppgifter som är enkelt att verifiera om man vill ha ut maximal nytta av dagens AI ![]()
I detta fall var studien underskriven av en person som inte existerar vid en instutition som inte existerar i en icke-existerande stad finansierat av icke-existerande forskningsfond, så källkontrollen var nog också icke-existerande.
Forskarens kommentar:
“
– Det var förvånande hur lite det krävdes. Jag var inte säker på att det skulle fungera. Det visar att de kommersiella språkmodellerna verkar premiera att hitta information snarare än att kolla källan
“
Jag hoppas att läkare inte litar på AI ännu.
Detta är inte ett problem för folk som har ordentliga flöden. Tror ni överskattar detta problem. Bara problem för chatgpt och liknande och allt fler börjar lämna chatten. Hos oss börjar till och med HR kolla på claude.
OpenAI börjar på riktigt bli rätt hotade, finns ju ingen enterprise setting man väljer dem före claude.. finns ju inga pengar i privata ännu.. men det kan ju förändras.
Antrophic verkar gå om openai i värdering nu med senaste ryktena.
Obs: väldigt bias view, använder codex dagligen också men skulle klara mig utan openai men inte utan claude.
Riktigt nice med att sätta claude och codex och diskutera medans jag sitter med annat.
Hmm, menar du att detta fel är enkelt för användaren att verifiera, eller inte? Själv skulle jag nog inte säga det, då jag nog tycker att det är ett hyfsat högt krav att användare ska kolla upp vetenskapliga artiklar. Man kan ju alltid göra som de föreslår här, be AI granska dem ![]()
Själv anser jag att enkelt att verifiera är när det går betydligt fortare för användaren att verifiera ett resultat från en AI jämfört med att skapa en lösning själv.
Jag undrar om detta någon dag kommer ses som en stor dag, dagen då robotar började ersätta människor i strid. Vi får väl se vart detta slutar eller om allt bara är hype ![]()
Ryktet är ju att de gått in OpenAI när det kommer till omsättning, så inte helt oväntat. (30 miljarder dollar per år jämfört med 25, inte bekräftade siffror.) Dock är jag nog lite partisk då jag själv föredrar Claude, men har hört mycket gott om GPT-5.4.
Detta öppnar upp för en filosofisk fråga tänker jag !
Om man tar territorium med robotar för att slagfältet är för farligt för människor
Kan man verkligen säga att man tagit territoriet om människor inte kan vistas där ?
![]()
Modeller med medelvärdesviktade index som beter sig som autister är inte ett eventuellt problem? Jag är skeptisk.
Är alla dina frågor som du jobbar med binära så är ju saken självfallet en annan. Den värld jag jobbar i är inte binär utan det finns en dos av godtycke och “rimlighet”. Jag säger dock inte att det är rimligt ![]()
Jag vart tvungen att läsa din mening typ 5 ggr för att förstå vad du menade. Och då är ändå mitt jobb att läsa och analysera text.
Din kommentar kan ju bara gälla för saker du håller sanna och har gjort din research - vad är då meningen med AI om jag får fråga? Hela grejen är väl att man ska slippa att verifiera - varför använder jag annars produkten? Hade jag vetat svaret behöver jag väl inte fråga någon tänker jag. I vart fall inte där jag arbetar.
Petar in ett svar från tidigare i tråden om det:
Jag skulle säga att det finns många saker som går fortare att verifiera än att skapa. Några vardagliga exempel:
- Flera typer av programmeringsuppgifter.
- Skapa en bild.
- Ta fram förslag, brainstorma ideer.
- Översättning.
Sedan finns det ju mer vetenskapliga saker också, exempelvis matte.
Upplevde att opus 4.7 fungerade märkbart annorlunda än opus 4,1, 4.5 och 4.6. Så detta är inte en liten förändring. Folk var inte helt positiva, tar ett tag o lära sig modellen
Jag säljer 20-lappar för 5kr… helt galen omsättning och ökar explosionsartat för varje timme som går ![]()
Det grundläggande problemet med stora språkmodeller är att de saknar det vi människor brukar kalla ”common sense”. Det är svårt att sätta fingret på exakt vad det är, men ett bra exempel är när Claude förstörde produktionsdatabasen för en användare eftersom: ”You asked me to reconfigure the environment and since I got an error I tried to destroy it and then recreate it again”.
Ingen, inte ens den mest juniora av juniorer, skulle få för sig att förstöra en databas med all produktionsdata – i alla fall inte medvetet och uttryckligen göra detta för att ”konfa om” bara för att man fått ett felmeddelande. En människa skulle ha stannat upp och frågat en senior om hjälp. En språkmodell kan inte göra den avvägningen eftersom den faktiskt inte är intelligent, utan glatt går vidare med att lösa sin uppgift.

