Opdateret 28. juli 2026
Når en ny topmodel lanceres, følger der altid en byge af benchmark-tal med. Med Claude Fable 5 er meldingen usædvanligt klar: modellen sætter rekord på næsten alle testede mål for AI-evner. Her er, hvad tallene faktisk viser — og vigtigere: hvad de betyder for dig, der skal bruge modellen i praksis.
Hvad måler benchmarks egentlig?
Et benchmark er en standardiseret prøve: en fast samling opgaver, som alle modeller kan testes på, så resultaterne kan sammenlignes. Nogle måler kodning (kan modellen løse rigtige fejl i rigtige kodebaser?), andre måler videnarbejde, billedforståelse eller videnskabelig problemløsning. Benchmarks er ikke hele sandheden — men de er den bedste fælles målestok, vi har.
Softwareudvikling: agentopgaver i rigtige kodebaser
Det mest omtalte felt er softwareudvikling, hvor prøverne tester modellens evne til selvstændigt at rette fejl og bygge funktioner i eksisterende kodebaser. Her er Fable 5 state of the art — og det er netop i kombinationen med lange, selvstændige arbejdssessioner, at forspringet vokser: modellen planlægger, tester sit eget arbejde og retter kursen undervejs, hvor tidligere modeller mistede tråden.
Videnarbejde, vision og forskning
Rekorderne begrænser sig ikke til kode. Fable 5 topper også målinger inden for videnarbejde (analyse, jura, finans), visuel forståelse og videnskabelig forskning. Det brede billede er vigtigt: modellen er ikke en specialist, der er tunet til én prøve, men et generelt løft over hele linjen.
Over 10 procent bedre end Opus 4.8 på udvalgte mål
På udvalgte målinger scorer Fable 5 mere end 10 procent højere end Claude Opus 4.8 — hidtil Anthropics stærkeste model. I toppen af skalaen, hvor hvert procentpoint er sværere at hente end det forrige, er det et markant spring. Hvad forskellen betyder i praksis, og hvornår Opus stadig rækker, gennemgår vi i Fable 5 mod Opus 4.8.
Benchmarks vs. virkelighed: hvad skal du gå efter?
Benchmark-rekorder er et godt tegn, men de garanterer ikke, at modellen løser netop din opgave bedst. Tre råd: Test modellen på en rigtig opgave fra din egen hverdag, før du beslutter dig. Vægt de benchmarks, der ligner dit arbejde — koder du ikke, er kodebenchmarks mindre relevante. Og husk, at forskellen mellem topmodellerne på almindelige opgaver ofte er mindre, end tallene antyder — det er på de sværeste opgaver, gabet for alvor viser sig. En bredere sammenligning på tværs af udbydere finder du i Claude mod alle AI-assistenter.
Officielle kilder: Anthropics nyheder
Ofte stillede spørgsmål
Er Fable 5 den bedste AI-model lige nu?
På tværs af offentliggjorte benchmarks er Fable 5 blandt de absolut stærkeste — og på mange målinger nummer ét. Konkurrencebilledet skifter dog hurtigt, så “bedst” afhænger af tidspunkt og opgave.
Kan jeg selv efterprøve tallene?
De fleste store benchmarks er offentlige, og Anthropic dokumenterer sine resultater. Den bedste efterprøvning er dog stadig din egen: samme opgave, to modeller, sammenlign resultatet.
Konklusion
Fable 5 sætter benchmark-rekorder over næsten hele linjen og distancerer Opus 4.8 med over 10 procent på udvalgte mål. Men det vigtigste tal står ikke i nogen tabel: det er, hvor meget af dit eget arbejde modellen kan tage. Start med den komplette Fable 5-guide, og test den derefter på en rigtig opgave.
Skriv et svar
Du skal være logget ind for at skrive en kommentar.