Aktuellt

Vem leder AI-racet? Så mäts det, och så ser läget ut i september 2026

Publicerat 2026-09-11

Varför frågan är svårare än den låter

"Vilken AI är bäst?" är en av de vanligaste frågorna om tekniken, och den ställs som om det fanns en rangordning att slå upp. Det finns gott om listor, men de svarar på olika saker. En lista mäter hur modellen klarar sig på prov, en annan vad användare föredrar, en tredje vad utvecklaren själv redovisar vid lanseringen. De ger olika vinnare.

Tre dygn i september 2026 illustrerar problemet. Den 1 september släppte Anthropic Claude Fable 5.1, dagen därpå kom Metas Muse Spark 1.3, och dagen efter det GPT-6 Astra från OpenAI. Tre modeller i toppskiktet på tre dygn, från tre bolag. Varje lansering kom med en egen tabell som visade att just den modellen var bäst.

Den här genomgången handlar om hur man kan kontrollera sådana påståenden, och vad de oberoende mätningarna visar just nu. Vi har tidigare skrivit om vad det innebär att förmågan samlas hos ett fåtal företag: Maktkoncentration.

Tre sätt att mäta, med tre olika svagheter

Utvecklarens egna prov

Siffrorna i lanseringsbloggen. Utförliga och färska, men bolaget väljer själv vilka prov som redovisas och vilka konkurrenter modellen jämförs mot.

Oberoende samlingsindex

En tredje part kör samma provbatteri på alla modeller och väger ihop resultatet till ett tal. Jämförbart, men indexet räknas om när proven byts ut.

Användarnas röster

Människor får två anonyma svar och väljer det bättre. Mäter vad folk föredrar, vilket är en annan sak än vad som är korrekt.

Utvecklarens egna prov. Anthropics tabell för Fable 5.1 anger 52,6 procent på Terminal-Bench-Science 0.1 mot 22,4 procent för OpenAI:s GPT-5.6 Sol. Siffran stämmer, men GPT-5.6 Sol ersattes två dygn senare av GPT-6 Astra. Jämförelsen var korrekt när den publicerades, och inaktuell inom samma vecka. Mönstret är detsamma hos alla tre bolagen: tabellen jämför mot den senaste modell som fanns när den sattes samman, och lanseringstakten gör att den perioden numera är kort.

Oberoende samlingsindex. Artificial Analysis kör samma prov på alla modeller och väger ihop dem till ett samlat tal, Intelligence Index. Enligt företagets metodbeskrivning består indexet av tio utvärderingar i fyra viktade kategorier: agentuppgifter (30 procent), allmän kunskap och långa dokument (30 procent), kodning (20 procent) och vetenskapligt resonemang (20 procent). Det är den mest jämförbara siffra som finns fritt tillgänglig.

Den har en fallgrop som är lätt att gå i. Indexet versionsnumreras och räknas om när proven byts ut, och samma modell får då ett annat tal. I en egen artikel den 2 september anger Artificial Analysis Claude Fable 5.1 till 66 och Claude Opus 5 till 63. På företagets topplista den 11 september står samma två modeller på 53 respektive 51. Däremellan, den 7 september, togs version 4.3 av indexet i bruk. Modellerna har inte blivit sämre, det är skalan som har ändrats. Siffror från olika tidpunkter går alltså inte att jämföra rakt av, inte ens när de kommer från samma källa, och ett tal som citeras utan datum säger mindre än det ser ut att göra.

Användarnas röster. LMArena låter besökare jämföra två anonyma svar och rösta. Resultatet blir en Elo-ranking av samma slag som i schack. Metoden fångar något de tekniska proven missar, nämligen om svaret duger för en människa. Den har också kritiserats. I forskningsartikeln The Leaderboard Illusion (april 2025), skriven av forskare vid bland annat Cohere Labs, Princeton, Stanford och University of Washington, hävdas att ett fåtal stora bolag får testa många privata modellvarianter och bara publicera den som gick bäst. Forskarna räknade till 27 icke offentliggjorda varianter från Meta inför en enda lansering. LMArena har svarat på kritiken och menar bland annat att artikeln utelämnar konfidensintervallen. Rankningen är alltså omtvistad, och den mäter tycke snarare än korrekthet.

Proven tar slut

Ett fjärde problem gäller alla tre metoderna. När modellerna blir tillräckligt bra slutar ett prov att skilja dem åt.

SWE-bench Verified, länge standardprovet för programmering, är det tydligaste exemplet. I februari 2026 publicerade OpenAI texten Why SWE-bench Verified no longer measures frontier coding capabilities och slutade redovisa resultat därifrån. Två skäl anges. Toppnoteringen hade planat ut och rörde sig bara några procentenheter under ett halvår, från omkring 75 till omkring 81 procent. Och en granskning av de svåraste uppgifterna visade att en majoritet av dem har felkonstruerade tester, som underkänner lösningar som fungerar.

Till det kommer ett problem som gäller provet i sig. Uppgifterna är 500 stycken hämtade ur tolv öppna Python-projekt, alltså kod som låg fritt på nätet innan modellerna tränades. Att en modell löser dem säger därför inte om den kan koda eller om den har sett facit.

Samma sak har hänt flera gånger: ett prov läggs fram, modellerna klättrar mot taket, och ett svårare prov tas fram. Terminal-Bench, SWE-bench Pro och Humanity's Last Exam är alla svar på att äldre prov slutat skilja modellerna åt. För en läsare betyder det att ett högt procenttal ska läsas tillsammans med datum och provnamn, och inte som ett betyg på modellen i stort.

Läget i september 2026

Med de reservationerna ser den oberoende rangordningen ut så här. Talen är hämtade från Artificial Analysis topplista den 11 september 2026 och avser det mest kapabla läget för varje modell.

Artificial Analysis Intelligence Index, 11 september 2026

Claude Fable 5.1 Anthropic 53
GPT-6 Astra OpenAI 53
Claude Opus 5 Anthropic 51
Muse Spark 1.3 Meta 48
GLM-5.3 Zhipu, öppna vikter 45
Kimi K3 Moonshot, öppna vikter 44
Grok 4.6 xAI 44
Gemini 3.8 Flash Google 41
DeepSeek V4.1 Flash DeepSeek, öppna vikter 40
Gemini 3.1 Pro Google 30
Mistral Medium 3.5 Mistral, öppna vikter 15

Källa: Artificial Analysis topplista, avläst 11 september 2026. Grå stapel betyder modell med öppna vikter, som går att ladda ned och köra på egen utrustning. Skalan gäller version 4.3 av indexet och är inte jämförbar med tal som publicerats tidigare.

Tre saker framgår.

Toppen är oavgjord. Claude Fable 5.1 och GPT-6 Astra står på samma tal, och Artificial Analysis anger i sin metodbeskrivning ett osäkerhetsintervall på under en indexpoäng. De två är alltså i praktiken jämnstora. På LMArenas röstbaserade lista ser ordningen annorlunda ut: där ligger fyra Anthropic-modeller och Metas Muse Spark 1.2 i topp, med åtta poängs skillnad mellan första och femte plats och överlappande felmarginaler. De två metoderna ger olika rangordningar utan att någon av dem är felaktig.

De är bra på olika saker. Anthropic redovisar de högsta talen på vetenskapliga terminaluppgifter. GPT-6 Astra är den första modell som OpenAI klassar som "Critical" i cyberförmåga, och fick enligt CSO Online full poäng på cybersäkerhetsprovet ExploitBench när de spärrar som gäller i den publika versionen var avstängda. Meta framhåller i stället kostnaden: enligt Artificial Analysis egen genomgång kostar Muse Spark 1.3 ungefär hälften så mycket per löst uppgift som de modeller som ligger på liknande nivå. Vilken som är "bäst" beror alltså på vad man ska göra.

Google ligger efter. Googles flaggskepp är fortfarande Gemini 3.1 Pro, som på företagets egen produktsida anges vara i förhandsversion, med efterföljaren 3.5 Pro beskriven som "coming soon". Fortune rapporterade den 3 september att Google levererat fyra mindre Flash-modeller på 106 dagar medan flaggskeppet uteblivit. Fortune återger också uppgifter från Wall Street Journal om att interna kandidater valts bort därför att de inte var tillräckligt mycket bättre än Flash-modellerna. Googles högsta placering på listan ovan tillhör Gemini 3.8 Flash, en snabb och billig modell avsedd för volym snarare än för toppresultat.

Utmanarna

Utöver de tre som brukar nämnas finns två grupper värda att följa.

Den ena är Meta, vars Muse Spark 1.3 ligger fyra på listan ovan och som konkurrerar på pris snarare än på topplacering.

Den andra är modellerna med öppna vikter, alltså modeller vars vikter går att ladda ned, så att modellen kan köras på egen utrustning. Här ligger kinesiska utvecklare främst. GLM-5.3 från Zhipu och Kimi K3 från Moonshot ligger åtta respektive nio indexpoäng under toppen. Det är en tydlig skillnad, men avståndet har krympt, och modellerna går att använda utan att man är beroende av ett amerikanskt bolags moln.

Europa saknas i toppen. Franska Mistral AI är den enda europeiska utvecklare som finns med på listan, och bolagets högst placerade modell, Mistral Medium 3.5, når 15 på samma index. Mistral är ett alternativ för den som vill ha öppna vikter och europeisk drift, men tävlar inte om ledningen.

Mest kapabel, eller mest tillgänglig?

Det är skillnad mellan vilka modeller som existerar och vilka man får använda, och skillnaden har vuxit under 2026.

Samtidigt med Fable 5.1 släppte Anthropic en modell som heter Mythos 5.1. Enligt bolagets egen beskrivning är det samma modell med andra spärrar, avsedd för granskade cyberförsvarare och forskare inom life science, och den är än så länge bara tillgänglig för en uppsättning organisationer i USA. OpenAI begränsar på motsvarande sätt de offensiva cybersäkerhetsfunktionerna i GPT-6 Astra till ett särskilt program. Den mest kapabla versionen av en modell är alltså inte nödvändigtvis den man kan köpa, och det är amerikanska företag som avgör vem som släpps in.

Vad betyder det för Sverige?

Ingen svensk eller europeisk modell är i närheten av toppen. Det är utgångspunkten för de beslut som ska fattas här.

Regeringen beslutade i februari 2026 om Sveriges första samlade AI-strategi, med målet att Sverige ska vara ett av världens tio ledande AI-länder. Strategin gäller användning och infrastruktur snarare än att bygga en konkurrent till modellerna ovan: en gemensam AI-verkstad för offentlig förvaltning som ska vara fullt utbyggd 2030, och arbete med svenska språkmodeller anpassade för svenska förhållanden, med en nationell samordnare tillsatt i maj 2026. Att bygga en modell i den storleksklass som listan visar är inte ett svenskt projekt, och strategin utger sig inte för att vara det.

Frågan för svensk del blir därför snarare vilka beroenden som byggs in. Den som handlar upp AI-tjänster i dag väljer i praktiken mellan ett fåtal amerikanska leverantörer och kinesiska modeller med öppna vikter som går att köra på egen eller europeisk utrustning. Det är en sådan avvägning som ligger bakom EU:s satsning på egna AI-gigafabriker, som vi skrev om i Sverige med i EU:s AI-gigafabrik.

Fråga 6 i AI-Kompassen ställer just den frågan till riksdagspartierna: vilka verktyg, om några, de vill använda för att hantera att ett fåtal, huvudsakligen amerikanska, företag ligger långt före alla andra. Fyra partier har svarat fråga för fråga. Socialdemokraterna vill arbeta via EU för sund konkurrens och för utveckling av EU-baserade alternativ. Vänsterpartiet vill se skärpt konkurrenslagstiftning, krav på öppenhet och insyn samt offentliga satsningar på alternativ och forskning. Centerpartiet vill stärka Europas konkurrenskraft genom satsningar på innovation och forskning, bland annat tre miljarder till ett nationellt AI-center i Linköping, och främja öppen data och öppen källkod. Miljöpartiet svarar att detta inte är en isolerad marknadsfråga och att nationella parlament och regeringar behöver den insyn som krävs för att fatta informerade beslut. Liberalerna svarade med en samlad text i stället för fråga för fråga, publicerad i sin helhet här. Sverigedemokraterna, Moderaterna och Kristdemokraterna har inte svarat, och är i stället bedömda utifrån sina egna riksdagsdokument.

Så här ska svaret läsas

Rangordningen ovan gäller den 11 september 2026. Tre av de fyra översta modellerna är mindre än två veckor gamla, och nästa lansering kan komma när som helst. Det som håller längre än siffrorna är mönstret: toppen består av ett fåtal amerikanska bolag som ligger tätt samlade, de kinesiska modellerna med öppna vikter ligger några poäng bakom och krymper avståndet, Google har halkat efter sin egen tidtabell och Europa är inte med i tätgruppen. Möter man ett påstående om att en viss modell är bäst är det värt att fråga vilket prov siffran kommer från, vem som har kört det och vilken dag den avser.

Läs vidare

Det här inlägget är framtaget med AI-stöd och granskat av redaktionen innan publicering. Så används AI

← Alla inlägg