PROT. 2026/27:5·MODELLJÄMFÖRELSE
Behövs en egen modell när GPT finns?
Rimlig fråga om vilken finjusterad modell som helst: varför träna en egen när man kan ringa ett API? Så jag lät min 110-miljonersmodell och sex frontier-LLM göra exakt samma sak, klassificera parti från riksdagstal, och mätte både träffsäkerhet och vad varje klassificering kostar. Min modell kom sist. Det är ändå rätt modell för jobbet, och siffrorna förklarar varför.
320 anföranden med känt parti, 40 per parti, alla hållna av de 146 talare som hölls utanför träningen. Det är modellens eget osedda testset, och att det verkligen är osett är kontrollerat: modellen träffar rätt på 99,5 % för talare den tränats på, men 59,1 % för de här. Den skillnaden är beviset på att det inte läcker. Alla sju fick exakt samma text, KB-BERT:s eget 512-token-fönster: ingen LLM fick mer av anförandet än den lilla modellen fysiskt kan läsa. KB-BERT kör lokalt, de sex LLM:erna via API med faktisk tokenkostnad uppmätt.
| Modell | Träffsäkerhet | Macro-F1 | Kostnad / 1000 |
|---|---|---|---|
| GPT-5.5 | 0.762 | 0.760 | $3.73 |
| Claude Opus 4.8 | 0.719 | 0.718 | $5.62 |
| Gemini 3.1 Pro | 0.677 | 0.679 | $3.76 |
| DeepSeek V4 Pro | 0.659 | 0.664 | $0.37 |
| Grok 4.3 | 0.656 | 0.657 | $1.09 |
| Qwen 3.6 Plus | 0.644 | 0.654 | $0.25 |
| KB-BERT (110M, lokal) | 0.591 | 0.606 | $0.00 |
Slumpbaslinje för 8 partier: 0.125. KB-BERT klarade sina 320 klassificeringar på drygt tre minuter lokalt, utan ett enda API-anrop. På sitt fulla testset ligger modellen på 0.628 i träffsäkerhet och 0.619 i macro-F1; siffrorna här är något lägre för att urvalet är balanserat och alla fick samma korta fönster. Två modeller lämnade enstaka svar som inte gick att tolka: Gemini fyra stycken, DeepSeek tre, av sina 320 vardera. De räknas inte som fel utan är uteslutna ur modellens nämnare, och därför står de på 316 respektive 317 svar.
Frontier-modellerna vinner på träffsäkerhet, hela vägen ner. GPT-5.5 ligger 17 procentenheter över min modell, och även de billigaste, Qwen och DeepSeek, ligger några enheter över.
Men träffsäkerhet är inte det enda man betalar för. Den bästa modellen, GPT-5.5, kostar nästan fyra dollar per tusen klassificeringar och kräver ett API-anrop per anförande. KB-BERT kostar noll och svarar på millisekunder, på samma maskin som kör resten av pipelinen.
Frågan är inte bara vem som är mest träffsäker, utan vad man byter bort. Det handlar inte om integritet här; riksdagens protokoll är offentliga. Det handlar om kostnad och drift. Den här sajten läser in nya anföranden varje vecka och bygger om analysen på hela korpusen. Att skicka varje anförande till ett API i det tempot kostar pengar som växer med materialet, och lägger till ett externt beroende och en nätverksrunda för en uppgift som annars kör på en enda maskin. En modell som ligger några procentenheter under men kör gratis är då rätt val: skillnaden är inte värd priset.
En sak till talar för den lilla modellen, som tabellen inte visar: frontier-modellerna är tränade på i princip hela webben, riksdagens protokoll inkluderat. En del av deras försprång kan alltså vara igenkänning av text de redan sett, inte generalisering. KB-BERT såg aldrig de här talarna.
Ska du bara klassificera enstaka texter, eller väger träffsäkerheten tyngre än kostnaden, då är API-anropet rätt val.
Systerstudien vänder på instrumentet: där är LLM:erna författare och KB-BERT domare. Vilket parti skriver språkmodellerna som?