Hoppa till innehåll
Service status

Skriv för att söka

Hur fungerar AI? · 3 min läsning

Språkmodeller

Hur språkmodeller tränas och svarar, kontextfönster, RAG och viktiga begränsningar.

Lärandemål

  • Förstå hur språkmodeller fungerar
  • Veta skillnaden mellan traditionell programmering och språkmodeller (se förra avsnittet för grunden)
  • Förstå vad ett kontextfönster är och varför det är viktigt
  • Känna till de viktigaste begränsningarna

I förra avsnittet pratade vi om generativ AI – nu zoomar vi in på den mest omtalade typen: språkmodeller (t.ex. ChatGPT, Claude, Gemini). Hur fungerar de – och vad behöver du veta för att använda dem effektivt?

Vad är en språkmodell?

Enkelt sagt: en språkmodell är tränad på enormt mycket text. Den förutsäger vilket ord som troligen kommer härnäst, baserat på alla ord som kommit innan – mönster den lärt sig från träningsdata.

När du skriver “Vad är huvudstaden i” lutar modellen åt att nästa ord är ett landsnamn, följt av ett svarsformat med en stad.

Moderna modeller kan svara på komplexa frågor, skriva kod, sammanfatta, översätta och resonera – men de genererar fortfarande text utifrån sannolikhet och mönster, inte mänsklig “förståelse” i ordets fulla bemärkelse.

Hur tränas en språkmodell?
  1. Datainsamling – Enorma textmängder från böcker, artiklar, webb, Wikipedia, forum m.m.

  2. Träning – Modellen lär sig mönster via neurala nätverk: vilka ord som följer varandra, hur meningar är uppbyggda, hur olika texttyper skiljer sig. Kräver massiv beräkning; miljontals parametrar justeras.

  3. Finjustering – Människor bedömer svar så modellen blir mer hjälpsam, relevant, korrekt och säker.

Resultat: en modell som kan generera flytande text om nästan vilket ämne som helst – inom ramen för sin träning och sitt kunskapsläge.

Vad är ett kontextfönster?

Kontextfönstret är den totala mängd text modellen kan arbeta med i ett svep – som korttidsminne.

Allt måste rymmas där: din fråga, tidigare meddelanden, bifogad text och modellens egna svar. Det mäts ofta i tokens (små textbitar – ord, stavelser eller tecken).

Varför spelar det roll?

  1. Långa dokument – En hel bok får sällan plats; du måste dela upp eller använda verktyg som RAG.
  2. Långa chattar – När fönstret är fullt tappar modellen de äldsta delarna (i Intric kan du få fel om kontexten är full).
  3. Samband – Mer relevant kontext i rätt ordning ger oftast bättre svar.
RAG – hur man ger modellen aktuell och omfattande kunskap

RAG står för Retrieval-Augmented Generation – ungefär “generering med stöd av framsökt information”. Retrieval betyder just framsökning: systemet letar upp de textbitar som verkar besvara din fråga, och skickar bara dem till modellen. Det gör att modellen slipper klämma in hela kunskapsbasen i prompten varje gång.

En chunk är en sådan textbit – ett stycke eller ett avsnitt ur ett dokument, litet nog att få plats i kontextfönstret men stort nog att vara begripligt på egen hand.

Så här ser kedjan ut, från uppladdat dokument till svar:

  1. Dokument laddas upp i kunskapsbanken.
  2. Chunking – dokumentet delas i mindre textbitar (chunks). Varje chunk får metadata om vilket dokument, vilken sida och vilket avsnitt den kommer från.
  3. Embeddings – varje chunk översätts till en sifferrepresentation som beskriver vad texten betyder, inte vilka ord den innehåller. Det är därför en sökning på “semester” kan hitta ett stycke som bara nämner “ledighet”.
  4. Vektorindex – alla dessa sifferrepresentationer sparas i ett sökbart register.
  5. Retrieval – din fråga översätts på samma sätt, och systemet hämtar de chunks som ligger närmast frågan i betydelse.
  6. Utvalda chunks + din fråga skickas in i kontextfönstret.
  7. Språkmodellen formulerar svaret utifrån just de bitarna.

Det är som en bibliotekarie som hämtar rätt kapitel åt dig i stället för att lägga hela hyllan på bordet.

Begränsningar för språkmodeller
  1. Kunskapsdatum – Träningen slutar vid ett datum; händelser efter det finns inte i “grundmodellen” (kopplingar till webben är ett separat lager).

  2. Hallucinationer – Modellen kan låta övertygande men fel – särskilt när den fyller luckor utan tillräckliga källor.

  3. Ingen verklig förståelse – Stark på textmönster; svag på sådant som kräver verklig erfarenhet, känsel och gemensam världsbild.

  4. Kontextbegränsning – Du är låst till kontextfönstrets storlek och hur väl rätt information faktiskt kommer med.

  5. Inkonsistens – Samma fråga kan ge något olika svar vid olika tillfällen. Modellen väljer inte alltid det allra mest sannolika ordet, utan lottar mellan de mest sannolika alternativen. Hur mycket slump som tillåts styrs av en inställning som kallas temperatur: låg temperatur ger mer förutsägbara och likartade svar, hög temperatur ger mer varierade och kreativa. Även små skillnader i hur du formulerar frågan påverkar svaret.

  • Språkmodeller förutsäger nästa ord utifrån mönster i träningsdata.
  • Kontextfönstret begränsar hur mycket som kan ingå åt gången.
  • RAG (retrieval = framsökning) delar dokument i chunks och hämtar bara de relevanta, så du slipper fylla hela dokument i prompten.
  • Viktiga risker: kunskapsdatum, hallucinationer, bristande “verklig” förståelse och variation i svar.

Testa dina kunskaper

Fråga 1 av 3

Fråga 1 av 3

Vad är den mest grundläggande förklaringen av hur en språkmodell fungerar?

Vad är den mest grundläggande förklaringen av hur en språkmodell fungerar?