Kostnadsoron: räkna först, oroa er sedan

Så räknar ni ut vad ett AI-svar kostar på en kvart, med tokens förklarade på vanlig svenska, ett räkneexempel och tre sätt att hålla kostnaden nere.

Kort sagt

  • En token är ungefär en del av ett ord, och leverantörerna tar betalt per miljon tokens in och ut.
  • Räkna tokens in och ut för ett typiskt svar, multiplicera med priset och med antalet svar per månad.
  • Jämför med vad arbetet kostar i dag, inte med noll.
  • Korta prompter och svar, använd mindre modeller där de räcker, och sätt ett månadstak med varning.
I den här artikeln · 6 avsnitt
  1. 01Vad är en token?
  2. 02Hur räknar man ut vad ett AI-svar kostar?
  3. 03Är det dyrt?
  4. 04Vad gör AI-kostnaden högre än den behöver vara?
  5. 05Hur sänker man kostnaden?
  6. 06Hur sätter man ett kostnadstak?

”Men vad kommer det att kosta när alla kunder använder det?”

Frågan kommer alltid, ofta från ekonomichefen och ofta i slutet av ett möte som annars gick bra. Ingen i rummet vet svaret. Någon har läst att AI är dyrt. Någon annan har hört att det är nästan gratis. Mötet slutar med att teamet ska ”ta fram en kostnadsbild”, och det blir ett nytt skäl att vänta.

Det här är det enklaste av alla hinder att ta sig förbi. Det tar en kvart, ungefär lika lång tid som mötet ägnade åt att undra.

Vad är en token?

En token är den enhet en AI-modell läser och skriver i. Det är ungefär en del av ett ord: korta vanliga ord är ofta en token, längre ord delas upp i flera. Som tumregel motsvarar tusen tokens ungefär 500–700 svenska ord; svenska kräver ofta fler tokens per ord än engelska, och det varierar mellan modeller.

Leverantörerna tar betalt per miljon tokens, och nästan alltid med två priser:

  • Tokens in: allt ni skickar till modellen. Instruktionerna (prompten), dokumenten den ska läsa och frågan.
  • Tokens ut: svaret modellen skriver. Det är oftast flera gånger dyrare per token än det som går in.

Hur räknar man ut vad ett AI-svar kostar?

Ta ett typiskt svar och räkna i fyra steg. Exemplet nedan använder påhittade, runda priser för att visa metoden. Använd er leverantörs aktuella prislista när ni räknar på riktigt.

Steg Exempel
1. Tokens in per svar Prompt 1 000 + dokument 2 000 + fråga 100 = cirka 3 100 tokens
2. Tokens ut per svar Ett svar på drygt 200 ord, cirka 300 tokens
3. Pris per miljon (exempel) 30 kr in, 150 kr ut
4. Kostnad per svar 3 100 × 30 / 1 000 000 + 300 × 150 / 1 000 000 ≈ 0,14 kr

Fjorton öre per svar, i det här exemplet. Det är mindre än kaffet handläggaren dricker medan hen läser svaret. Multiplicera sedan med hur många svar ni räknar med:

  • 1 000 svar om dagen blir cirka 140 kr om dagen, eller drygt 4 000 kr i månaden.
  • 100 svar om dagen blir drygt 400 kr i månaden.

Är det dyrt?

Det beror på vad ni jämför med. Jämför inte med noll, jämför med hur arbetet görs i dag.

Om ett svar i kundtjänst tar fyra minuter att skriva för hand, och AI:n gör ett förslag som tar en halv minut att granska, har ni sparat tre och en halv minut. Med en personalkostnad på 500 kr i timmen är det ungefär 29 kr i sparad tid per svar, mot fjorton öre för AI-svaret i exemplet.

Siffrorna blir olika för er, men förhållandet brukar se ut ungefär så: AI-kostnaden per svar är liten jämfört med den tid den sparar. Det är sällan kostnaden per svar som är problemet. Det är att ingen har räknat.

Vad gör AI-kostnaden högre än den behöver vara?

Tre saker brukar driva upp kostnaden i onödan:

  • Långa prompter. Varje rad i prompten skickas med i varje fråga. En prompt som vuxit till tre sidor kostar vid varje svar. Städa den, som i Prompten som ingen vågar röra.
  • Långa svar. Tokens ut är dyrast. ”Svara med högst tre meningar” sänker kostnaden och gör ofta svaren bättre.
  • För stor modell. Den största modellen behövs sällan för att sortera ärenden eller hitta ett ordernummer. En mindre modell kan vara många gånger billigare och snabbare.

Hur sänker man kostnaden?

I den här ordningen:

  1. Mät först. Logga tokens in och ut för varje svar, så att ni vet var kostnaden faktiskt ligger.
  2. Korta ner prompten och svaren.
  3. Använd en mindre modell för enkla uppgifter, men bara om den klarar samma testfrågor. Testa precis som när ni byter modell, se Vi väntar på nästa modell.
  4. Utnyttja cachning. Många leverantörer gör det billigare att skicka samma inledning av prompten om och om igen. Lägg det som är likadant i varje fråga först.

Hur sätter man ett kostnadstak?

Bestäm en månadsbudget, och se till att ni märker i god tid om den håller på att överskridas:

  • Varning när halva budgeten är förbrukad före halva månaden.
  • Billigare läge nära gränsen: kortare svar, mindre modell för det som inte är kritiskt.
  • Stopp vid gränsen, med ett tydligt meddelande, eller ett beslut om att höja taket.

Med ett tak på plats är kostnaden inte längre en okänd risk. Det är en budgetpost, som vilken annan som helst.

Hur kostnaden följs upp per kund och per prompt, och hur cachning och val av modell räknas i detalj, beskrivs i Cost and latency på engelska.

Läs härnäst →Få med juristen, säkerhetschefen och ledningenVåga hela vägen · Nr 10 · 6 min

Vanliga frågor

Vad kostar ett AI-svar?
Det beror på modellen och på hur mycket text som skickas och kommer tillbaka. Räkna antalet tokens in och ut för ett typiskt svar och multiplicera med leverantörens pris per miljon tokens. För de flesta kundtjänst- och interna assistenter landar det på ören till någon krona per svar.
Vad är en token?
Den enhet AI-modeller läser och skriver i, ungefär en del av ett ord. Som tumregel motsvarar tusen tokens ungefär 500–700 svenska ord, men det varierar med språk och modell. Leverantörerna tar betalt per miljon tokens, ofta med olika pris för text in och text ut.
Hur sänker man kostnaden för AI?
Korta ner prompten och svaren, använd en mindre modell för enkla uppgifter, och utnyttja leverantörens cachning av återkommande text. Mät först, så att ni vet vilken del av kostnaden ni faktiskt kan påverka.