Del 5 · Kapitel 1
Så mäter ni effekten av AI — och visar vad den är värd
Vilka siffror som visar om ett AI-system faktiskt gör nytta, hur ni sätter en baslinje innan ni börjar och hur ni räknar fram värdet för ledningsgruppen.
Ett AI-system som ingen kan visa värdet av kommer förr eller senare att stängas av eller glömmas bort. Det spelar ingen roll hur väl det fungerar — utan siffror finns inget underlag för att behålla det, förbättra det eller bygga nästa. Det här kapitlet handlar om vad ni ska mäta, hur ni sätter en baslinje innan ni börjar och hur ni räknar fram ett värde som en ledningsgrupp litar på.
Varför mätningen så ofta saknas
Det är förvånansvärt vanligt att AI-projekt saknar mätning. Det beror sällan på slarv, utan på tre saker.
Ingen mätte före. När projektet startade var fokus på att få tekniken att fungera. Ingen tänkte på att dokumentera hur lång tid flödet tog innan. När systemet väl är i drift finns inget att jämföra med.
Det som mäts är fel saker. Antal användare, antal frågor till en chattbot eller antal genererade texter är lätta att mäta men säger ingenting om nyttan. Ett system som används mycket kan ändå spara lite tid, och ett som används sällan kan spara mycket.
Effekten sprids ut. Om tio personer sparar tjugo minuter var om dagen, märks det inte i någon enskild budget. Tiden försvinner in i andra uppgifter, och efter några månader minns ingen hur det var innan.
Alla tre går att undvika med lite planering i början.
Fyra typer av mått
Ett AI-system i ett verksamhetsflöde bör följas upp med fyra typer av mått. Inget av dem räcker ensamt.
1. Tid
Hur lång tid tar ett ärende från början till slut, och hur mycket av den tiden är arbete? Mät både:
- Arbetstid per ärende: den tid människor faktiskt lägger, inklusive granskning av systemets förslag.
- Ledtid: tiden från att ärendet kommer in till att det är klart. Den påverkar kunder och andra led, och förbättras ofta mer än arbetstiden.
2. Kvalitet
Sparad tid är inget värt om kvaliteten sjunker. De viktigaste kvalitetsmåtten är:
- Godkännandegrad: andelen förslag som godkänns utan ändring, med små ändringar respektive skrivs om helt. Det här är det enskilt bästa måttet på hur väl systemet fungerar.
- Felfrekvens: fel som upptäcks efter att ärendet är klart — reklamationer, rättelser, omtag.
- Kundupplevelse där flödet påverkar kunder: nöjdhet, svarstider, klagomål.
3. Volym
Hur många ärenden hanteras per vecka, och hur stor del går genom systemet? Volymen visar om systemet faktiskt används, och gör det möjligt att räkna från tid per ärende till total besparing.
4. Kostnad
Vad kostar systemet att driva? Licenser, modellanvändning, förvaltning och den tid ägaren lägger på uppföljning. Utan kostnadssidan blir kalkylen ofullständig — och ingen ekonomichef kommer att godta den.
Sätt baslinjen innan ni börjar
Den viktigaste mätningen görs innan systemet byggs. Utan den finns inget att jämföra med.
För det flöde ni har valt, mät under två till fyra veckor:
- Antal ärenden per vecka.
- Arbetstid per ärende — antingen genom att be medarbetarna logga tid för ett urval, eller genom data från ärendehanterare och system.
- Ledtid från start till klart.
- Antal fel, omtag eller reklamationer.
Det behöver inte vara perfekt. Ett urval på femtio ärenden där tiden har mätts ordentligt är bättre än en uppskattning över hela året. Dokumentera hur ni mätte, så att ni kan mäta på samma sätt efteråt.
Om ni redan har startat utan baslinje går det att rekonstruera den, till exempel genom att mäta ärenden som av någon anledning inte går genom systemet, eller genom historiska data. Var öppen med att jämförelsen då är ungefärlig.
Baslinjen är också en del av kartläggningen som beskrivs i kapitlet om att hitta det manuella arbetet — den som har räknat på flödena där har redan en god start.
Följ upp i drift
När systemet är i drift, följ samma mått som i baslinjen, på samma sätt. Lägg till de mått som bara finns när systemet körs:
- Godkännandegrad över tid. Den ska öka de första veckorna när instruktionerna förbättras, och sedan ligga stabilt. Sjunker den, har något förändrats — underlaget, flödet eller modellen.
- Andel ärenden som hanteras utan mänsklig inblandning, om ni har kommit dit.
- Typ av ändringar som människor gör i förslagen. Det är den bästa källan till förbättringar av instruktionerna.
Följ måtten varje vecka den första tiden och sedan varje månad. Gör det till en fast punkt för den som äger flödet, inte en engångsrapport.
Det här hänger ihop med kvalitetskontrollen som beskrivs i kapitlet om att gå från pilot till drift: testfallen fångar fel innan förändringar tas i bruk, uppföljningen fångar det som händer i verkligheten.
Från mått till värde
Ledningsgruppen vill sällan ha fyra typer av mått. De vill veta om systemet är värt pengarna. Så här räknar ni fram ett värde som håller för granskning.
Sparad arbetstid per år. (Arbetstid per ärende före − arbetstid per ärende efter) × antal ärenden per år. Räkna med granskningstiden i "efter".
Värdet av den sparade tiden. Här är det lätt att överdriva. Sparad tid är bara sparade pengar om den antingen används till något annat som skapar värde, eller om ni slipper anställa för att hantera en växande volym. Redovisa därför sparad tid och vad den faktiskt används till som två separata saker.
Värdet av kortare ledtid. Svårare att räkna på, men ofta större. Snabbare offertsvar kan ge fler affärer, snabbare fakturering ger bättre kassaflöde, snabbare kundsvar minskar avhopp. Uppskatta försiktigt och redovisa antagandena.
Värdet av färre fel. Kostnaden för ett fel — rättelse, kompensation, förlorad kund — gånger antalet fel som undviks.
Kostnaden för systemet. Drift, licenser, förvaltning och ägarens tid.
Det viktigaste med kalkylen är inte att den är exakt, utan att den är ärlig. En försiktig kalkyl som håller är mer värd än en optimistisk som någon kan plocka isär.
Exempel på mått per typ av flöde
Vilka mått som är viktigast beror på flödet. Några vanliga exempel:
Inkommande förfrågningar och kundärenden.
- Tid till första svar och tid till löst ärende.
- Andel ärenden som sorteras till rätt mottagare direkt.
- Andel svarsförslag som skickas utan ändring.
- Kundnöjdhet och antal ärenden som öppnas igen.
Fakturor och ekonomiflöden.
- Tid per faktura från mottagen till attesterad.
- Andel fakturor som konteras rätt utan manuell rättelse.
- Antal betalningar som försenas eller blir fel.
Offerter och underlag.
- Tid från förfrågan till skickad offert.
- Antal offerter per säljare och vecka.
- Andel underlag som behöver kompletteras efter att de skickats.
Innehåll och texter.
- Ledtid från brief till publicering.
- Kostnad per publicerad enhet.
- Andel texter som godkänns utan större ändringar — samma mått som vi använder i kapitlet om att skala innehållsproduktion.
Välj två till fyra mått per flöde. Fler än så blir sällan uppföljda.
Så sätter ni mål
Mått utan mål blir lätt en rapport som ingen agerar på. Sätt därför mål för varje flöde innan systemet går i drift — men sätt dem i rätt ordning.
Först kvalitet, sedan tid. Det första målet ska vara att systemets förslag håller samma kvalitet som det mänskliga arbetet. Först när det är uppnått är det meningsfullt att mäta hur mycket tid som sparas. Ett system som sparar mycket tid men gör fler fel är en kostnad, inte en besparing.
Mål som går att nå. Ett rimligt första mål kan vara att godkännandegraden når en nivå ni har bestämt i förväg efter sex veckor, och att arbetstiden per ärende minskar med en bestämd andel efter tre månader. Utgå från baslinjen när ni sätter nivåerna, inte från vad andra säger sig ha uppnått.
Mål som går att påverka. Ägaren av flödet ska kunna göra något åt måttet — ändra instruktioner, lägga till testfall, förbättra underlaget. Mål som beror på saker utanför flödet, som total försäljning, är svåra att följa upp och lätta att bortförklara.
Ett enkelt veckomått
Om ni bara orkar följa ett mått varje vecka, välj det här: andelen förslag som godkändes utan större ändringar, och antalet ärenden. Skriv upp båda i en enkel tabell vecka för vecka.
Det säger nästan allt ni behöver veta i vardagen. Stiger andelen, blir systemet bättre. Sjunker den, har något förändrats och behöver undersökas. Sjunker antalet ärenden, används systemet mindre — och då vill ni veta varför.
De mer omfattande måtten — tid, ledtid, kostnad och värde — räcker det att räkna fram varje månad eller kvartal.
Vanliga misstag
Att mäta aktivitet i stället för effekt. "Systemet har genererat 4 000 texter" säger ingenting. "Ledtiden från brief till publicering har gått från tre veckor till fyra dagar" säger något.
Att räkna all sparad tid som pengar. Det gör kalkylen orimlig och undergräver förtroendet för resten av siffrorna.
Att glömma granskningstiden. Ett system som skriver ett utkast på tio sekunder men kräver tjugo minuters granskning har inte sparat lika mycket som det ser ut.
Att bara mäta en gång. Kvaliteten kan sjunka över tid när underlaget, flödet eller modellen förändras. Löpande uppföljning fångar det.
Att inte dela resultatet. Om bara projektgruppen känner till siffrorna, får ingen annan i organisationen veta att det fungerar — och nästa flöde blir svårare att få igenom.
När siffrorna är dåliga
Ibland visar mätningen att systemet inte gör den nytta ni hoppades. Det är inte ett misslyckande — det är precis därför ni mäter. Det viktiga är att ta reda på varför, och det finns oftast en av fyra förklaringar.
Underlaget räcker inte. Systemet saknar information som en människa har tillgång till: historik i ett annat system, kunskap om kunden, regler som aldrig har skrivits ner. Lösningen är att ge systemet tillgång till underlaget, eller att avgränsa flödet till de ärenden där underlaget finns.
Instruktionerna är otydliga. Titta på de förslag som skrivs om helt. Har de något gemensamt? Ofta handlar det om en typ av ärende eller ett undantag som instruktionerna inte täcker. Lägg till det, och lägg till ett testfall.
Granskningen tar för lång tid. Om det tar nästan lika lång tid att granska ett förslag som att göra arbetet själv, sparas ingen tid. Se över hur förslagen presenteras: visas underlaget bredvid, är det lätt att se vad systemet har ändrat, går det att godkänna med ett klick?
Flödet passar inte. Det händer att ett flöde visar sig ha fler undantag, större variation eller högre kostnad för fel än kartläggningen visade. Då är det bättre att avbryta, dokumentera vad ni lärde er och gå vidare till nästa flöde i listan, än att fortsätta lägga tid på något som inte bär.
Oavsett förklaring: redovisa det öppet. En organisation som ser att dåliga resultat leder till förbättringar, inte till skuldfördelning, blir bättre på att använda AI.
Rapportera till ledningsgruppen
En bra uppföljning till ledningen ryms på en sida:
- Flödet och vad systemet gör, i en mening.
- Före och efter för tid, ledtid och kvalitet, med baslinjen tydligt angiven.
- Volym och hur stor del som går genom systemet.
- Nettovärde per år, med antagandena redovisade.
- Nästa steg: vad som ska förbättras och vilket flöde som står på tur.
Den sista punkten är viktigast. En uppföljning som bara visar att något fungerar är bra. En som också föreslår nästa steg, med samma typ av kalkyl, är det som gör att arbetet fortsätter. Hur ni går vidare till fler flöden och marknader tar vi upp i delen om att skala.
Sammanfattning
Ett AI-system som inte mäts kommer förr eller senare att ifrågasättas. Mät tid, kvalitet, volym och kostnad. Sätt en baslinje innan ni börjar, och följ samma mått på samma sätt i drift. Godkännandegraden — hur ofta förslagen godkänns utan ändring — är det bästa enskilda måttet på hur väl systemet fungerar. Räkna fram värdet försiktigt, skilj på sparad tid och sparade pengar, och avsluta varje uppföljning med ett förslag på nästa steg.