Plansch VKometen

Del V · Kapitel 2

Kvalitet i drift — så vet ni att AI-systemet fortfarande gör rätt

Ett AI-system som fungerade vid lanseringen kan bli sämre utan att någon märker det. Så följer ni upp kvaliteten löpande och upptäcker problem i tid.

Av Nicolas9 min läsningUppdaterad

I det här kapitlet11 avsnitt
  1. Effekt och kvalitet är olika saker
  2. Vad som kan gå fel
  3. Fyra lager av uppföljning
  4. När kvaliteten sjunker
  5. Modellbyten
  6. Vad är tillräckligt bra?
  7. Vad uppföljningen kostar
  8. Vanliga misstag
  9. Rapportera kvaliteten
  10. Ett exempel
  11. Sammanfattning

Ett AI-system som fungerade bra vid lanseringen är inte garanterat att fungera bra om sex månader. Det är inte för att systemet slits eller glömmer, utan för att världen runt omkring förändras. Nya produkter läggs till, kunder börjar skriva på nya sätt, en leverantör byter fakturaformat, en kollega ändrar en regel i affärssystemet eller AI-leverantören uppdaterar sin modell.

Systemet fortsätter att göra samma sak, men förutsättningarna har ändrats. Om ingen följer upp kvaliteten märks det först när en kund klagar, ett fel upptäcks i bokslutet eller medarbetarna har slutat lita på systemet och börjat göra arbetet för hand igen. Det här kapitlet handlar om hur ni undviker det.

Effekt och kvalitet är olika saker

Kapitlet om att mäta effekten av AI handlar om vad systemet ger: tid, kostnad, ledtid och kvalitet i resultatet jämfört med innan. Det här kapitlet handlar om något närliggande men annorlunda: att systemet fortsätter att göra rätt, dag efter dag.

Skillnaden är viktig. Effektmått följs upp månadsvis eller kvartalsvis och används för att fatta beslut om systemet är värt det. Kvalitetsmått följs upp dagligen eller veckovis och används för att upptäcka problem innan de får konsekvenser. Ett system kan ha god effekt i genomsnitt och ändå ha ett allvarligt kvalitetsproblem i en liten del av fallen.

Vad som kan gå fel

Det hjälper att känna till de vanligaste orsakerna till att kvaliteten sjunker. De flesta går att upptäcka med enkla mått.

Det som kommer in förändras. En ny leverantör, en ny produktkategori, en kampanj som ger en ny sorts kundfrågor. Systemet möter fall det inte är byggt för och gör fel eller blir osäkert oftare.

Det som slås upp förändras. Ett fält i affärssystemet byter betydelse, en prislista uppdateras inte, ett register får dubbletter. Systemet gör rätt utifrån fel information.

Modellen förändras. AI-leverantörer uppdaterar sina modeller. Ofta blir de bättre, men inte alltid på exakt det sätt som ert flöde behöver. En instruktion som fungerade perfekt kan fungera lite annorlunda med en ny version.

Granskningen förändras. När systemet har fungerat bra länge blir granskarna mindre noggranna. Fel som tidigare fångades passerar.

Volymen förändras. Ett flöde som byggdes för 200 fall i veckan klarar kanske inte 2 000 utan att svarstider, kostnader eller köer till granskning påverkas.

Fyra lager av uppföljning

Ett bra upplägg för kvalitetsuppföljning har fyra lager, från det automatiska och dagliga till det manuella och mer sällsynta.

1. Automatiska signaler varje dag

Mått som räknas fram automatiskt och larmar när något avviker. De kräver ingen manuell insats och fångar de flesta plötsliga förändringar.

  • Andelen fall som lämnas över till granskning. Om den plötsligt ökar möter systemet något nytt. Om den plötsligt minskar kan något vara fel med hur osäkerhet bedöms.
  • Andelen ändrade förslag. Hur ofta granskarna ändrar det systemet föreslog. En ökning är ett tydligt tecken på att kvaliteten sjunker.
  • Fördelningen av resultat. Om systemet sorterar ärenden i fem kategorier, och fördelningen plötsligt ändras, kan det bero på verkliga förändringar eller på fel.
  • Tekniska fel. Misslyckade anrop, uppslag som inte hittar något, svar som tar för lång tid.

Sätt gränser för varje mått och låt någon få en signal när gränsen passeras. Gränserna behöver inte vara exakta från början. Justera dem när ni ser hur måtten brukar variera.

2. Stickprov varje vecka

Automatiska mått fångar mycket, men inte allt. Ett system kan göra fel med stor säkerhet, och då syns det inte i andelen osäkra fall.

Ta därför ett slumpmässigt urval av fall som systemet hanterade själv, utan granskning, och låt en erfaren person bedöma dem. Tjugo till femtio fall i veckan räcker ofta för att upptäcka systematiska problem. Notera vilka fel som hittas och om de följer något mönster.

3. Tester vid varje förändring

Varje gång något förändras i systemet, en instruktion, en regel, en integration eller modellen, ska det testas mot en uppsättning exempel med kända rätta svar innan förändringen går i drift. Det är samma princip som för vanlig mjukvara, och den är minst lika viktig för AI.

Testexemplen bör spegla verkligheten: vanliga fall, kända undantag och fall där systemet tidigare har gjort fel. Lägg till nya exempel när ni hittar nya typer av fel, så att samma fel inte kan komma tillbaka utan att märkas.

4. Genomgång varje månad

En gång i månaden går flödesägaren och förvaltaren igenom måtten, stickproven och de problem som har uppstått. Frågorna är enkla. Håller kvaliteten den nivå vi har bestämt? Finns det mönster i felen? Har något förändrats i verksamheten som systemet behöver anpassas till? Behöver nivån av granskning ändras?

Den här genomgången är också rätt tillfälle att besluta om förändringar i hur självständigt systemet arbetar, vilket beskrivs i kapitlet om människan i loopen.

När kvaliteten sjunker

Förr eller senare kommer ett mått att larma. Då är det bra att ha bestämt i förväg vad som händer.

  1. Skydda resultatet. Öka granskningen direkt för den typ av fall som påverkas, så att fel inte når kunder eller system medan orsaken utreds.
  2. Hitta orsaken. Titta på de fall som gick fel. Vad har de gemensamt? Började det vid en viss tidpunkt? Har något förändrats i flödet, i systemen eller i modellen?
  3. Åtgärda. Det kan vara en ny regel, en justerad instruktion, en rättning i ett register eller en förändring i hur osäkerhet bedöms.
  4. Testa. Kör testerna, med de nya felfallen tillagda, och kontrollera att kvaliteten är tillbaka.
  5. Återgå. Minska granskningen igen när måtten visar att problemet är löst.

Dokumentera varje sådan händelse kort: vad som hände, varför och vad som gjordes. Det bygger en historik som gör nästa problem lättare att lösa, och det visar att systemet förvaltas på ett ansvarsfullt sätt.

Modellbyten

AI-modeller utvecklas snabbt, och det är ofta värt att byta till en nyare modell som är bättre eller billigare. Men ett modellbyte är en förändring som kan påverka kvaliteten, och det ska hanteras som en sådan.

Kör alla testexempel med den nya modellen och jämför resultaten med den gamla. Titta inte bara på hur många som blev rätt, utan också på vilka som blev annorlunda. Ibland blir en modell bättre i genomsnitt men sämre på en viktig typ av fall. Om resultatet är bra, gå över gradvis, till exempel genom att låta den nya modellen hantera en del av fallen först och jämför.

Med en gemensam grund för alla system, som beskrivs i kapitlet om att gå från ett system till tio, kan modellbyten göras på ett ställe och testas för alla flöden samtidigt.

Vad är tillräckligt bra?

För att kunna säga att kvaliteten har sjunkit måste ni veta vilken nivå som är godtagbar. Det låter självklart, men det saknas förvånansvärt ofta.

Sätt kvalitetsmålet utifrån hur arbetet fungerade innan systemet. Hur ofta blev det fel när människor gjorde arbetet? Hur stora var felen, och hur upptäcktes de? Ett system behöver inte vara felfritt, men det bör vara minst lika bra som det gamla arbetssättet i de fall det hanterar själv, och det bör upptäcka sina egna osäkra fall.

Sätt också olika mål för olika typer av fel. Ett felsorterat ärende som hamnar i fel kö är irriterande men ofarligt. Ett felaktigt belopp i en betalning är allvarligt. Kvalitetsmålet för det senare bör vara betydligt strängare, och det bör styra hur mycket som granskas.

Skriv ner målen och gå igenom dem i den månatliga genomgången. När verksamheten förändras kan målen behöva ändras med den.

Vad uppföljningen kostar

Kvalitetsuppföljning tar tid, och den tiden ska finnas med i kalkylen. Automatiska mått kostar lite när de väl är byggda. Stickprov tar någon timme i veckan per flöde. Den månatliga genomgången tar en timme eller två. Utredningar när något går fel tar det tid de tar.

Sammantaget är det en liten del av den tid systemet frigör, men den är inte noll. Den vanligaste orsaken till att uppföljningen inte görs är att ingen har fått tid för den. Planera in den från början, och räkna med den i kalkylen för projektet.

Vanliga misstag

  • Att bara mäta vid lanseringen. Ett system som testades noggrant före driftsättning och aldrig igen kommer att bli sämre utan att någon märker det.
  • Att bara titta på genomsnitt. Ett genomsnitt kan dölja ett allvarligt problem i en liten grupp fall. Titta på fördelningar och på de fall som gick fel.
  • Att lita på att granskningen fångar allt. Granskning fångar bara det som granskas. Fall som systemet hanterar självständigt behöver stickprov.
  • Att rätta utan att testa. En snabb ändring i en instruktion kan lösa ett problem och skapa ett annat. Kör testerna varje gång.
  • Att inte spara felen. Varje fel som hittas är ett testexempel för framtiden. Om det inte sparas kan samma fel komma tillbaka.

Rapportera kvaliteten

Kvalitet som bara syns för förvaltaren är lätt att glömma. Gör den synlig.

En enkel översikt per flöde räcker: andel hanterat utan granskning, andel ändrade förslag, resultat från veckans stickprov och eventuella händelser. Visa utvecklingen över tid, så att trender syns. Dela översikten med flödesägaren varje vecka och med ledningen som en del av den löpande rapporteringen.

Synlighet har en sidoeffekt. Medarbetare som ser att kvaliteten följs upp och att problem åtgärdas litar mer på systemet. Det gör att de använder det, vilket är förutsättningen för att det ska ge effekt.

Ett exempel

Ett företag har ett system som tolkar inkommande leverantörsfakturor och föreslår kontering. Det har fungerat bra i fyra månader, med en låg andel ändrade förslag.

En måndag larmar måttet för ändrade förslag. Andelen har fördubblats på en vecka. Förvaltaren tittar på de ändrade fallen och ser att nästan alla kommer från samma leverantör. Leverantören har bytt fakturasystem, och den nya layouten placerar ordernumret på ett ställe där systemet tolkar det som ett annat fält.

Granskningen för leverantörens fakturor ökas till hundra procent direkt. Förvaltaren lägger till en regel och tre av de nya fakturorna som testexempel. Testerna går igenom, och efter några dagar med stabila mått återgår granskningen till normal nivå.

Hela händelsen tar mindre än en vecka och påverkar inga betalningar. Utan måttet hade problemet upptäckts först vid nästa avstämning, efter en månad av felkonteringar.

Vid månadsgenomgången konstaterar flödesägaren och förvaltaren att det här kommer att hända igen, eftersom leverantörer byter system då och då. De lägger till ett nytt automatiskt mått: andelen ändrade förslag per leverantör, inte bara totalt. Nästa gång en leverantör byter format larmar det redan efter några fakturor.

Sammanfattning

  • Ett AI-system blir inte sämre av sig självt, men världen runt omkring förändras. Kvaliteten måste följas löpande.
  • Skilj på effekt, som följs upp för att fatta beslut, och kvalitet, som följs upp för att upptäcka problem.
  • Bygg uppföljningen i fyra lager: automatiska signaler varje dag, stickprov varje vecka, tester vid varje förändring och en genomgång varje månad.
  • Bestäm i förväg vad som händer när kvaliteten sjunker: skydda, hitta orsaken, åtgärda, testa, återgå.
  • Hantera modellbyten som en förändring som ska testas, inte som en uppgradering som sker av sig själv.
  • Gör kvaliteten synlig. Det bygger förtroende och ger effekt.
Slut på kapitel 2

Vanliga frågor

Varför blir ett AI-system sämre över tid?
Oftast för att omvärlden förändras. Nya produkter, nya kundgrupper, nya format från leverantörer, ändrade regler eller en uppdaterad modell. Systemet gör samma sak som tidigare, men det som kommer in är annorlunda. Därför behöver kvaliteten följas löpande, inte bara vid lansering.
Hur ofta ska vi kontrollera kvaliteten?
Automatiska mått varje dag, stickprov varje vecka och en genomgång med flödesägaren varje månad är en rimlig rytm för de flesta flöden. Flöden med stor påverkan kan behöva tätare kontroll, särskilt i början.
Vem ska ansvara för kvaliteten?
Flödesägaren ansvarar för att kvaliteten är tillräcklig, och förvaltaren för att den mäts och att problem åtgärdas. Granskarna bidrar med rättelser och iakttagelser. Det viktiga är att någon har uppgiften, annars blir den inte gjord.
Vad gör vi om kvaliteten plötsligt sjunker?
Öka granskningen direkt, så att fel inte når kunder eller system, och ta reda på orsaken. Ofta är det en förändring någonstans i flödet. När orsaken är åtgärdad och testerna visar att kvaliteten är tillbaka kan granskningen minskas igen.

Om skribenten

Nicolas · Grundare, Luniat

Nicolas grundade Luniat i Stockholm och bygger AI-system som tar bort manuellt arbete i företag.