När AI:n har fel: bygg för misstag i stället för att frukta dem

AI kommer att svara fel ibland. Så bygger ni ett skyddsnät med människan i loopen, ett sätt att rätta och en fel-logg som gör varje fel till ett test.

Kort sagt

  • AI:n kommer att svara fel ibland. Det som avgör är om felet fångas, går att rätta och kommer tillbaka.
  • Börja med människan i loopen: AI:n föreslår, en människa godkänner.
  • Svar om pengar, löften och känsliga ämnen granskas alltid, med regler i koden snarare än instruktioner i prompten.
  • Gör varje fel till ett nytt testfall, och släpp granskningen typ för typ när siffrorna säger att ni kan.
I den här artikeln · 7 avsnitt
  1. 01Kommer AI:n att svara fel?
  2. 02Vad är ett skyddsnät för AI?
  3. 03Hur fungerar människan i loopen?
  4. 04Vilka svar ska alltid granskas?
  5. 05Hur rättar man ett AI-svar som redan har gått ut?
  6. 06Hur ser man till att samma fel inte kommer tillbaka?
  7. 07När kan man släppa granskningen?

Kundtjänstchefen Lena har ett ord för det som hände förra månaden: ”kaffeincidenten”.

AI-assistenten skulle svara på en fråga om en försenad kaffemaskin. Den lovade kunden en rabattkod på 20 procent. Det finns ingen sådan rabattkod. Kunden blev glad, sedan förvirrad, sedan arg, och skrev ett omdöme med rubriken ”Rabattkoden som inte fanns”. Det blev årets mest lästa omdöme.

Det intressanta är vad som hände sedan. Teamet stängde inte av assistenten. Inom en dag hade de lagt till en regel om att svar som nämner rabatter alltid granskas av en människa. Samma eftermiddag skrev de tre nya testfall om rabatter. Veckan efter visade testerna att assistenten inte längre lovade något den inte fick.

Det fanns ett fel, och det kom inte tillbaka. Det är så det ska se ut.

Kommer AI:n att svara fel?

Ja. Det är det enda säkra svaret, och det är bättre att utgå från det än att hoppas på motsatsen. Precis som en ny medarbetare kommer den ibland att missförstå, gissa eller lova för mycket. Skillnaden är att den gör det snabbare, och utan att rodna.

Skillnaden mellan ett AI-projekt som fungerar och ett som stängs ner är sällan hur ofta det blir fel. Det är vad som händer sedan: om felet fångas innan kunden ser det, om det går att rätta, och om det kommer tillbaka.

Vad är ett skyddsnät för AI?

Ett skyddsnät är allt som gör att ett fel blir ofarligt. Det har fyra delar, och ni behöver inte alla från dag ett:

Del Vad den gör När ni behöver den
Människan i loopen En person ser svaret innan det får effekt Från början, särskilt för kundsvar
Rätta och ångra Det går att ändra eller dra tillbaka ett svar Så fort svar går direkt till någon
Vägen till en människa Användaren kan alltid få prata med en person Alltid, i allt som kunder ser
Fel-loggen Varje fel sparas och blir ett nytt testfall Från början

Hur fungerar människan i loopen?

Människan i loopen betyder att AI:n föreslår och en människa bestämmer. I kundtjänst ser handläggaren ett färdigt förslag på svar, ändrar det om det behövs och skickar det. AI:n gör det tråkiga, människan står för omdömet.

Det låter långsamt, men är det sällan. Att läsa och godkänna ett bra förslag tar några sekunder. Att skriva svaret från början tar minuter. Ni sparar fortfarande det mesta av tiden, och ni slipper att kunderna drabbas av felen.

Ännu bättre: varje gång en människa ändrar ett förslag får ni gratis information. Om handläggarna ändrar varannan rabattfråga vet ni precis var assistenten behöver bli bättre.

Vilka svar ska alltid granskas?

Även när ni har vågat släppa granskningen för de enkla ärendena finns det svar som alltid ska ses av en människa. Gör en lista och bygg in den som regler, inte som en instruktion till AI:n:

  • Pengar: rabatter, återbetalningar, priser som inte står i prislistan.
  • Löften: leveransdatum, garantier, undantag från villkoren.
  • Känsliga ämnen: hälsa, juridik, klagomål på personal, hot.
  • Allt AI:n inte är säker på, om ni kan mäta det, till exempel när den inte hittat något stöd i underlaget.

En regel i koden fungerar alltid. En instruktion i prompten fungerar för det mesta. För de här kategorierna räcker inte ”för det mesta”.

Hur rättar man ett AI-svar som redan har gått ut?

Det beror på var svaret hamnade, men principen är densamma: det ska gå snabbt och det ska vara någons uppgift.

  • Ett mejl eller chattsvar: skicka ett kort, ärligt rättelsemeddelande. ”Vi gav dig fel uppgift om leveranstiden. Rätt är …” fungerar bättre än man tror.
  • Något som sparats i ett system: gör det möjligt att se vilka poster AI:n har ändrat, och att ändra tillbaka dem.
  • Något som publicerats: ha en rutin för att ta ner och rätta, precis som för vilket annat fel som helst.

Det viktigaste är att någon äger det. Mer om det i Vem äger AI-funktionen när den är i drift?

Hur ser man till att samma fel inte kommer tillbaka?

Varje fel som upptäcks ska bli ett nytt testfall. Det är den enskilt viktigaste vanan i hela projektet.

Felet med rabattkoden blir en ny rad i testlistan: frågan om den försenade kaffemaskinen, och regeln att svaret inte får innehålla ”rabattkod”. Nästa gång någon ändrar prompten körs testet, och om felet kommer tillbaka märks det innan någon kund ser det. Hur testlistan fungerar beskrivs i Ert första test av AI-svaren.

Efter några månader har ni en testlista som består av era egna, verkliga misstag. Det är den mest värdefulla testlistan ni kan ha.

När kan man släppa granskningen?

När siffrorna säger det, och då typ för typ. Om handläggarna godkänner 98 av 100 förslag om leveranstider utan ändringar, kan leveranstidsfrågor börja gå direkt till kunden. Rabattfrågor, där de ändrar vart tredje svar, behåller granskningen.

Det är inte allt eller inget. De flesta väl fungerande AI-funktioner har en blandning: det enkla går direkt, det svåra granskas, det känsliga granskas alltid. Ribban för varje typ bestämmer ni som i Hur bra är bra nog?

Den tekniska sidan av skyddsnätet, med godkännanden som överlever omstarter och verktyg som bara får göra det de ska, beskrivs i Agents in production på engelska.

Läs härnäst →Prompten som ingen vågar röraVåga hela vägen · Nr 06 · 5 min

Vanliga frågor

Hur hanterar man att en AI-assistent svarar fel?
Genom att bygga för det i förväg. Låt en människa granska svaren i början, gör det enkelt att rätta och att nå en människa, logga varje fel och gör varje fel till ett nytt testfall så att det inte kommer tillbaka.
Vad betyder människan i loopen?
Att en människa granskar eller godkänner AI:ns förslag innan de får effekt, till exempel innan ett svar skickas till en kund. Det är det enklaste sättet att släppa tidigt utan att kunderna drabbas av felen.
När kan man ta bort den mänskliga granskningen?
När ni har mätt att svaren nästan aldrig behöver ändras, för just den typen av ärenden. Ta bort granskningen stegvis, typ för typ, och behåll den för det som är svårt eller känsligt.