Släpp till tio användare först
Det säkraste sättet att släppa en AI-funktion är i små steg. Skuggläge, tio användare, en avstängningsknapp och ett datum för nästa steg.
Kort sagt
- Ett släpp är en trappa, inte en dag: skuggläge, tio användare, en liten andel kunder, alla.
- Skuggläge ger er hundratals riktiga ärenden att mäta på, utan att någon kund påverkas.
- En provad avstängningsknapp gör varje steg ofarligt, eftersom ett problem tar en minut att stoppa.
- Bestäm vad som ska vara sant för nästa steg innan ni tar det här, så att det försiktiga släppet inte blir permanent.
I den här artikeln · 6 avsnitt
Tänk er två team med samma AI-assistent.
Det första teamet släpper den till alla kunder en tisdag morgon. På eftermiddagen kommer de första klagomålen. Assistenten svarar på engelska när kunderna skriver svenska med stavfel. Teamet stänger av den på onsdagen, och nästa gång någon föreslår AI i ledningsgruppen säger någon: ”Vi provade ju det. Det fungerade inte.”
Det andra teamet låter samma assistent gå i bakgrunden i två veckor, utan att någon kund ser svaren. Sedan släpper de den till tio kollegor i kundtjänst, som ser förslagen och väljer om de vill använda dem. De upptäcker problemet med språket på andra dagen, rättar det och lägger till fem nya testfrågor. En månad senare används assistenten av hela kundtjänsten, och ingen kund har märkt något annat än snabbare svar.
Samma teknik. Det enda som skilde var hur de släppte den.
Släppet är inte en dag, det är en trappa
Det som gör ett stort släpp så skrämmande är att allt står på spel samtidigt. Om något är fel drabbas alla, på en gång, och ni får veta det av kunderna.
Ett släpp i steg vänder på det. Varje steg är litet nog att ett fel är ofarligt, och ger er något att lära er innan nästa. Trappan ser ut ungefär så här:
| Steg | Vem ser AI:ns svar? | Vad ni lär er |
|---|---|---|
| 1. Skuggläge | Ingen | Hur ofta AI:n hade gjort rätt, på riktiga ärenden |
| 2. Tio interna | Tio kollegor, som förslag | Hur förslagen fungerar i verkligt arbete |
| 3. Liten andel kunder | Fem procent, med möjlighet att nå en människa | Hur kunderna reagerar |
| 4. Alla | Alla | Att det håller i stor skala |
Ni behöver inte gå igenom alla steg för varje funktion. Men ju större risken är, desto fler steg är värda att ta.
Steg 1: Skuggläge
Skuggläge betyder att AI:n gör jobbet men att ingen ser resultatet. Varje nytt kundmejl går både till kundtjänst som vanligt och till assistenten. Assistentens svar sparas, men skickas inte.
Efter en vecka eller två har ni något ovärderligt: hundratals riktiga ärenden där ni kan jämföra vad AI:n föreslog med vad en människa faktiskt svarade. Det är det bästa underlaget ni någonsin kommer att få för att se om ni når ribban från Hur bra är bra nog?, och det har inte kostat en enda kund något.
Skuggläget hittar också sådant som testfrågorna missade. Riktiga användare skriver på sätt ni inte föreställt er. Lägg varje sådant fynd till er testlista från Ert första test av AI-svaren.
Steg 2: Tio användare, som förslag
Välj tio personer som arbetar med uppgiften varje dag, gärna några som är nyfikna och några som är skeptiska. Den mest skeptiska är ofta den mest värdefulla: hen hittar felen ni helst inte vill höra om, och blir assistentens bästa ambassadör den dag hen ändrar sig. Låt AI:n föreslå svar som de kan använda, ändra eller strunta i.
Det här steget lär er tre saker som inget test kan:
- Hur ofta förslagen används som de är, ändras lite eller kastas. Det är den ärligaste siffran ni kan få.
- Vad som irriterar. Ofta små saker: svaret är för långt, tonen för formell, förslaget kommer för sent.
- Om det faktiskt sparar tid. Det är det enda som spelar roll för verksamheten.
Prata med de tio. En kort avstämning varje vecka, där ni frågar vad som fungerade och vad som inte gjorde det, ger mer än någon instrumentpanel.
Avstängningsknappen
Det finns en sak som gör alla steg i trappan mindre läskiga: att kunna stänga av funktionen på en minut.
En avstängningsknapp, ofta kallad feature flag, är en inställning som slår av och på funktionen utan att ni behöver bygga och släppa en ny version. Den kan också styra vem som ser funktionen, till exempel ”bara de här tio” eller ”fem procent av kunderna”. Det är samma knapp som tar er uppför trappan.
Testa att den fungerar innan ni behöver den. En avstängningsknapp som ingen har provat är ett löfte, inte ett skyddsnät.
Bestäm nästa steg innan ni tar det här
Den vanligaste fällan med försiktiga släpp är att de aldrig tar slut. Tio användare blir ett halvår med tio användare, eftersom ingen bestämde när nästa steg skulle tas. Till slut firar piloten ettårsdag, med tårta.
Skriv därför ner, innan ni börjar, vad som ska vara sant för att gå vidare:
- Tid: ”Om två veckor tittar vi på resultatet.”
- Siffra: ”Om minst sju av tio förslag används som de är eller med små ändringar…”
- Inga allvarliga fel: ”…och inga fel från kategorin ’får aldrig hända’…”
- Beslut: ”…då går vi till fem procent av kunderna.”
Och lika viktigt: vad som får er att stanna eller gå tillbaka. Då är nästa steg ett beslut ni redan har fattat, inte en ny diskussion.
Mät efter släppet, inte bara före
När funktionen väl används finns det tre siffror som berättar om den fungerar. Följ dem varje vecka i början:
- Andelen förslag som används som de är eller med små ändringar.
- Tiden det tar att hantera ett ärende, jämfört med före.
- Antalet fel som rapporteras, och vilken kategori de hör till.
Går siffrorna åt rätt håll tar ni nästa steg i trappan. Går de åt fel håll vet ni varför, och kan stänga av medan ni rättar. Hur man följer AI-funktioner i drift mer i detalj beskrivs i Observability for LLM systems på engelska.
Det här är sista delen av den första omgången i Våga hela vägen. Serien började med Demon fungerade. Varför släpper vi den inte?