”Vi väntar på nästa modell”: varför det sällan hjälper
Nästa modell kommer alltid snart. Varför väntan sällan löser det som håller projektet tillbaka, och hur ni byter modell säkert när den väl kommer.
Kort sagt
- Det som håller de flesta projekt tillbaka är saknade tester, dåligt underlag eller ingen ribba, inte modellen.
- Att vänta kostar manuellt arbete, lärdomar från riktiga användare och tid att bygga grunden.
- Med tester på plats är ett modellbyte ett kort arbete: kör samma frågor, jämför, justera och släpp till få först.
- Bygg så att modellen är en inställning på ett ställe, så blir nästa modell en uppgradering.
I den här artikeln · 4 avsnitt
”Vi har pratat om det, och vi tror att det är klokt att vänta på nästa modell. Den ska vara mycket bättre på precis det här.”
Det sades i januari. Nästa modell kom i april. Den var bättre. Men projektet kom inte igång ändå, för då hade någon läst att ännu en modell skulle komma till hösten. Projektet har nu väntat in tre modeller. Alla var bättre än den förra. Ingen av dem har svarat på en enda kundfråga.
Det är inte konstigt att man resonerar så. Modellerna blir bättre hela tiden, och ingen vill bygga på något som snart är gammalt. Men väntan har en kostnad, och den löser sällan det som faktiskt håller projektet tillbaka.
Är modellen det som håller er tillbaka?
Förmodligen inte. Ställ frågan konkret: vilka av era testfrågor klarar dagens modell inte, och varför?
Oftast blir svaret ett av tre:
- Ni vet inte, eftersom ni inte har några testfrågor. Då är det inte modellen som saknas, utan testerna. Börja med Ert första test av AI-svaren.
- Den svarar fel för att underlaget är fel eller saknas. Om dokumenten den läser är gamla eller ofullständiga hjälper ingen modell. Den nya modellen kommer att svara lika fel, bara mer välformulerat.
- Den klarar nästan allt, men ni vet inte om det räcker. Då saknas en ribba, inte en modell. Se Hur bra är bra nog?
Bara i det fjärde fallet, när ni har tester, bra underlag och en ribba, och modellen ändå inte når den, är det modellen som är problemet. Det fallet finns, men det är ovanligare än man tror.
Vad kostar det att vänta?
Mer än det verkar, eftersom kostnaden inte syns.
- Arbetet görs fortfarande för hand. Varje månad ni väntar är en månad av samma manuella arbete som AI:n skulle ta bort.
- Ni lär er inget. Det mesta av det som gör en AI-funktion bra lär man sig av riktiga användare: vilka frågor de ställer, vad som irriterar, vad som behöver granskas. Det går inte att lära sig i förväg.
- Grunden byggs inte. Tester, skyddsnät, loggar och rutiner tar tid att få på plats, och de behövs oavsett modell.
Den sista punkten är den viktigaste. Allt det där är det som gör att ni kan dra nytta av nästa modell när den kommer.
Hur byter man modell säkert?
Med tester på plats är ett modellbyte ett kort och tråkigt arbete, inte ett projekt. Det går till ungefär så här:
- Kör era testfrågor mot den nuvarande modellen och spara resultatet.
- Kör samma frågor mot den nya modellen, med samma prompt.
- Jämför. Vilka svar blev bättre, vilka blev sämre? Det är de sämre som är intressanta.
- Justera prompten om den nya modellen tolkar något annorlunda, och kör testerna igen.
- Släpp den nya modellen till en liten del av användarna först, som i Släpp till tio användare först.
Om ni har byggt så att modellen är en inställning och inte inbyggd överallt i koden, tar det här dagar, inte månader.
Bygg så att modellen går att byta
Det enklaste sättet att slippa vänta är att se till att modellen inte är ett låst beslut. Tre saker gör det möjligt:
- Modellen är en inställning, inte något som står hårdkodat på tjugo ställen i koden.
- All kontakt med modellen går genom ett ställe i koden, så att ett byte bara görs där.
- Testerna körs automatiskt, så att jämförelsen mellan två modeller är ett kommando, inte ett projekt.
Med det på plats är nästa modell inte ett skäl att vänta. Den är en gratis uppgradering ni kan ta när det passar.
Hur ett system byggs så att modeller och leverantörer går att byta, med reservalternativ som har klarat samma tester, beskrivs i A reference architecture for LLM systems in production på engelska.