Brikken som manglet
I forrige innlegg skrev vi om loopen: at gjennombruddene i AI denne høsten ikke kom fra smartere modeller, men fra stillaset rundt dem. Konklusjonen var at det vanskelige ikke er å bygge selve loopen. Det vanskelige er å vite når den er ferdig.
Firefox-prosjektet hadde et svar som ikke lot seg diskutere: programmet krasjet, eller så gjorde det ikke det. De fleste forretningsprosesser har ikke noe slikt. Spør du en språkmodell om en faktura er riktig kontert, får du et avsnitt tilbake. Noen må lese det og tolke det.
Samme måned kom det en modell som angriper akkurat det problemet.
Hva Jev er
Jev er laget av TypeSafe AI, et selskap i San Francisco grunnlagt av Diogo Almeida. Han er ifølge TechCrunch tidligere forsker i OpenAI og var med på å bygge ChatGPT. Modellen ble sluppet i begrenset tidlig tilgang 15. september.
Det som skiller den fra alt annet du har brukt, er at den ikke skriver tekst.
Du bestemmer på forhånd hvilke svar som er mulige. For eksempel: riktig kontert, feil kontert, trenger manuell vurdering. Jev velger ett av dem og legger ved en sannsynlighet. Svaret er ment for å leses av et program, ikke av et menneske.
| Vanlig språkmodell | Jev | |
|---|---|---|
| Svarer med | Fri tekst | Et forhåndsdefinert valg og en sannsynlighet |
| Lager svaret | Ord for ord | Alt på én gang |
| Svartid | Sekunder til minutter | 70 til 500 millisekunder, ifølge TypeSafe |
| Laget for | Mennesker | Programvare |
TypeSafe kaller dette «System One-modeller», etter Daniel Kahnemans begrep for rask, intuitiv tenkning. Den er ikke laget for samtaler eller for å skrive noe kreativt. Den er laget for å ta mange små avgjørelser raskt.
Hvorfor det er interessant
Se for deg loopen fra forrige innlegg. Et av de fire trinnene var at loopen må avgjøre om oppgaven faktisk er løst. Med en vanlig språkmodell er det trinnet svakt, fordi svaret er tekst som må tolkes.
Med Jev blir det trinnet et tall. «Feil kontert, 94 prosent sikker» er noe et program kan handle på uten at et menneske må lese noe.
Anthony Maio, som har skrevet en av de grundigste gjennomgangene, mener modellen passer best som et kontrollag rundt andre agenter. Den kan velge hvilket verktøy som skal brukes, vurdere om et resultat er godt nok, oppdage at en loop går i ring, og avgjøre når et menneske må inn.
Det er ikke en ny chatbot. Det er en ny type byggekloss.
Påstanden som ikke holder
Flere omtaler skriver at Jev aldri hallusinerer. Det stemmer ikke, og TypeSafe sier det egentlig selv. Tallet på null prosent i deres egne grafer er, med deres egne ord, ikke målt. Det betyr bare at modellen aldri gir et svar som faller utenfor formatet du har definert.
Den kan fortsatt velge feil alternativ. Og den kan gjøre det med høy sikkerhet.
Det er en viktig forskjell. En språkmodell som tar feil, tar ofte feil på en måte du kan se. Et program som får «riktig kontert, 97 prosent» tilbake, stiller ingen spørsmål.
Det ingen vet ennå
Det er mye vi ikke vet om Jev, og det er verdt å si rett ut:
Hvordan den er bygget er ikke publisert. Arkitekturen, treningen og hvordan sannsynlighetene kalibreres er holdt hemmelig.
Ingen har testet den systematisk utenfra. TechCrunch intervjuet to utviklere som hadde prøvd den. Den ene fikk raskere og mer presise svar enn fra modellen han sammenlignet med. Den andre fant at Gemini traff litt bedre, men var 10 til 20 ganger dyrere.
TypeSafes egne tester er laget av deres eget team. Det sier de selv, og de skriver også at de enkleste demoene viser modellen i et fordelaktig lys.
Det gjør ikke Jev uinteressant. Men det betyr at dette er en ny kategori å forstå, ikke et produkt å kjøpe i morgen.
Det vanskelige spørsmålet: hva er sikkert nok?
Her er poenget som gjelder uansett hvilken leverandør som vinner.
Armin Ronacher, teknisk direktør i Earendil, sa det presist til TechCrunch: kommer svaret tilbake med 50 prosent sannsynlighet, må noen bestemme om det egentlig bare er myntkast.
Det spørsmålet kan ikke leverandøren svare på. Det må dere.
Skal alt under 80 prosent sikkerhet til et menneske? Under 95? Er grensen den samme for en faktura på 500 kroner og en på 500 000? Hvem eier den grensen, og hvem endrer den?
Og grensen er ikke noe man setter én gang. Maio peker på at sannsynlighetene kan bli mindre til å stole på når forholdene endrer seg: nye rutiner, nye typer kunder, nye mønstre modellen ikke har sett. En grense som var riktig i mars, kan være feil i september. Noen må følge med.
Det er ikke et teknisk spørsmål. Det er et spørsmål om ansvar og kontroll, og det er akkurat den typen spørsmål som må være besvart før teknologien tas i bruk.
Hva du kan gjøre nå
Du trenger ikke Jev for å begynne. Du trenger å vite hvilke avgjørelser i virksomheten som egentlig er et valg mellom faste alternativer.
Mange er det. Er fakturaen riktig kontert. Hører henvendelsen hjemme hos support eller salg. Er dokumentet oppdatert. Skal saken eskaleres.
For hver av dem kan dere skrive ned tre ting:
Hvilke svar er mulige? Skriv dem ned. Mangler det riktige svaret i listen, vil enhver modell legge sannsynligheten på et galt ett.
Hva er riktig, og hvordan vet dere det? Uten et fasitsvar kan ingen måle om en modell treffer.
Hvor sikker må dere være før ingen trenger å se på det? Og hvem bestemmer det?
Det arbeidet er nyttig uansett om dere ender med Jev, en språkmodell eller bare en bedre rutine. Det er strukturen. Teknologien kommer etterpå.