Det finns en hel industri som lever på AI-demos. En slick presentation, en agent som verkar göra magi i realtid, ett par siffror om produktivitetsökning. Sedan tystnad. Eller om det är en pilot som testats i en kundmiljö: tre månader senare ligger den i ett arkiv och ingen pratar om den längre.
Mönstret för vilka agenter som överlever och vilka som dör har förvånansvärt lite med själva tekniken att göra. Det handlar om vad som finns runt agenten.
Felhantering är inte en feature, det är merparten av jobbet
En demo behöver fungera en gång. En agent i skarpt läge måste fungera tio tusen gånger, varav nio tusen niohundranittionio är trista och en är konstig. Den konstiga är där felhantering avgör om systemet ses som pålitligt eller inte.
Vad händer när tredjepartsapi:t inte svarar. Vad händer när modellen returnerar något som inte går att parsa. Vad händer när användaren skickar in en bild på ett kvitto som tagits från ovanligt långt avstånd och OCR misslyckas. Vad händer när två parallella anrop kommer in på samma kund med motstridiga uppdateringar.
Allt det måste hanteras innan agenten sätts i skarpt läge. Inte som efterhandskonstruktion utan som del av designen.
Observability är dyrt om man bygger det sent
En agent i skarpt läge bör logga varje agentanrop med input, output, modell, kostnad och latens, och varje verktygsanrop med argument, resultat och felkod. Dashboards som visar misslyckanden per timme, anomalier i kostnad och drift i svarstid hör till samma grundutrustning, liksom larm när något beter sig avvikande.
Att bygga det här i efterhand på en agent som redan kör är dyrt och stökigt. Att bygga in det från start är förhållandevis lite arbete och betalar sig omedelbart. Ett vanligt mönster är att bolag inser långt in i ett projekt att de inte vet hur agenten egentligen presterar, och tvingas pausa allt för att retroaktivt instrumentera.
Versionering räddar dig dagen modellen uppdateras
Modellleverantörer släpper nya versioner. Ibland blir output bättre, ibland marginellt sämre, ibland helt annorlunda i tonläge. Om du inte versionerar både dina prompts och de modeller du anropar kommer du inte att förstå varför kvaliteten plötsligt skiftade en tisdag.
Den som bygger agenter gör klokt i att pinna modell till en specifik version, köra en testsuite mot nya modellversioner innan man byter, och ha en rollback-rutin som är snabb, inte en process som tar dagar.
Det boring som inte syns i demos
Auth, rate limiting, kostnadstak per kund, queueing när belastningen sticker iväg, retries med exponential backoff, idempotens, deduplikering av events, audit trail. Inget av det är glamoröst. Allt är skillnaden mellan en agent som klarar skarpt läge och en som kraschar tredje veckan och blir bortglömd.
En tumregel värd att ha i huvudet om du bygger er första riktiga agent: kanske en tredjedel av tiden går till själva modellen och promptarna. Resten, uppskattningsvis, är allt det som gör att systemet överlever en vardag. Det är en grov uppskattning, inte en mätning.