Traditionella agentmätningar mäter resultat, inte beteende. En agent kan komma fram till rätt svar medan den ignorerar begränsningar, utnyttjar genvägar eller fabricerar mellanliggande steg, och mätningen skulle ändå markera det som framgångsrikt.
Du har byggt en AI-agent. Den demonstrerar vackert. Intressenter är exalterade. Sedan når den produktion, och saker blir röriga. Svar driver iväg. Uppgifter blir ofullständiga. Användare slutar lita på den. Och ingen kan förklara varför eftersom ingen definierade vad



