Konrad Kowalski (rootsher)Principal Platform & Reliability Architect011001110011010011100001000110101111011101111101

Model Evaluation

wpisy (1)

  1. Część II: Standaryzacja AI w SDLC na poziomie organizacji9/10

    Evals i quality gates

    Observability mówi, co agent zrobił, ale nie czy zrobił to dobrze. Evals obok kodu agenta działają jak testy regresyjne zachowania i blokują rollout przez…