Evaluation Types
Accuracy
LLM-as-a-judge evaluation that scores agent output quality against expected answers on a 1–10 scale.
Performance
Latency and memory profiling with statistical analysis across multiple iterations.
Reliability
Tool-call verification that asserts expected tools were invoked during execution.

