Quick Start: Evaluation
New to evaluations? Get your first evaluation running in minutes.
Why Evaluation Matters
Without systematic evaluation, you’re flying blind. Netra helps you answer critical questions with confidence:Core Building Blocks
The Evaluation suite is built on three interconnected pillars:Evaluators
Evaluators are the scoring logic that assesses your AI’s performance. Netra organizes evaluators by modality:- Text Evaluators — LLM-as-Judge, code-based, and rule-based evaluators for text outputs
- Voice Evaluators — TTS, STT, and conversational evaluators for audio quality
- Image Evaluators — Multimodal and rule-based evaluators for image generation and editing
Netra provides a Library of 49 preconfigured evaluators across 12 categories. Customize any evaluator and save it to My Evaluators for reuse across evaluations.
Evaluations
Evaluations are collections of test cases that define what you want to evaluate.Test Runs
Test Runs execute your evaluations through the evaluation pipeline, providing point-in-time snapshots of system health.Supported Agent Types
Netra evaluates multiple types of AI agents:Text Agents
Evaluate chatbots, copilots, and LLM-based agents that produce text outputs.
Voice Agents
Evaluate voice agents for call quality, transcription accuracy, and conversational delivery.
Image Agents
Evaluate image generation, editing, and analysis systems for visual quality and accuracy.
Use Cases
Regression Testing
Catch quality degradation before it reaches production:- Create an evaluation from your golden test cases
- Run evaluations after each model or prompt change
- Compare results across test runs to identify regressions
Continuous Quality Monitoring
Track quality metrics over time:- Build an evaluation that reflects your production traffic patterns
- Schedule regular evaluation runs
- Set up alerts when pass rates drop below thresholds
Model Comparison
Evaluate different models or prompts objectively:- Create a standardized evaluation
- Run the same inputs through different model configurations
- Compare scores across test runs to make data-driven decisions
Image Quality Testing
Evaluate AI-generated or edited images for visual quality and accuracy:- Create an image evaluation with input images and expected characteristics
- Use image evaluators to assess composition, style, and format
- Track visual quality metrics across model updates and prompt changes
Getting Started
1
Configure Evaluators
Define your scoring criteria by adding evaluators—choose from the library or create custom ones.
2
Create an Evaluation
Create an evaluation manually or by importing a CSV, and attach your evaluators.
3
Run Evaluations
Execute your evaluation and view results in Test Runs.
4
Iterate and Improve
Use insights from test runs to refine your prompts, models, and evaluation criteria.
Related
- Quick Start: Evaluation - Get started with evaluations in minutes
- Evaluators Overview - Understand the evaluator framework
- Text Evaluators - Configure scoring logic and criteria
- Evaluations - Create and manage test case collections
- Test Runs - Analyze evaluation results and track regressions
- Image Evaluations - Evaluate image generation and editing quality
- Traces - Understand how evaluations connect to trace data
