> ## Documentation Index
> Fetch the complete documentation index at: https://docs.getnetra.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Evaluation Overview

> Measure and improve AI quality with Netra's evaluation framework. Run automated test suites, track scores over time, and catch regressions before production.

AI systems don't fail loudly. They drift, regress, and quietly degrade over time. Netra's Evaluation framework makes that invisible failure visible, giving you a structured, repeatable way to measure how your AI behaves—not just once, but continuously across releases, prompts, models, and environments.

<Card title="Quick Start: Evaluation" icon="rocket" href="/quick-start/QuickStart_Evals">
  New to evaluations? Get your first evaluation running in minutes.
</Card>

## Why Evaluation Matters

Without systematic evaluation, you're flying blind. Netra helps you answer critical questions with confidence:

| Question                                | What Netra Measures                                       |
| --------------------------------------- | --------------------------------------------------------- |
| Is my system producing correct answers? | Answer correctness, semantic similarity, factual accuracy |
| Did this update introduce a regression? | Side-by-side comparison across test runs                  |
| Are costs creeping up unnoticed?        | Token usage, latency, and cost per evaluation             |
| Are my agents executing correctly?      | Tool call sequences, decision paths, guardrail compliance |

## Core Building Blocks

The Evaluation suite is built on three interconnected pillars:

### Evaluators

[Evaluators](/Evaluators/overview) are the scoring logic that assesses your AI's performance. Netra organizes evaluators by modality:

* **[Text Evaluators](/Evaluators/text-evaluators)** — LLM-as-Judge, code-based, and rule-based evaluators for text outputs
* **[Voice Evaluators](/Evaluators/voice-evaluators)** — TTS, STT, and conversational evaluators for audio quality
* **[Image Evaluators](/Evaluators/image-evaluators)** — Multimodal and rule-based evaluators for image generation and editing

<Info>
  Netra provides a [Library](/Evaluators/text-evaluators#library) of 49 preconfigured evaluators across 12 categories. Customize any evaluator and save it to **My Evaluators** for reuse across evaluations.
</Info>

### Evaluations

[Evaluations](/Evaluations/text-evaluations/Datasets) are collections of test cases that define what you want to evaluate.

| Feature              | Description                                                                   |
| -------------------- | ----------------------------------------------------------------------------- |
| **Manual Creation**  | Build test suites from scratch in the dashboard                               |
| **CSV Import**       | Bulk-upload test cases from a spreadsheet with column mapping and validation  |
| **Variable Mapping** | Map evaluator inputs to evaluation fields, agent responses, or trace metadata |
| **Metadata & Tags**  | Organize evaluations by feature, model, or release version                    |

### Test Runs

[Test Runs](/Evaluations/TestRuns) execute your evaluations through the evaluation pipeline, providing point-in-time snapshots of system health.

| Feature                | Description                                                                     |
| ---------------------- | ------------------------------------------------------------------------------- |
| **Deep Diagnostics**   | Compare expected output vs. actual output side-by-side                          |
| **Trace Integration**  | Link directly to execution traces to debug the "why" behind failures            |
| **Run Comparison**     | Compare multiple runs side-by-side with per-evaluator verdicts and delta badges |
| **Aggregated Metrics** | View total cost, average latency, and pass/fail rates across the run            |

## Supported Agent Types

Netra evaluates multiple types of AI agents:

<CardGroup cols={3}>
  <Card title="Text Agents" icon="font" href="/Evaluations/text-evaluations/evaluations">
    Evaluate chatbots, copilots, and LLM-based agents that produce text outputs.
  </Card>

  <Card title="Voice Agents" icon="microphone" href="/Simulations/voice-simulations/Simulations">
    Evaluate voice agents for call quality, transcription accuracy, and conversational delivery.
  </Card>

  <Card title="Image Agents" icon="image" href="/Evaluations/image-evaluations/evaluations">
    Evaluate image generation, editing, and analysis systems for visual quality and accuracy.
  </Card>
</CardGroup>

## Use Cases

### Regression Testing

Catch quality degradation before it reaches production:

1. Create an evaluation from your golden test cases
2. Run evaluations after each model or prompt change
3. Compare results across test runs to identify regressions

### Continuous Quality Monitoring

Track quality metrics over time:

1. Build an evaluation that reflects your production traffic patterns
2. Schedule regular evaluation runs
3. Set up [alerts](/Alert-rules/Alert-rules) when pass rates drop below thresholds

### Model Comparison

Evaluate different models or prompts objectively:

1. Create a standardized evaluation
2. Run the same inputs through different model configurations
3. Compare scores across test runs to make data-driven decisions

### Image Quality Testing

Evaluate AI-generated or edited images for visual quality and accuracy:

1. Create an [image evaluation](/Evaluations/image-evaluations/Datasets) with input images and expected characteristics
2. Use [image evaluators](/Evaluators/image-evaluators) to assess composition, style, and format
3. Track visual quality metrics across model updates and prompt changes

## Getting Started

<Steps>
  <Step title="Configure Evaluators">
    Define your scoring criteria by adding [evaluators](/Evaluators/text-evaluators)—choose from the library or create custom ones.
  </Step>

  <Step title="Create an Evaluation">
    [Create an evaluation](/Evaluations/text-evaluations/Datasets) manually or by importing a CSV, and attach your evaluators.
  </Step>

  <Step title="Run Evaluations">
    Execute your evaluation and view results in [Test Runs](/Evaluations/TestRuns).
  </Step>

  <Step title="Iterate and Improve">
    Use insights from test runs to refine your prompts, models, and evaluation criteria.
  </Step>
</Steps>

## Related

* [Quick Start: Evaluation](/quick-start/QuickStart_Evals) - Get started with evaluations in minutes
* [Evaluators Overview](/Evaluators/overview) - Understand the evaluator framework
* [Text Evaluators](/Evaluators/text-evaluators) - Configure scoring logic and criteria
* [Evaluations](/Evaluations/text-evaluations/Datasets) - Create and manage test case collections
* [Test Runs](/Evaluations/TestRuns) - Analyze evaluation results and track regressions
* [Image Evaluations](/Evaluations/image-evaluations/Datasets) - Evaluate image generation and editing quality
* [Traces](/Observability/Traces/overview) - Understand how evaluations connect to trace data
