Skip to content
phoenix-evals logo

Phoenix Evals

phoenix-evals

Build and run evaluators for AI/LLM applications using Phoenix.

NeverSight/skills_feed0installs214stars

SKILL.md

Full skill instructions

Phoenix Evals

Build evaluators for AI/​LLM applications. Code first, LLM for nuance, validate against humans.

Quick Reference

TaskFiles
Setupsetup-python, setup-typescript
Build code evaluatorevaluators-code-{python|typescript}
Build LLM evaluatorevaluators-llm-{python|typescript}, evaluators-custom-templates
Run experimentexperiments-running-{python|typescript}
Create datasetexperiments-datasets-{python|typescript}
Validate evaluatorvalidation, validation-calibration-{python|typescript}
Analyze errorserror-analysis, axial-coding
RAG evalsevaluators-rag
Productionproduction-overview, production-guardrails

Workflows

Starting Fresh: observe-tracing-setup → error-analysis → axial-coding → evaluators-overview

Building Evaluator: fundamentals → evaluators-{code\|llm}-{python\|typescript} → validation-calibration-{python\|typescript}

RAG Systems: evaluators-rag → evaluators-code-* (retrieval) → evaluators-llm-* (faithfulness)

Production: production-overview → production-guardrails → production-continuous

Rule Categories

PrefixDescription
fundamentals-*Types, scores, anti-patterns
observe-*Tracing, sampling
error-analysis-*Finding failures
axial-coding-*Categorizing failures
evaluators-*Code, LLM, RAG evaluators
experiments-*Datasets, running experiments
validation-*Calibrating judges
production-*CI/​CD, monitoring

Key Principles

PrincipleAction
Error analysis firstCan't automate what you haven't observed
Custom > genericBuild from your failures
Code firstDeterministic before LLM
Validate judges>80% TPR/​TNR
Binary > LikertPass/​fail, not 1-5