For the complete documentation index, see llms.txt. This page is also available as Markdown.

layerlens evaluate

layerlens evaluate — create and run an evaluation.

layerlens evaluate --model openai/gpt-4o --benchmark mmlu
layerlens evaluate --space my-space
layerlens evaluate --space my-space --fail-on-regression --tolerance 0.01

Options

Option
Description

--model

Model key

--benchmark

Benchmark key

--space

Saved space ID

--scorers

Comma-separated scorer IDs

--judges

Comma-separated judge IDs

--fail-on-regression

Exit non-zero on regression

--tolerance

Regression tolerance (default 0.01)

See also

Last updated

Was this helpful?