Tutorial 1: First evaluation in 10 minutes
Tutorial 1 — Run your first end-to-end Stratix evaluation in 10 minutes.
Last updated
Was this helpful?
Was this helpful?
from layerlens import Stratix
client = Stratix()
model = client.models.get_by_key("openai/gpt-4o")
benchmark = client.benchmarks.get_by_key("arc-agi-2")
print(model.name, "→", benchmark.name)evaluation = client.evaluations.create(
model=model,
benchmark=benchmark,
)
print("Started:", evaluation.id)result = client.evaluations.wait_for_completion(evaluation)
print(f"Accuracy: {result.accuracy}")model_a = client.models.get_by_key("openai/gpt-4o")
model_b = client.models.get_by_key("anthropic/claude-opus-4-7")
eval_a = client.evaluations.create(model=model_a, benchmark=benchmark)
eval_b = client.evaluations.create(model=model_b, benchmark=benchmark)
result_a = client.evaluations.wait_for_completion(eval_a)
result_b = client.evaluations.wait_for_completion(eval_b)
print(f"GPT-4o: {result_a.accuracy}")
print(f"Claude Opus 4: {result_b.accuracy}")