Skip to main content
Conductor makes A/B testing a first-class citizen. Test prompts, models, agents, entire workflows - anything.

Simple A/B Test

Test two AI models:

Traffic Splitting

50/50 Split

90/10 Split

33/33/33 Split (3 variants)

Dynamic Split (via KV)

Update split via CLI:

Sticky Sessions

Critical: Users must get the same variant every time.

Bad (Random)

Good (Sticky)

Hash Implementation

Or simpler with parseInt:

What to Test

1. AI Models

Test different models:

2. Prompts

Test different prompts (with Edgit versioning):

3. Agent Implementations

Test different agent versions:

4. Entire Workflows

Test different ensemble implementations:

Metrics Collection

Track variant performance:
Query results:

Multivariate Testing

Test multiple variables simultaneously.

22 Test: Model Prompt

Analysis & Decision Making

Statistical Significance

Auto-Promote Winner

Best Practices

  1. Sticky Sessions - Use consistent hashing, not random
  2. Sample Size - Collect at least 1000 samples per variant
  3. Statistical Significance - Wait for p < 0.05 or Bayesian > 95%
  4. Monitor for Weeks - Capture weekly patterns
  5. One Variable at a Time - Or use multivariate with large samples
  6. Track Costs - Some variants may be more expensive
  7. Monitor Failures - Track error rates per variant
  8. Document Results - Keep records of what worked

Common Pitfalls

1. Random Assignment

2. Insufficient Sample Size

3. Testing Too Many Things

4. Stopping Too Early

Next Steps

Edgit A/B Testing

Version-based A/B testing

Flow Control

Advanced flow patterns

State Management

Share data across agents

Playbooks

Real-world A/B test examples