OptionalexperimentOptionalmaxOptionalmetadataOptionalmodelExtraction model for the LLM fallback path; defaults to gpt-4.1-mini (the eval's chosen model).
OptionalnumRun each example N times (LangSmith repetitions) to measure per-example consistency.
OptionaltimeFallback zone when an example omits one.
LangSmith dataset of
{ question, referenceInstant, timeZone? }-> gold{ intent, window }examples.