Runs a LangSmith experiment over a find_documents relevance dataset: replays just the document-selection LLM step per example and scores reference-based relevance (recall/precision against labeled gold documents, abstention on empty-gold examples).
Runs a LangSmith experiment over a find_documents relevance dataset: replays just the document-selection LLM step per example and scores reference-based relevance (recall/precision against labeled gold documents, abstention on empty-gold examples).