Comma-separated list of fields to sort by, applied in order (the first field dominates); prefix any field with ’-’ for descending — e.g. ‘-evaluators.reward.mean,cost_usd.mean’. Each field is an evaluation attribute (name, created_at, updated_at, pinned_at) or an aggregate metric: run_count, test_case_count, cost_usd.<stat>, latency_ms.<stat>, tokens.<stat>, or evaluators.<name>.<stat>, where <stat> is one of mean, median, p90, p95, p99, sum, count. When omitted, defaults to -created_at with pinned evaluations first.
Filter evaluations by name, experiment_id (experiment group membership; experiment_group_id is a deprecated alias), dataset_name, dataset_version, created_by, created_at, or updated_at. Pass is_deleted=true to return only soft-deleted evaluations; omit to see only live ones. Pass is_pinned=true (or false) to filter by pinned state; omit to return both. Filter by a metadata key/value: filter[metadata.<key>]=<value>. Filter by a rollup metric with numeric range operators (lte/lt/gte]=5, filter[cost_usd.mean][lte]=1000, filter[tokens.mean][gte]=0.8.