nemo_rl.data.datasets.response_datasets.openr1_math#

Module Contents#

Classes#

OpenR1Math220KDataset

Simple wrapper around the OpenR1-Math-220k dataset.

API#

class nemo_rl.data.datasets.response_datasets.openr1_math.OpenR1Math220KDataset(
subset: str | None = 'default',
split: str = 'train',
split_validation_size: float = 0.0,
seed: int = 42,
**kwargs,
)#

Bases: nemo_rl.data.datasets.raw_dataset.RawDataset

Simple wrapper around the OpenR1-Math-220k dataset.

Parameters:
  • subset – Hugging Face dataset config (subset) name, default is “default”

  • split – Split name for the dataset, default is “train”

  • split_validation_size – Size of the validation data, default is 0

  • seed – Seed for train/validation split when split_validation_size > 0, default is 42

Initialization

format_data(data: dict[str, Any]) dict[str, Any]#