> This page is for version 26.07 · v1.3.0.
> For other versions, use one of these documentation indexes:
> - Latest · v1.4.0 (26.09) (default): https://docs.nvidia.com/nemo/curator/latest/llms.txt
> - Main · preview: https://docs.nvidia.com/nemo/curator/main/llms.txt
> - 26.09 · v1.4.0: https://docs.nvidia.com/nemo/curator/v26.09/llms.txt
> - 26.07 · v1.3.0: https://docs.nvidia.com/nemo/curator/v26.07/llms.txt
> - 26.04 · v1.2.0: https://docs.nvidia.com/nemo/curator/v26.04/llms.txt
> - 26.02 · v1.1.0: https://docs.nvidia.com/nemo/curator/v26.02/llms.txt
> - 25.09 · v1.0.0: https://docs.nvidia.com/nemo/curator/v25.09/llms.txt

> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/curator/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/curator/_mcp/server.

# nemo_curator.models.vllm_model

## Module Contents

### Classes

| Name                                                               | Description                                              |
| ------------------------------------------------------------------ | -------------------------------------------------------- |
| [`LLM`](#nemo_curator-models-vllm_model-LLM)                       | -                                                        |
| [`SamplingParams`](#nemo_curator-models-vllm_model-SamplingParams) | -                                                        |
| [`VLLMModel`](#nemo_curator-models-vllm_model-VLLMModel)           | Generic vLLM language model wrapper for text generation. |

### Data

[`VLLM_AVAILABLE`](#nemo_curator-models-vllm_model-VLLM_AVAILABLE)

### API

```python
class nemo_curator.models.vllm_model.LLM()
```

```python
class nemo_curator.models.vllm_model.SamplingParams()
```

```python
class nemo_curator.models.vllm_model.VLLMModel(
    model: str,
    max_model_len: int | None = None,
    tensor_parallel_size: int | None = None,
    max_num_batched_tokens: int = 4096,
    temperature: float = 0.7,
    top_p: float = 0.8,
    top_k: int = 20,
    min_p: float = 0.0,
    max_tokens: int | None = None,
    cache_dir: str | None = None
)
```

**Bases:** [ModelInterface](/nemo/curator/nemo-curator/nemo_curator/models/base#nemo_curator-models-base-ModelInterface)

Generic vLLM language model wrapper for text generation.

**`_final_max_model_len`** `int | None = None`

---

**`_is_qwen3`** `bool = False`

---

**`_llm`** `LLM | None = None`

---

**`_sampling_params`** `SamplingParams | None = None`

---

**`model_id_names`** `list[str]`

Return the model identifier.

---

```python
nemo_curator.models.vllm_model.VLLMModel.generate(
    prompts: list[str]
) -> list[str]
```

Generate text from prompts.

**Parameters:**

**`prompts`** `list[str]`

List of prompt strings or list of message dicts
(for chat template).

---

**Returns:** `list[str]`

List of generated text strings.

**Raises:**

* `RuntimeError`: If the model is not set up or generation fails.

```python
nemo_curator.models.vllm_model.VLLMModel.get_tokenizer() -> typing.Any
```

Get the tokenizer from the LLM instance.

```python
nemo_curator.models.vllm_model.VLLMModel.setup() -> None
```

Set up the vLLM model and sampling parameters.

```python
nemo_curator.models.vllm_model.VLLM_AVAILABLE = True
```