> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/automodel/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/automodel/_mcp/server.

# nemo_automodel.components.models.inkling.configuration

Inkling configuration classes for Automodel's registry-first config lookup.

## Module Contents

### Classes

| Name                                                                                                 | Description                                  |
| ---------------------------------------------------------------------------------------------------- | -------------------------------------------- |
| [`InklingAudioConfig`](#nemo_automodel-components-models-inkling-configuration-InklingAudioConfig)   | Configuration for Inkling's audio tower.     |
| [`InklingConfig`](#nemo_automodel-components-models-inkling-configuration-InklingConfig)             | Top-level multimodal Inkling configuration.  |
| [`InklingTextConfig`](#nemo_automodel-components-models-inkling-configuration-InklingTextConfig)     | Configuration for the Inkling text backbone. |
| [`InklingVisionConfig`](#nemo_automodel-components-models-inkling-configuration-InklingVisionConfig) | Configuration for Inkling's vision tower.    |

### Data

[`__all__`](#nemo_automodel-components-models-inkling-configuration-__all__)

### API

```python
class nemo_automodel.components.models.inkling.configuration.InklingAudioConfig(
    n_mel_bins: int = 80,
    mel_vocab_size: int = 256,
    text_hidden_size: int = 6144,
    rms_norm_eps: float = 1e-06,
    initializer_range: float = 0.02,
    kwargs: typing.Any = {}
)
```

**Bases:** `PretrainedConfig`

Configuration for Inkling's audio tower.

```python
class nemo_automodel.components.models.inkling.configuration.InklingConfig(
    text_config: nemo_automodel.components.models.inkling.configuration.InklingTextConfig | dict[str, typing.Any] | None = None,
    audio_config: nemo_automodel.components.models.inkling.configuration.InklingAudioConfig | dict[str, typing.Any] | None = None,
    vision_config: nemo_automodel.components.models.inkling.configuration.InklingVisionConfig | dict[str, typing.Any] | None = None,
    image_token_id: int = 200054,
    audio_token_id: int = 200053,
    image_bos_token_id: int = 200005,
    audio_bos_token_id: int = 200020,
    mtp_config: dict[str, typing.Any] | None = None,
    kwargs: typing.Any = {}
)
```

**Bases:** `PretrainedConfig`

Top-level multimodal Inkling configuration.

```python
nemo_automodel.components.models.inkling.configuration.InklingConfig._coerce_sub_config(
    config,
    config_cls
)
```

staticmethod

```python
class nemo_automodel.components.models.inkling.configuration.InklingTextConfig(
    vocab_size: int = 201024,
    unpadded_vocab_size: int | None = None,
    hidden_size: int = 6144,
    num_hidden_layers: int = 66,
    num_attention_heads: int = 64,
    num_key_value_heads: int = 8,
    head_dim: int = 128,
    swa_num_attention_heads: int = 64,
    swa_num_key_value_heads: int = 16,
    swa_head_dim: int = 128,
    sliding_window_size: int = 512,
    d_rel: int = 16,
    rel_extent: int = 1024,
    log_scaling_n_floor: int | None = None,
    log_scaling_alpha: float = 0.1,
    local_layer_ids: list[int] | None = None,
    layer_types: list[str] | None = None,
    max_position_embeddings: int = 131072,
    rms_norm_eps: float = 1e-06,
    conv_kernel_size: int = 4,
    mlp_layer_types: list[str] | None = None,
    intermediate_size: int = 24576,
    hidden_act: str = 'silu',
    moe_intermediate_size: int = 3072,
    n_routed_experts: int = 256,
    num_experts_per_tok: int = 6,
    n_shared_experts: int = 2,
    shared_expert_sink: bool = True,
    route_scale: float = 8.0,
    logits_mup_width_multiplier: float = 24.0,
    rms_norm_eps_moe_gate: float = 1e-06,
    attention_dropout: float = 0.0,
    initializer_range: float = 0.02,
    pad_token_id: int | None = None,
    bos_token_id: int | None = 1,
    eos_token_id: int | None = 2,
    num_mtp_layers: int | None = None,
    chain_hidden_post_norm: bool = False,
    mtp_hidden_states_first: bool = True,
    mtp_local_layer_ids: list[int] | None = None,
    dense_mlp_idx: int = 0,
    dense_intermediate_size: int | None = None,
    kwargs: typing.Any = {}
)
```

**Bases:** `PretrainedConfig`

Configuration for the Inkling text backbone.

```python
class nemo_automodel.components.models.inkling.configuration.InklingVisionConfig(
    text_hidden_size: int = 6144,
    patch_size: int = 40,
    temporal_patch_size: int = 2,
    num_channels: int = 3,
    hidden_size: int = 1024,
    num_hidden_layers: int = 24,
    num_attention_heads: int = 16,
    rms_norm_eps: float = 1e-06,
    initializer_range: float = 0.02,
    kwargs: typing.Any = {}
)
```

**Bases:** `PretrainedConfig`

Configuration for Inkling's vision tower.

```python
nemo_automodel.components.models.inkling.configuration.__all__ = ['InklingConfig', 'InklingTextConfig', 'InklingAudioConfig', 'InklingVisionConfi...
```