core.transformer.wide_residual_config#
Module Contents#
Classes#
Configuration for streamwise wide residuals around ordinary-width branches. |
API#
- class core.transformer.wide_residual_config.WideResidualConfig#
Configuration for streamwise wide residuals around ordinary-width branches.
The model carries
num_streamscontiguous residual streams, each withTransformerConfig.hidden_sizefeatures. Attention, MLP, and MoE branches continue to operate at the ordinary hidden size.- num_streams: int#
None
Number of ordinary-width streams carried by the model; must be greater than one.
- streamwise_sigmoid_init_scale: float#
0.01
Symmetric initialization spread for streamwise write logits.
- learned_retention: bool#
False
Apply one bounded learned carry factor to each residual stream.
- retention_init: float#
0.999
Initial retention factor; values near one preserve the initial function.
- retention_max_forget: float#
0.1
Maximum forget rate in
1 - max_forget * sigmoid(-logit).
- __post_init__() None#