bridge.recipes.qwen_vl.gb200.qwen35_vl#
GB200 functional recipes shared by Qwen3.5/Qwen3.6-VL 35B-A3B.
Module Contents#
Functions#
Return Qwen3.5-VL 27B language-and-projector pretraining for sixteen GB200 GPUs. |
|
Apply shared settings for bounded GB200 functional runs. |
|
Return shared Qwen3.5/Qwen3.6-VL 35B-A3B SFT for eight GB200 GPUs. |
|
Return shared Qwen3.5/Qwen3.6-VL 35B-A3B LoRA for eight GB200 GPUs. |
Data#
API#
- bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_27b_pretrain_16gpu_gb200_bf16_mock_config() megatron.bridge.training.config.ConfigContainer#
Return Qwen3.5-VL 27B language-and-projector pretraining for sixteen GB200 GPUs.
This keeps the dense pretraining objective and trainable-parameter contract from the H100 recipe while using the measured GB200 execution layout. In particular, deterministic mode must remain opt-in: Qwen3.5’s Gated DeltaNet replaces its fused FLA kernels with a torch-native reference path when deterministic mode is enabled.
- bridge.recipes.qwen_vl.gb200.qwen35_vl._apply_qwen35_vl_35b_a3b_gb200_functional_defaults(
- cfg: megatron.bridge.training.config.ConfigContainer,
Apply shared settings for bounded GB200 functional runs.
- bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_35b_a3b_sft_8gpu_gb200_bf16_functional_config() megatron.bridge.training.config.ConfigContainer#
Return shared Qwen3.5/Qwen3.6-VL 35B-A3B SFT for eight GB200 GPUs.
- bridge.recipes.qwen_vl.gb200.qwen35_vl.qwen35_vl_35b_a3b_peft_8gpu_gb200_bf16_functional_config() megatron.bridge.training.config.ConfigContainer#
Return shared Qwen3.5/Qwen3.6-VL 35B-A3B LoRA for eight GB200 GPUs.
- bridge.recipes.qwen_vl.gb200.qwen35_vl.__all__#
[‘qwen35_vl_27b_pretrain_16gpu_gb200_bf16_mock_config’, ‘qwen35_vl_35b_a3b_peft_8gpu_gb200_bf16_func…