Model CoverageOmniQwenQwen2.5-Omni-3B

Qwen2.5-Omni-3B

View as Markdown

Qwen2.5-Omni is Alibaba Cloud’s omnimodal model supporting text, image, audio, and video inputs in a single unified architecture with a dense language backbone. NeMo AutoModel onboards the Thinker stack for audio understanding tasks such as automatic speech recognition (ASR).

Set up NeMo AutoModel with the latest container or follow the installation instructions.

Fine-Tune Qwen2.5-Omni-3B

From the repository root, run:

uv run automodel --nproc-per-node=8 examples/audio_finetune/qwen2_5_omni_asr/ami_sft_3b.yaml

Choose a Workflow

GoalStart Here
ASR SFT - Qwen2.5-Omni 3B on the AMI meeting corpusUse ami_sft_3b.yaml. Dataset: AMI.

Model Reference

Model Architecture

PropertyValue
TaskOmnimodal (Text/Image/Audio/Video)
ArchitectureQwen2_5OmniForConditionalGeneration
Parameters3B
Hugging Face OrganizationQwen

The registry wires the Qwen2.5-Omni Thinker backbone under the following architecture keys:

  • Qwen2_5OmniForConditionalGeneration
  • Qwen2_5OmniModel
  • Qwen2_5OmniThinkerForConditionalGeneration

Available Models

ModelHF ID
Qwen2.5-Omni 3BQwen/Qwen2.5-Omni-3B