llava-1.5-7b-hf

View as Markdown

LLaVA (Large Language and Vision Assistant) is a pioneering open-source multimodal model connecting a vision encoder to a language model via a projection layer. Multiple versions and variants are supported via the llava-hf organization on Hugging Face.

Use this page as a checkpoint and architecture reference. Set up NeMo AutoModel with the latest container or follow the installation instructions.

Model Reference

Model Architecture

PropertyValue
TaskImage-Text-to-Text
ArchitectureLlavaForConditionalGeneration / LlavaNextForConditionalGeneration
Parameters7B
Hugging Face Organizationllava-hf
  • LlavaForConditionalGeneration - LLaVA 1.5
  • LlavaNextForConditionalGeneration - LLaVA-NeXT / 1.6
  • LlavaNextVideoForConditionalGeneration - LLaVA-NeXT-Video
  • LlavaOnevisionForConditionalGeneration - LLaVA-OneVision

Available Models

ModelHF ID
LLaVA 1.5 7Bllava-hf/llava-1.5-7b-hf