llava-1.5-7b-hf
llava-1.5-7b-hf
LLaVA (Large Language and Vision Assistant) is a pioneering open-source multimodal model connecting a vision encoder to a language model via a projection layer. Multiple versions and variants are supported via the llava-hf organization on Hugging Face.
Use this page as a checkpoint and architecture reference. Set up NeMo AutoModel with the latest container or follow the installation instructions.
Model Reference
Model Architecture
LlavaForConditionalGeneration- LLaVA 1.5LlavaNextForConditionalGeneration- LLaVA-NeXT / 1.6LlavaNextVideoForConditionalGeneration- LLaVA-NeXT-VideoLlavaOnevisionForConditionalGeneration- LLaVA-OneVision