> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/curator/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/curator/_mcp/server.

> Core concepts and terminology for NeMo Curator across text, image, video, and audio data curation modalities

# Concepts

Learn about the core components and concepts introduced by NeMo Curator.

## Modality Concepts

Learn about working with specific modalities using NeMo Curator.

#### [Text Curation Concepts](/about/concepts/text)

Learn about text data curation, covering data loading and processing (filtering, classification, deduplication).

#### [Image Curation Concepts](/about/concepts/image)

Explore key concepts for image data curation, including scalable loading, processing (embedding, classification, filtering), and dataset export.

#### [Video Curation Concepts](/about/concepts/video)

Discover video data curation concepts, such as distributed processing, pipeline stages, execution modes, and efficient data flow.

#### [Audio Curation Concepts](/about/concepts/audio)

Learn about speech data curation, ASR inference, quality assessment, and audio-text integration workflows.

## Universal Concepts

Core concepts that apply across all modalities in NeMo Curator.

#### [Deduplication](/about/concepts/deduplication)

Comprehensive overview of deduplication techniques across text, image, and video modalities including exact, fuzzy, and semantic approaches.

#### [Resource Allocation](/about/concepts/scaling/resource-allocation)

How NeMo Curator allocates CPUs, GPUs, and memory across pipeline stages for optimal hardware utilization.

#### [Streaming](/about/concepts/scaling/streaming)

How streaming execution processes data in batches for constant memory usage and higher GPU utilization.

#### [Auto-Balancing](/about/concepts/scaling/auto-balancing)

How the executor automatically balances resources across pipeline stages to eliminate bottlenecks.

#### [Throughput](/about/concepts/scaling/throughput)

Scale from a single GPU to multi-node clusters with near-linear scaling.