> This page is for version 26.07 · v1.3.0.
> For other versions, use one of these documentation indexes:
> - Latest · v1.4.0 (26.09) (default): https://docs.nvidia.com/nemo/curator/latest/llms.txt
> - Main · preview: https://docs.nvidia.com/nemo/curator/main/llms.txt
> - 26.09 · v1.4.0: https://docs.nvidia.com/nemo/curator/v26.09/llms.txt
> - 26.07 · v1.3.0: https://docs.nvidia.com/nemo/curator/v26.07/llms.txt
> - 26.04 · v1.2.0: https://docs.nvidia.com/nemo/curator/v26.04/llms.txt
> - 26.02 · v1.1.0: https://docs.nvidia.com/nemo/curator/v26.02/llms.txt
> - 25.09 · v1.0.0: https://docs.nvidia.com/nemo/curator/v25.09/llms.txt

> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/curator/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/curator/_mcp/server.

> Essential concepts for text data curation including loading and processing.

# Text Curation Concepts

This document covers the essential concepts for text data curation in NVIDIA NeMo Curator. These concepts assume basic familiarity with data science and machine learning principles.

## Core Concept Areas

Text curation in NeMo Curator focuses on these key areas:

#### [Text Curation Pipeline](/about/concepts/text/data/data-curation-pipeline)

Comprehensive overview of the end-to-end text curation architecture and workflow
overview architecture

#### [Data Loading](/about/concepts/text/data/loading)

Core concepts for loading and managing text datasets from local files
local-files formats

#### [Data Acquisition](/about/concepts/text/data/acquisition)

Components for downloading and extracting data from remote sources
remote-sources download

#### [Data Processing](/about/concepts/text/data/processing)

Concepts for filtering, deduplication, and classification
filtering quality

## Infrastructure Components

The text curation concepts build on NVIDIA NeMo Curator's core infrastructure components, which are shared across all modalities. These components include:

#### [Memory Management](/reference/infra/memory-management)

Optimize memory usage when processing large datasets
partitioning
batching
monitoring

#### [GPU Acceleration](/reference/infra/gpu-processing)

Leverage NVIDIA GPUs for faster data processing
cuda
rmm
performance

#### [Resumable Processing](/reference/infra/resumable-processing)

Continue interrupted operations across large datasets
checkpoints
recovery
batching