> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/curator/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/curator/_mcp/server.

# Audio Curation Concepts

> Essential concepts for audio data curation including ASR inference, quality assessment, and speech processing workflows

This guide covers the essential concepts for audio data curation in NVIDIA NeMo Curator. These concepts assume basic familiarity with speech processing and machine learning principles.

## Core Concept Areas

Audio curation in NVIDIA NeMo Curator focuses on these key areas:

#### [Audio Curation Pipeline](/about/concepts/audio/curation-pipeline)

Modality-level overview of ingest, validation, optional ASR, metrics, filtering, and export

#### [AudioBatch Structure](/about/concepts/audio/audio-batch)

Understanding the AudioBatch data structure and audio file management

#### [ASR Pipeline](/about/concepts/audio/asr-pipeline)

Comprehensive overview of the automatic speech recognition pipeline and workflow

#### [Quality Metrics](/about/concepts/audio/quality-metrics)

Core concepts for evaluating speech transcription quality and audio characteristics

#### [Dataset Manifests and Ingest](/about/concepts/audio/manifests-ingest)

Concepts for constructing manifests and ingesting audio datasets

#### [Text Integration](/about/concepts/audio/text-integration)

Concepts for integrating audio processing with text curation workflows

## Infrastructure Components

The audio curation concepts build on NVIDIA NeMo Curator's core infrastructure components, which are shared across all modalities. These components include:

#### [Memory Management](/reference/infra/memory-management)

Optimize memory usage when processing large audio datasets

#### [GPU Acceleration](/reference/infra/gpu-processing)

Leverage NVIDIA GPUs for faster ASR inference and audio processing

#### [Resumable Processing](/reference/infra/resumable-processing)

Continue interrupted operations across large audio datasets