> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://docs.nvidia.com/nemo/curator/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://docs.nvidia.com/nemo/curator/_mcp/server.

# nemo_curator.stages.text.download

## Subpackages

* **[`nemo_curator.stages.text.download.arxiv`](/nemo-curator/nemo_curator/stages/text/download/arxiv)**
* **[`nemo_curator.stages.text.download.base`](/nemo-curator/nemo_curator/stages/text/download/base)**
* **[`nemo_curator.stages.text.download.common_crawl`](/nemo-curator/nemo_curator/stages/text/download/common_crawl)**
* **[`nemo_curator.stages.text.download.html_extractors`](/nemo-curator/nemo_curator/stages/text/download/html_extractors)**
* **[`nemo_curator.stages.text.download.wikipedia`](/nemo-curator/nemo_curator/stages/text/download/wikipedia)**

## Submodules

* **[`nemo_curator.stages.text.download.utils`](/nemo-curator/nemo_curator/stages/text/download/utils)**

## Package Contents

### Data

[`__all__`](#nemo_curator-stages-text-download-__all__)

### API

```python
nemo_curator.stages.text.download.__all__ = ['ArxivDownloadExtractStage', 'CommonCrawlDownloadExtractStage', 'DocumentDownlo...
```