core.tokenizers.utils.build_tokenizer#
Module Contents#
Functions#
Initialize tokenizer. |
|
Pad vocab size so it is divisible by model parallel size and still having GPU friendly size. |
|
Sets padded vocab size if None. |
Data#
API#
- core.tokenizers.utils.build_tokenizer.MEGATRON_TOKENIZERS#
[‘BertWordPieceLowerCase’, ‘BertWordPieceCase’, ‘GPT2BPETokenizer’]
- core.tokenizers.utils.build_tokenizer.SP_TOKENIZERS#
[‘SentencePieceTokenizer’, ‘GPTSentencePieceTokenizer’, ‘Llama2Tokenizer’]
- core.tokenizers.utils.build_tokenizer.SUPPORTED_TOKENIZERS#
None
- core.tokenizers.utils.build_tokenizer.logger#
‘getLogger(…)’
- core.tokenizers.utils.build_tokenizer.build_tokenizer(args, **kwargs)#
Initialize tokenizer.
- core.tokenizers.utils.build_tokenizer.vocab_size_with_padding(orig_vocab_size, args, logging_enabled=True)#
Pad vocab size so it is divisible by model parallel size and still having GPU friendly size.
- core.tokenizers.utils.build_tokenizer._set_padded_vocab_size(args, tokenizer)#
Sets padded vocab size if None.