mindspore/docs/api/api_python/dataset_text/mindspore.dataset.text.Bert...

39 lines
3.2 KiB
ReStructuredText
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

mindspore.dataset.text.BertTokenizer
====================================
.. py:class:: mindspore.dataset.text.BertTokenizer(vocab, suffix_indicator='##', max_bytes_per_token=100, unknown_token='[UNK]', lower_case=False, keep_whitespace=False, normalization_form=NormalizeForm.NONE, preserve_unused_token=True, with_offsets=False)
使用Bert分词器对字符串进行分词。
.. note:: Windows平台尚不支持 `BertTokenizer`
参数:
- **vocab** (:class:`mindspore.dataset.text.Vocab`) - 用于查词的词汇表。
- **suffix_indicator** (str可选) - 用于指示子词后缀的前缀标志。默认值:'##'。
- **max_bytes_per_token** (int可选) - 分词最大长度超过此长度的词汇将不会被拆分。默认值100。
- **unknown_token** (str可选) - 对未知词汇的分词输出。当设置为空字符串时,直接返回对应未知词汇作为分词输出;否则,返回该字符串作为分词输出。默认值:'[UNK]'。
- **lower_case** (bool可选) - 是否对字符串进行小写转换处理。若为True会将字符串转换为小写并删除重音字符若为False将只对字符串进行规范化处理其模式由 `normalization_form` 指定。默认值False。
- **keep_whitespace** (bool可选) - 是否在分词输出中保留空格。默认值False。
- **normalization_form** (:class:`mindspore.dataset.text.NormalizeForm`,可选) - `Unicode规范化模式 <http://unicode.org/reports/tr15/>`_ ,仅当 `lower_case` 为False时生效取值可为NormalizeForm.NONE、NormalizeForm.NFC、NormalizeForm.NFKC、NormalizeForm.NFD或NormalizeForm.NFKD。默认值NormalizeForm.NONE。
- NormalizeForm.NONE不进行规范化处理。
- NormalizeForm.NFC先以标准等价方式分解再以标准等价方式重组。
- NormalizeForm.NFKC先以兼容等价方式分解再以标准等价方式重组。
- NormalizeForm.NFD以标准等价方式分解。
- NormalizeForm.NFKD以兼容等价方式分解。
- **preserve_unused_token** (bool可选) - 是否保留特殊词汇。若为True将不会对特殊词汇进行分词如 '[CLS]', '[SEP]', '[UNK]', '[PAD]', '[MASK]' 等。默认值True。
- **with_offsets** (bool可选) - 是否输出词汇在字符串中的偏移量。默认值False。
异常:
- **TypeError** - 当 `vocab` 的类型不为 :class:`mindspore.dataset.text.Vocab`
- **TypeError** - 当 `suffix_indicator` 的类型不为str。
- **TypeError** - 当 `max_bytes_per_token` 的类型不为int。
- **ValueError** - 当 `max_bytes_per_token` 为负数。
- **TypeError** - 当 `unknown_token` 的类型不为str。
- **TypeError** - 当 `lower_case` 的类型不为bool。
- **TypeError** - 当 `keep_whitespace` 的类型不为bool。
- **TypeError** - 当 `normalization_form` 的类型不为 :class:`mindspore.dataset.text.NormalizeForm`
- **TypeError** - 当 `preserve_unused_token` 的类型不为bool。
- **TypeError** - 当 `with_offsets` 的类型不为bool。