mindspore/docs/api/api_python/dataset_text/mindspore.dataset.text.Basi...

31 lines
2.3 KiB
ReStructuredText
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

mindspore.dataset.text.BasicTokenizer
======================================
.. py:class:: mindspore.dataset.text.BasicTokenizer(lower_case=False, keep_whitespace=False, normalization_form=NormalizeForm.NONE, preserve_unused_token=True, with_offsets=False)
按照指定规则对输入的UTF-8编码字符串进行分词。
.. note:: Windows平台尚不支持 `BasicTokenizer`
参数:
- **lower_case** (bool可选) - 是否对字符串进行小写转换处理。若为True会将字符串转换为小写并删除重音字符若为False将只对字符串进行规范化处理其模式由 `normalization_form` 指定。默认值False。
- **keep_whitespace** (bool可选) - 是否在分词输出中保留空格。默认值False。
- **normalization_form** (:class:`mindspore.dataset.text.NormalizeForm`,可选) - `Unicode规范化模式 <http://unicode.org/reports/tr15/>`_ ,仅当 `lower_case` 为False时生效取值可为NormalizeForm.NONE、NormalizeForm.NFC、NormalizeForm.NFKC、NormalizeForm.NFD或NormalizeForm.NFKD。默认值NormalizeForm.NONE。
- NormalizeForm.NONE不进行规范化处理。
- NormalizeForm.NFC先以标准等价方式分解再以标准等价方式重组。
- NormalizeForm.NFKC先以兼容等价方式分解再以标准等价方式重组。
- NormalizeForm.NFD以标准等价方式分解。
- NormalizeForm.NFKD以兼容等价方式分解。
- **preserve_unused_token** (bool可选) - 是否保留特殊词汇。若为True将不会对特殊词汇进行分词如 '[CLS]', '[SEP]', '[UNK]', '[PAD]', '[MASK]' 等。默认值True。
- **with_offsets** (bool可选) - 是否输出词汇在字符串中的偏移量。默认值False。
异常:
- **TypeError** - 当 `lower_case` 的类型不为bool。
- **TypeError** - 当 `keep_whitespace` 的类型不为bool。
- **TypeError** - 当 `normalization_form` 的类型不为 :class:`mindspore.dataset.text.NormalizeForm`
- **TypeError** - 当 `preserve_unused_token` 的类型不为bool。
- **TypeError** - 当 `with_offsets` 的类型不为bool。
- **RuntimeError** - 当输入Tensor的数据类型不为str。