mindspore/docs/api/api_python/dataset_text/mindspore.dataset.text.Sent...

20 lines
1.1 KiB
ReStructuredText
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

mindspore.dataset.text.SentencePieceTokenizer
=============================================
.. py:class:: mindspore.dataset.text.SentencePieceTokenizer(mode, out_type)
使用SentencePiece分词器对字符串进行分词。
参数:
- **mode** (Union[str, SentencePieceVocab]) - SentencePiece模型。
如果输入是字符串类型则代表要加载的SentencePiece模型文件的路径
如果输入是SentencePieceVocab类型则要求是构造好的 :class:`mindspore.dataset.text.SentencePieceVocab` 对象。
- **out_type** (SPieceTokenizerOutType) - 分词器输出的类型,可以取值为 SPieceTokenizerOutType.STRING 或 SPieceTokenizerOutType.INT。
- SPieceTokenizerOutType.STRING表示SentencePice分词器的输出类型是str。
- SPieceTokenizerOutType.INT表示SentencePice分词器的输出类型是int。
异常:
- **TypeError** - 参数 `mode` 的类型不是字符串或 :class:`mindspore.dataset.text.SentencePieceVocab`
- **TypeError** - 参数 `out_type` 的类型不是 :class:`mindspore.dataset.text.SPieceTokenizerOutType`