mindspore/docs/api/api_python/mindspore.dataset.text.rst

73 lines
2.2 KiB
ReStructuredText
Raw Normal View History

2022-02-11 17:34:24 +08:00
mindspore.dataset.text
======================
2022-02-22 15:25:59 +08:00
此模块用于文本数据增强,包括 `transforms``utils` 两个子模块。
2022-02-17 16:26:58 +08:00
2022-02-22 15:25:59 +08:00
`transforms` 是一个高性能文本数据增强模块,支持常见的文本数据增强处理。
`utils` 提供了一些文本处理的工具方法。
在API示例中常用的模块导入方法如下
2022-02-17 16:26:58 +08:00
.. code-block::
import mindspore.dataset as ds
from mindspore.dataset import text
2022-02-11 17:34:24 +08:00
常用数据处理术语说明如下:
- TensorOperation所有C++实现的数据处理操作的基类。
- TextTensorOperation所有文本数据处理操作的基类派生自TensorOperation。
2022-06-21 11:53:31 +08:00
变换
2022-06-22 15:07:38 +08:00
-----
2022-02-11 17:34:24 +08:00
2022-02-22 15:25:59 +08:00
.. mscnnoteautosummary::
2022-02-11 17:34:24 +08:00
:toctree: dataset_text
:nosignatures:
:template: classtemplate.rst
2022-06-14 19:44:33 +08:00
mindspore.dataset.text.BasicTokenizer
mindspore.dataset.text.BertTokenizer
mindspore.dataset.text.CaseFold
mindspore.dataset.text.FilterWikipediaXML
mindspore.dataset.text.JiebaTokenizer
mindspore.dataset.text.Lookup
mindspore.dataset.text.Ngram
mindspore.dataset.text.NormalizeUTF8
mindspore.dataset.text.PythonTokenizer
mindspore.dataset.text.RegexReplace
mindspore.dataset.text.RegexTokenizer
mindspore.dataset.text.SentencePieceTokenizer
mindspore.dataset.text.SlidingWindow
mindspore.dataset.text.ToNumber
mindspore.dataset.text.ToVectors
mindspore.dataset.text.TruncateSequencePair
mindspore.dataset.text.UnicodeCharTokenizer
mindspore.dataset.text.UnicodeScriptTokenizer
mindspore.dataset.text.WhitespaceTokenizer
mindspore.dataset.text.WordpieceTokenizer
2022-02-11 17:34:24 +08:00
2022-06-21 11:53:31 +08:00
工具
2022-06-22 15:07:38 +08:00
-----
2022-02-11 17:34:24 +08:00
2022-02-22 15:25:59 +08:00
.. mscnnoteautosummary::
2022-02-11 17:34:24 +08:00
:toctree: dataset_text
:nosignatures:
:template: classtemplate.rst
2022-06-14 19:44:33 +08:00
mindspore.dataset.text.CharNGram
mindspore.dataset.text.FastText
mindspore.dataset.text.GloVe
2022-02-11 17:34:24 +08:00
mindspore.dataset.text.JiebaMode
mindspore.dataset.text.NormalizeForm
mindspore.dataset.text.SentencePieceModel
mindspore.dataset.text.SentencePieceVocab
mindspore.dataset.text.SPieceTokenizerLoadType
mindspore.dataset.text.SPieceTokenizerOutType
2022-06-14 19:44:33 +08:00
mindspore.dataset.text.Vectors
2022-02-11 17:34:24 +08:00
mindspore.dataset.text.Vocab
2022-06-14 19:44:33 +08:00
mindspore.dataset.text.to_bytes
mindspore.dataset.text.to_str