mindspore/docs/api/api_python/dataset/mindspore.dataset.InMemoryG...

53 lines
3.3 KiB
ReStructuredText
Raw Normal View History

2022-07-16 10:58:06 +08:00
mindspore.dataset.InMemoryGraphDataset
======================================
.. py:class:: mindspore.dataset.InMemoryGraphDataset(data_dir, save_dir="./processed", column_names="graph", num_samples=None, num_parallel_workers=1, shuffle=None, num_shards=None, shard_id=None, python_multiprocessing=True, max_rowsize=6)
用于将图数据加载到内存中的Dataset基类。
建议通过继承这个基类来实现相应的Dataset并实现对应的方法比如'process'、'save'和'load'。
参数:
- **data_dir** (str) - 加载数据集的目录,这里包含原始格式的数据,并将在 `process` 方法中被加载。
- **save_dir** (str) - 保存处理后得到的数据集的相对目录,该目录位于 `data_dir` 下面。
- **column_names** (Union[str, list[str]],可选) - dataset包含的单个列名或多个列名组成的列表默认值'Graph'。当实现类似 `__getitem__` 等方法时,列名的数量应该等于该方法中返回数据的条数。
- **num_samples** (int可选) - 指定从数据集中读取的样本数默认值None读取全部样本。
- **num_parallel_workers** (int可选) - 指定读取数据的工作进程数/线程数(由参数 `python_multiprocessing` 决定当前为多进程模式或多线程模式默认值1。
- **shuffle** (bool可选) - 是否混洗数据集。当实现的Dataset带有可随机访问属性 `__getitem__` 才可以指定该参数。默认值None。
- **num_shards** (int, 可选) - 指定分布式训练时将数据集进行划分的分片数默认值None。指定此参数后, `num_samples` 表示每个分片的最大样本数。
- **shard_id** (int, 可选) - 指定分布式训练时使用的分片ID号默认值None。只有当指定了 `num_shards` 时才能指定此参数。
- **python_multiprocessing** (bool可选) - 启用Python多进程模式加速运算默认值True。当传入 `source` 的Python对象的计算量很大时开启此选项可能会有较好效果。
- **max_rowsize** (int可选) - 指定在多进程之间复制数据时共享内存分配的最大空间默认值6单位为MB。仅当参数 `python_multiprocessing` 设为True时此参数才会生效。
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.add_sampler.rst
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.rst
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.b.rst
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.c.rst
.. include:: mindspore.dataset.Dataset.d.rst
2022-07-16 10:58:06 +08:00
.. py:method:: load()
从给定处理好的路径加载数据也可以在自己实现的Dataset类中实现这个方法。
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.e.rst
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. py:method:: process()
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
与原始数据集相关的处理方法建议在自定义的Dataset中重写此方法。
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. include:: mindspore.dataset.Dataset.f.rst
2022-07-16 10:58:06 +08:00
2022-07-21 10:55:35 +08:00
.. py:method:: save()
将经过 `process` 函数处理后的数据以 numpy.npz 格式保存到磁盘中也可以在自己实现的Dataset类中自己实现这个方法。
.. include:: mindspore.dataset.Dataset.g.rst
2022-07-16 10:58:06 +08:00
.. include:: mindspore.dataset.Dataset.use_sampler.rst
.. include:: mindspore.dataset.Dataset.zip.rst