forked from mindspore-Ecosystem/mindspore
1) extending _Linear's input as 4-dimension tensor: [outer_batch, expert_dim, -1, hidden], and _Liner's BatchMatMul becomes BatchMatMul(4_dim_tensor, 3_dim_tensor); 2) configuring the _Linear's BatchMatMul sharding strategy as [[dp, ep, 1, 1], [ep, 1, mp]]; 3) introducing a new parameter 'expert_parallel' in TransformerOpParallelConfig, creating a new class MoEParallelConfig to include 'data_parallel', 'model_parallel' and 'expert_parallel'; 4) changing parallel config for FeedForward, TransformerEncoderLayer, TransformerDecoderLayer. |
||
|---|---|---|
| .. | ||
| mindspore.nn.AttentionMask.rst | ||
| mindspore.nn.CrossEntropyLoss.rst | ||
| mindspore.nn.EmbeddingOpParallelConfig.rst | ||
| mindspore.nn.FeedForward.rst | ||
| mindspore.nn.FixedSparseAttention.rst | ||
| mindspore.nn.MoEConfig.rst | ||
| mindspore.nn.MultiHeadAttention.rst | ||
| mindspore.nn.OpParallelConfig.rst | ||
| mindspore.nn.Transformer.rst | ||
| mindspore.nn.TransformerDecoder.rst | ||
| mindspore.nn.TransformerDecoderLayer.rst | ||
| mindspore.nn.TransformerEncoder.rst | ||
| mindspore.nn.TransformerEncoderLayer.rst | ||
| mindspore.nn.TransformerOpParallelConfig.rst | ||
| mindspore.nn.VocabEmbedding.rst | ||