49 KiB
子赛题一、评测数据集生成挑战赛
欢迎参加 评测数据集生成挑战赛 📊! 本比赛旨在构建一个标准化、可用于 GPU 性能测试的评测数据集,帮助开发者更高效地比较不同硬件和框架的性能表现。
💻 比赛背景简介
在 AI 模型开发和部署中,GPU 性能评测是一个非常重要的环节。 不同 GPU、不同深度学习框架(如 PyTorch、TensorFlow、PaddlePaddle 等)在运行相同任务时,速度、吞吐量、内存占用等表现差异很大。 本次挑战赛希望通过社区的力量,构建一个标准化、带权重的评测数据集,让 GPU 性能比较更加科学、公正。
🎯 比赛目标
-
从 PyTorch、PaddlePaddle、TensorFlow、Jax、MMCV、Transformers 等框架中收集并生成评测样本。
-
为每个样本提供标准输出和性能指标,确保结果可复现。
-
最终形成 GPU CodeForces 数据集和评价方法。
初次了解本类比赛的小伙伴可以查看以下两份文档,希望帮助你快速入门和上手: 赛题入门、代码解读。
✅ 算子实现状态
该清单由 scripts/update_operator_checklist.py 根据 scripts/operator_targets.txt 和 S1 codes/ 自动生成;新增待实现算子请写入目标清单,新增实现目录后运行 python scripts/update_operator_checklist.py --sync-targets 即可自动勾选。
- 已实现:578
- 未实现:0
- 跟踪总数:578
展开查看算子实现状态
| 状态 | 算子 | 实现目录 |
|---|---|---|
| [x] | aconc | hli28146_#25 |
| [x] | ActorCriticLoss | uucoco_#74 |
| [x] | adaptive_maxpool1d | ZZZJ_#83 |
| [x] | adaptive_maxpool3d | ZZZJ_#85 |
| [x] | Adaptivepiecewiselinear | gsd123_#32 |
| [x] | AdvantageLoss | uucoco_#75 |
| [x] | AdversarialLoss | uucoco_#76 |
| [x] | Affine+ReLU6 融合 | Ljy123_#13 |
| [x] | affine_grid3d | ZZZJ_#173 |
| [x] | affineleakyreluclamp | uucoco_#77 |
| [x] | AHAF | gsd123_#33 |
| [x] | AHerfReLU | hli28146_#86 |
| [x] | alpha_iou | ZZZJ_#16 |
| [x] | alphablend | ZZZJ_#174 |
| [x] | angle | hli28146_#35 |
| [x] | AngularDistance | gsd123_#62 |
| [x] | AngularLoss | uucoco_#57 |
| [x] | AOAF | hli28146_#102 |
| [x] | APALU | hli28146_#112 |
| [x] | AQuLU | hli28146_#105 |
| [x] | arcfaceloss | hli28146_#22 |
| [x] | ArcSinh-Affine-Gate | Ljy123_#116 |
| [x] | ArcSinTanh-Affine-Gate | Ljy123_#109 |
| [x] | Arctan-Affine-Gate | Ljy123_#97 |
| [x] | ARiA2 | hli28146_#66 |
| [x] | Atan-Sigmoid-Mix-Gate | LJy123_#50 |
| [x] | balanced_softmax_loss | hli28146_#46 |
| [x] | ball_query | ZZZJ_#175 |
| [x] | batchnorm1d | Icy_Cola10 |
| [x] | bce | wut0n_#8 |
| [x] | bcewithlogitsloss | ZZZJ 14 |
| [x] | BehaviorCloningLoss | uucoco_#79 |
| [x] | BellmanLoss | uucoco_#80 |
| [x] | BetaDivergenceLoss | uucoco_#81 |
| [x] | BhattacharyyaDistance | uucoco_#5 |
| [x] | Bias+GELU(tanh 近似) | Ljy123_#10 |
| [x] | Bias+SiLU(Swish)融合 | Ljy123_#11 |
| [x] | bilinear | zizi05_#6 |
| [x] | BilinearGLU | uucoco_#34 |
| [x] | Bipolar | uucoco_#31 |
| [x] | BipolarSigmoid | uucoco_#32 |
| [x] | black_scholes | ZZZJ_#135 |
| [x] | blurpool | ZZZJ_#134 |
| [x] | box_area | ZZZJ_#18 |
| [x] | box_corner_to_center | ZZZJ_#19 |
| [x] | box_iou | ZZZJ_#17 |
| [x] | boxfilter | ZZZJ_#21 |
| [x] | braycurtis | wut0n_#22 |
| [x] | braycurtis_adaptive_triplet | wut0n_#104 |
| [x] | bregman_divergence_gelu | uucoco_#117 |
| [x] | BregmanDivergenceLoss | uucoco_#82 |
| [x] | BReLU | uucoco_#33 |
| [x] | broadcast_tensors | ZZZJ_#180 |
| [x] | bucketize | ZZZJ_#181 |
| [x] | BYOLLoss | gsd123_#105 |
| [x] | canberra | wut0n_#21 |
| [x] | canberra_focalloss | wut0n_#88 |
| [x] | CanberraDistance | gsd123_#26 |
| [x] | cartesian_prod | ZZZJ_#182 |
| [x] | causal_mask | ZZZJ_#183 |
| [x] | CELU-Affine-Gate | Ljy123_#101 |
| [x] | CenterNetLoss | uucoco_#118 |
| [x] | Channel RMS Gate | Ljy123_#35 |
| [x] | Channel-Softmax-Affine gating | Ljy123_#33 |
| [x] | channel_permute | ZZZJ_#130 |
| [x] | channelmeangate | gsd123_#84 |
| [x] | ChannelShuffle | uucoco_#8 |
| [x] | CharbonnierLoss | uucoco_#10 |
| [x] | chebyshev | wut0n_#16 |
| [x] | chebyshev_abs_square | uucoco_#119 |
| [x] | chebyshev_hardswish | wut0n_#105 |
| [x] | chebyshev_leakyrelu | wut0n_#59 |
| [x] | chebyshev_sigmoid | wut0n_#42 |
| [x] | chebyshevaffine | gsd123_#87 |
| [x] | ChebyshevDistance | gsd123_#29 |
| [x] | cholesky | hli28146_#7 |
| [x] | circleloss | gsd123 18 gsd123_#9 |
| [x] | circularpad1d | ZZZJ_#184 |
| [x] | circularpad2d | ZZZJ_#185 |
| [x] | circularpad3d | ZZZJ_#186 |
| [x] | clarksDistance | gsd123_#28 |
| [x] | cmyk_to_rgb | ZZZJ_#50 |
| [x] | Colu | gsd123_#34 |
| [x] | column_stack | ZZZJ_#65 |
| [x] | ComboLoss | uucoco_#58 |
| [x] | complex_abs_angle_polar | uucoco_#83 |
| [x] | complex_conj_mul_div | uucoco_#84 |
| [x] | complex_exp_log_power | uucoco_#85 |
| [x] | complex_mul | ZZZJ_#66 |
| [x] | constantpad3d | ZZZJ_#189 |
| [x] | contrastiveloss | gsd123_#22 wut0n_#11 |
| [x] | conv2d | Icy_cola 11 |
| [x] | Cos-Affine-Gate | Ljy123_#43 Ljy123_#82 |
| [x] | cosfaceloss | hli28146_#21 |
| [x] | cosine | wut0n_#19 |
| [x] | Cosine-Affine-Gate | Ljy123_#113 |
| [x] | Cosine-Square-Affine-Gate | Ljy123_#49 |
| [x] | cosine_swish_gelu | uucoco_#120 |
| [x] | cosinedistance | wut0n_#15 |
| [x] | cosinedistance_softmax | wut0n_#58 |
| [x] | CosineEmbeddingLoss | gsd123 37 gsd123_#15 |
| [x] | cosineloss | ZZZJ_#1 |
| [x] | cosinesimilarity | wwmm_#2 |
| [x] | CoVariance | uucoco_#12 |
| [x] | crop_resize | ZZZJ_#190 |
| [x] | cross | ZZZJ_#164 |
| [x] | cross_layer_norm | ZZZJ_#136 |
| [x] | CrossEntropyDiceLoss | uucoco_#59 |
| [x] | CrossEntropyLoss | gsd123_#6 |
| [x] | CRReLU | hli28146_#115 |
| [x] | cumsum | hli28146_#11 |
| [x] | DecayingSineUnit | uucoco_#29 |
| [x] | deepnorm | hli28146_#32 |
| [x] | depthwise_conv1d | ZZZJ_#74 |
| [x] | dequantize_fp4 | ZZZJ_#86 |
| [x] | dequantize_int8 | ZZZJ_#87 |
| [x] | dequantize_linear | ZZZJ_#88 |
| [x] | dice | wut0n_#6 |
| [x] | dice_bce | wut0n_#110 |
| [x] | dice_from_2d | wut0n_#108 |
| [x] | DiceLoss | gsd123_#17 |
| [x] | DiceSimilarity | gsd123_#66 |
| [x] | digitization | ZZZJ_#191 |
| [x] | Dilation1d | ZZZJ_#107 |
| [x] | Dilation2d | ZZZJ_#108 |
| [x] | DistillationLoss | gsd123_#108 |
| [x] | dot_mse_tanh | uucoco_#121 |
| [x] | DoubleGLU | uucoco_#44 |
| [x] | dropblock1d | ZZZJ_#192 |
| [x] | DSiLU | hli28146_#107 |
| [x] | DSReLU | hli28146_#131 |
| [x] | Dual-Input Contrastive Gate | Ljy123_#34 |
| [x] | dw_transpose | ZZZJ_#54 |
| [x] | dw_transpose2d | ZZZJ_#55 |
| [x] | dw_transpose3d | ZZZJ_#56 |
| [x] | EIS1 | hli28146_#128 |
| [x] | EIS2 | hli28146_#129 |
| [x] | EIS3 | hli28146_#130 |
| [x] | ELU-Affine-Gate | Ljy123_#89 |
| [x] | ELUGLU | uucoco_#46 |
| [x] | embeddingbag | wwmm_#3 |
| [x] | EMDLoss | gsd123_#109 |
| [x] | Erf-Affine-Gate | Ljy123_#98 |
| [x] | ErfAct | hli28146_#91 |
| [x] | ErfReLU | hli28146_#87 |
| [x] | Erosion1d | ZZZJ_#110 |
| [x] | Erosion2d | ZZZJ_#111 |
| [x] | Esh | hli28146_#84 |
| [x] | euclidean | wut0n_#14 |
| [x] | euclidean_erfc | uucoco_#122 |
| [x] | evonorm | gsd123 13 gsd123_#5 |
| [x] | Exp-Square Affine Gate | Ljy123_#42 |
| [x] | Expm1+Affine | Ljy123_#29 |
| [x] | Expm1-Sigmoid-Affine-Gate | Ljy123_#51 |
| [x] | expnormalizelog | uucoco_#86 |
| [x] | ExponentialLinear-Affine-Gate | Ljy123_#120 |
| [x] | fake_quantize_per_channel_affine | hli28146_#37 |
| [x] | fake_quantize_per_tensor_affine | hli28146_#38 |
| [x] | farthest_point_sampling | ZZZJ_#116 |
| [x] | FastAPLoss | uucoco_#123 |
| [x] | FDivergenceLoss | uucoco_#87 |
| [x] | finite_difference | ZZZJ_#195 |
| [x] | fisherrao_rmsnorm | uucoco_#124 |
| [x] | FlattenT | gsd123_#53 |
| [x] | flip_horizontal | ZZZJ_#146 |
| [x] | fma_activation | wut0n_#36 |
| [x] | focal_eiou | ZZZJ_#15 |
| [x] | FocalLoss | gsd123_#18 wut0n_#2 |
| [x] | focalloss_fused | wut0n_#31 |
| [x] | focalloss_labelsmoothing | wut0n_#109 |
| [x] | focalloss_reduction | wut0n_#40 |
| [x] | focalloss_sigmoid | wut0n_#107 |
| [x] | focaltverskyloss | hli28146_#58 uucoco_#61 |
| [x] | fold | ZZZJ_#196 |
| [x] | fourieraffine | gsd123_#88 |
| [x] | FPFLU | hli28146_#127 |
| [x] | FReLU | gsd123_#45 |
| [x] | fresnel_schlick | ZZZJ_#144 |
| [x] | FTS | gsd123_#55 hli28146_#24 |
| [x] | FunnelActivationforVisualRecognition | gsd123_#46 |
| [x] | fused_adam_step | ZZZJ_#121 |
| [x] | fused_rmsprop_step | ZZZJ_#145 |
| [x] | gamma_correction | ZZZJ_#197 |
| [x] | GammaDivergenceLoss | uucoco_#88 |
| [x] | gateblendnormalize | uucoco_#89 |
| [x] | gather_elements | ZZZJ_#198 |
| [x] | Gaussian+Bias | Ljy123_#22 |
| [x] | Gaussian-Affine-Gate | Ljy123_#100 |
| [x] | gaussian_blur | ZZZJ_#113 |
| [x] | gaussian_filter_2d | ZZZJ_#114 |
| [x] | gaussian_pdf | ZZZJ_#120 |
| [x] | GaussianNLLLoss | hli28146_#113 uucoco 31 uucoco_#1 |
| [x] | GDL | hli28146_#55 |
| [x] | geglu | geglu_sample |
| [x] | GELU-Affine-Gate | Ljy123_#94 |
| [x] | gelu_dropout | Ljy123_#3 |
| [x] | gempool | hli28146_#12 |
| [x] | GeneratorLoss | gsd123_#19 |
| [x] | giouloss | hli28146_#13 |
| [x] | global_average_pooling | ZZZJ_#118 |
| [x] | global_response_normalization | ZZZJ_#119 |
| [x] | GLU(Gated Linear Unit)融合 | Ljy123_#12 |
| [x] | Gompertz-Affine-Gate | Ljy123_#123 |
| [x] | gowerdistance | uucoco_#50 |
| [x] | GradientClip | gsd123_#67 |
| [x] | gridsample1d | ZZZJ_#200 |
| [x] | Group-Softmax-Affine gating | Ljy123_#37 |
| [x] | groupnorm | wut0n_#5 ZZZJ2 |
| [x] | GrowingCosineUnit | uucoco_#35 |
| [x] | GTU(tanh(a) * sigmoid(b)) | Ljy123_#19 |
| [x] | GumbelCDF | hli28146_#82 |
| [x] | GumbelPDF | hli28146_#83 |
| [x] | hamming | wut0n_#20 |
| [x] | hamming_gelu | gsd123_#139 |
| [x] | hamming_relu | gsd123_#140 |
| [x] | hamming_sigmoid | gsd123_#141 |
| [x] | hamming_swish | gsd123_#142 |
| [x] | hamming_xor_and | uucoco_#125 |
| [x] | HammingDistance | uucoco_#4 |
| [x] | hardbootstrappingloss | hli28146_#42 |
| [x] | HardELiSH | uucoco_#36 |
| [x] | hardmish | gsd123_#36 zizi05_#8 |
| [x] | hardshrink | uucoco_#28 |
| [x] | HardShrink-Affine-Gate | Ljy123_#104 |
| [x] | HardSigmoid | uucoco_#27 |
| [x] | Hardsigmoid+Affine | Ljy123_#23 |
| [x] | HardSigmoid-Affine-Gate | Ljy123_#78 |
| [x] | HardSReLUE | hli28146_#110 |
| [x] | HardSwish | uucoco_#26 |
| [x] | Hardswish-Affine-Gate | Ljy123_#48 Ljy123_#95 |
| [x] | hardswishgate | gsd123_#89 |
| [x] | HardTanh | uucoco_#25 |
| [x] | HardTanh-Affine-Gate | Ljy123_#87 |
| [x] | hardtanhgate | gsd123_#90 |
| [x] | haversine_distance | ZZZJ_#117 |
| [x] | hellinger_bhattacharyya | gsd123_#147 |
| [x] | hellinger_gelu | gsd123_#148 |
| [x] | HellingerDistance | uucoco_#6 |
| [x] | hexpo | hli28146_#68 |
| [x] | hingeembeddingloss | ZZZJ 15 |
| [x] | hingeloss | wut0n_#13 |
| [x] | HistogramLoss | uucoco_#90 |
| [x] | Huber-Affine-Gate | Ljy1234_#107 |
| [x] | huber_loss_tukey_biweight | gsd123_#113 |
| [x] | huberloss | wut0n_#12 |
| [x] | HungarianLoss | uucoco_#126 |
| [x] | image_normalize | ZZZJ_#68 |
| [x] | ImitationLearningLoss | uucoco_#91 |
| [x] | infonceloss | gsd123 19 gsd123_#8 |
| [x] | Instancenorm | wut0n_#4 |
| [x] | instancenorm_dropout | wut0n_#34 |
| [x] | instancenorm_relu | wut0n_#35 |
| [x] | IntraClassCorrelation | uucoco_#11 |
| [x] | inverse_lerp | ZZZJ_#148 |
| [x] | InverseReinforcementLearningLoss | uucoco_#92 |
| [x] | InverseSquare-Affine-Gate | Ljy123_#122 |
| [x] | InvMultiquadratic | gsd123_#48 |
| [x] | iou_tanh | uucoco_#127 |
| [x] | IOULoss | uucoco_#17 |
| [x] | IpLU | hli28146_#95 |
| [x] | Isigmoid | hli28146_#124 |
| [x] | ISRLU | gsd123_#49 hli28146_#72 |
| [x] | ISRU | gsd123_#50 |
| [x] | ItakuraSaitoDistanceLoss | uucoco_#93 |
| [x] | jaccard_dice_sqrt | uucoco_#128 |
| [x] | jaccard_legendre | uucoco_#129 |
| [x] | JaccardSimilarity | uucoco_#9 |
| [x] | jaro_winkler_softmax | uucoco_#130 |
| [x] | jensenshannon_groupnorm | uucoco_#131 |
| [x] | jsdivergence | hli28146_#31 |
| [x] | kldiv_jsdiv_swish | uucoco_#132 |
| [x] | kldivloss | gsd123_#24 ZZZJ 29 |
| [x] | KulczynskiIndex | gsd123_#69 |
| [x] | kullbackleibler_layernorm | uucoco_#133 |
| [x] | l1 | wut0n_#9 |
| [x] | l1_fused | wut0n_#45 |
| [x] | l1loss | ZZZJ 26 |
| [x] | l2_normalize | ZZZJ_#126 |
| [x] | LaLU | hli28146_#104 |
| [x] | laplacian | ZZZJ_#127 |
| [x] | Laplacian-Affine-Gate | Ljy123_#105 |
| [x] | laplacian_filter | ZZZJ_#128 |
| [x] | layernorm | Ljy123_#1 wut0n_#1 |
| [x] | LDAMLoss | hli28146_#45 |
| [x] | Leaky-Swish+Bias | Ljy123_#31 |
| [x] | LeakyReGLU | uucoco_#37 |
| [x] | LeakyReLU-Affine-Gate | Ljy123_#79 |
| [x] | LeCunTanh | uucoco_#38 |
| [x] | legendreaffine | gsd123_#91 |
| [x] | linear_gelu | HHyy 43 |
| [x] | lisht | hli28146_#19 |
| [x] | localresponsenorm | ZZZJ 8 |
| [x] | Log1p(Square)+Bias | Ljy123_#27 |
| [x] | Log1pAbs-Affine-Gate | LJy123_#115 |
| [x] | logbeta | wut0n_#29 |
| [x] | LogCosh-Affine-Gate | Ljy123_#106 Ljy123_#58 |
| [x] | logcoshdiceloss | hli28146_#56 |
| [x] | LogCoshLoss | Lwh20070813 42 Lwh20070813_#2 |
| [x] | logdet | ZZZJ_#167 |
| [x] | logitsigmoidshift | uucoco_#95 |
| [x] | LogLU | hli28146_#75 |
| [x] | LogMeanExp | uucoco_#24 |
| [x] | LogSigmoid | uucoco_#23 |
| [x] | LogSigmoid Affine Gate | Ljy123_#41 |
| [x] | LogSigmoid-Affine-Gate | Ljy123_#96 |
| [x] | LogSumExp | gsd123_#71 hli28146_#10 wut0n_#28 |
| [x] | LogWeightedSumExp | uucoco_#22 |
| [x] | lp_pool2d | ZZZJ_#149 |
| [x] | lrn_simple | zizi05_#5 |
| [x] | Lsoftmaxloss | hli28146_#53 |
| [x] | MahalanobisDistanceLoss | uucoco_#96 |
| [x] | manhattan | wut0n_#17 |
| [x] | manhattan_distance_matrix | ZZZJ_#80 |
| [x] | manhattan_erf | uucoco_#134 |
| [x] | manhattan_hardswish | wut0n_#103 |
| [x] | manhattan_leakyrelu | wut0n_#60 |
| [x] | manhattan_mse | wut0n_#66 |
| [x] | manhattan_relu | wut0n_#62 |
| [x] | manhattan_sigmoid | wut0n_#61 |
| [x] | manhattan_sqrt | wut0n_#67 |
| [x] | manhattan_swish | wut0n_#64 |
| [x] | manhattan_tanh | wut0n_#65 |
| [x] | marcsinh | gsd123_#51 |
| [x] | marginrankingloss | ZZZJ 16 |
| [x] | matmul | HHyy 25 |
| [x] | maxunpool1d | ZZZJ_#11 |
| [x] | maxunpool2d | ZZZJ_#12 |
| [x] | meanstdnormalizeclip | uucoco_#97 |
| [x] | median_filter_3d | ZZZJ_#106 |
| [x] | MElliott | hli28146_#134 |
| [x] | MeshEdgeLoss | gsd123_#116 |
| [x] | MetaAconC | hli28146_#26 |
| [x] | minkowski | wut0n_#18 |
| [x] | minkowski_contrastiveloss | wut0n_#68 |
| [x] | minkowski_instancenorm | wut0n_#78 |
| [x] | minkowski_relu | wut0n_#74 |
| [x] | MinkowskiDistance | uucoco_#7 |
| [x] | minmax_observer | ZZZJ_#103 |
| [x] | minmaxscaleshift | uucoco_#98 |
| [x] | Mish | gsd123_#31 zizi05_#1 |
| [x] | Mish+Bias | Ljy123_#17 |
| [x] | Mish-Affine-Gate | Ljy123_#93 |
| [x] | MishB | uucoco_#62 |
| [x] | mishglu | hli28146_#59 uucoco_#39 |
| [x] | mixup | ZZZJ_#147 |
| [x] | MMReLU | hli28146_#94 |
| [x] | ModeSeekingLoss | uucoco_#99 |
| [x] | ModReLU | gsd123_#52 |
| [x] | ModSwish | hli28146_#114 |
| [x] | mseloss | wut0n_#10 ZZZJ 28 |
| [x] | MsewithLogitLoss | uucoco_#100 |
| [x] | mulaw_decoding | ZZZJ_#100 |
| [x] | mulaw_encoding | ZZZJ_#101 |
| [x] | multilabelmarginloss | gsd123_#73 hli28146 44 |
| [x] | multimarginloss | hli28146_#2 |
| [x] | Multiquadratic | gsd123_#54 |
| [x] | MutualInformation | uucoco_#51 |
| [x] | NIPUNA | hli28146_#85 |
| [x] | Nish | hli28146_#74 |
| [x] | NISRLU | hli28146_#73 |
| [x] | NLLLoss | uucoco 32 uucoco_#2 |
| [x] | NLReLU | hli28146_#78 |
| [x] | optional_get_element | ZZZJ_#22 |
| [x] | optional_has_element | ZZZJ_#23 |
| [x] | PAA | hli28146_#132 |
| [x] | pairwise_distance | zizi05_#3 |
| [x] | pairwisedistance | ZZZJ 38 |
| [x] | ParametricSigmoid | uucoco_#63 |
| [x] | PATS | hli28146_#88 |
| [x] | PearsonCorrelation | Lwh20070813 41 Lwh20070813_#1 |
| [x] | penalizedtanh | hli28146_#64 |
| [x] | PerceptualLoss | uucoco_#101 |
| [x] | permute | ZZZJ_#143 |
| [x] | PGELU | hli28146_#99 |
| [x] | piecewiseaffine | gsd123_#94 |
| [x] | PiecewiseLinearUnit | gsd123_#39 |
| [x] | poissonnllloss | gsd123 20 |
| [x] | polar_to_cartesian | ZZZJ_#132 |
| [x] | polaraffine | gsd123_#95 |
| [x] | poly1crossentropy | hli28146_#15 |
| [x] | poly1focalloss | hli28146_#16 |
| [x] | PolyLoss | uucoco_#64 |
| [x] | polynomial_eval | ZZZJ_#99 |
| [x] | polynomialaffine | gsd123_#96 |
| [x] | Power-Sigmoid-Affine-Gate | Ljy123_#46 |
| [x] | Power-Sigmoid-Gate | Ljy123_#21 |
| [x] | PPOLoss | uucoco_#102 |
| [x] | PReLU | uucoco_#40 |
| [x] | projectiveaffine | gsd123_#97 |
| [x] | Prototype-Cosine Gate | Ljy123_#36 |
| [x] | Pserf | hli28146_#92 |
| [x] | PseudoHuber-Affine-Gate | Ljy123_#99 |
| [x] | PSGU | hli28146_#101 |
| [x] | PSMish | uucoco_#42 |
| [x] | PTELU | hli28146_#122 |
| [x] | PTLU | uucoco_#65 |
| [x] | python | Ljy123_#67 |
| [x] | QLearningLoss | uucoco_#103 |
| [x] | QReLU | gsd123_#60 |
| [x] | QuantileLoss | hli28146_#69 uucoco_#66 |
| [x] | quantilenormalizeexpand | uucoco_#104 |
| [x] | RadialBasisFunction | uucoco_#43 |
| [x] | Range-Gate Affine | Ljy123_#39 |
| [x] | rangescalegate | uucoco_#68 |
| [x] | rangeshiftgate | uucoco_#69 |
| [x] | rank_normalize_scale | gsd123_#122 |
| [x] | ranknetloss | hli28146_#50 |
| [x] | ransac_normalize_outlier_reject | gsd123_#123 |
| [x] | RationalClip-Affine-Gate | Ljy123_#112 |
| [x] | RationalFunctionApproximator | uucoco_#52 |
| [x] | real_imag_hypot | uucoco_#105 |
| [x] | ReflectionPad3d | gsd123 22 |
| [x] | ReLTanh | hli28146_#125 |
| [x] | ReLU-Affine-Gate | Ljy123_#88 |
| [x] | ReLU6-Affine-Gate | Ljy123_#83 |
| [x] | ReLU^2 | Ljy123_#14 |
| [x] | RenyiDivergenceLoss | uucoco_#106 |
| [x] | repeat_interleave | ZZZJ_#102 |
| [x] | replicationpad1d | wwmm_#4 |
| [x] | replicationpad2d | wwmm_#5 |
| [x] | replicationpad3d | wwmm_#6 |
| [x] | RePU | hli28146_#60 |
| [x] | resistance_distance_exp | gsd123_#163 |
| [x] | resize_nearest | ZZZJ_#133 |
| [x] | rgb_to_bayer | ZZZJ_#36 |
| [x] | rgb_to_grayscale | ZZZJ_#41 |
| [x] | rgb_to_xyz | ZZZJ_#39 |
| [x] | rgb_to_yuv | ZZZJ_#47 |
| [x] | RMAF | hli28146_#121 |
| [x] | rmsnorm | Icy_cola9 Ljy123_#8 wut0n_#3 |
| [x] | rmsnorm_residual | wut0n_#32 |
| [x] | rmsnorm_silu | hli28146_#61 |
| [x] | robustscalegate | uucoco_#70 |
| [x] | robustscalehuber | uucoco_#107 |
| [x] | rogers_tanimoto_silu | gsd123_#164 |
| [x] | roiaware_pool1d | ZZZJ_#152 |
| [x] | roll2d | ZZZJ_#52 |
| [x] | roll3d | ZZZJ_#53 |
| [x] | rope | wwmm_#1 |
| [x] | SAAF | hli28146_#93 |
| [x] | SaRa | hli28146_#106 |
| [x] | SbPiPLU | hli28146_#116 |
| [x] | scalenorm | hli28146_#33 |
| [x] | scatter_add | ZZZJ#24 |
| [x] | scatter_div | ZZZJ_25 |
| [x] | scatter_nd | ZZZJ_#30 |
| [x] | sceloss | hli28146_#40 |
| [x] | SCLMish | hli28146_#119 |
| [x] | SCSwish | hli28146_#118 |
| [x] | segment_reduce | ZZZJ_#69 |
| [x] | SELU+Affine | Ljy123_#26 |
| [x] | SELU-Affine-Gate | Ljy123_#90 |
| [x] | selu_clip | zizi05_#4 |
| [x] | Sep | hli28146_#111 |
| [x] | separable_conv2d | ZZZJ_#141 |
| [x] | separable_conv3d | ZZZJ_#142 |
| [x] | serf | hli28146_#65 uucoco_#45 |
| [x] | Serlu | gsd123_#40 |
| [x] | ShiftedSincUnit | uucoco_#47 |
| [x] | Sigmoid+Clamp+Affine | Ljy123_#16 |
| [x] | Sigmoid-Affine-Gate | Ljy123_#85 |
| [x] | sigmoid_derivative | wut0n_#27 |
| [x] | sigmoid_focal_loss | ZZZJ_#131 |
| [x] | SigmoidGLU | uucoco_#53 |
| [x] | SigmoidSlope-Affine-Gate | Ljy123_#110 |
| [x] | SigmoidSquared-Affine-Gate | Ljy123_#117 |
| [x] | signmuladd | uucoco_#108 |
| [x] | SimCLRLoss | gsd123_#133 |
| [x] | Sin-Affine-Gate | Ljy123_#44 |
| [x] | Sinc-Affine-Gate | Ljy123_#92 |
| [x] | sincoshypot | uucoco_#109 |
| [x] | Sine-Affine-Gate | Ljy123_#114 |
| [x] | Sinh-Affine-Gate | Ljy123_#81 |
| [x] | SinLU | hli28146_#89 |
| [x] | SinuGaussian | uucoco_#71 |
| [x] | smelu | hli28146_#27 uucoco_#48 |
| [x] | SmoothAbs | gsd123_#74 |
| [x] | SmoothL1Loss | gsd123 40 gsd123_#13 |
| [x] | SmoothMaximum | gsd123_#75 |
| [x] | SmoothMinimum | gsd123_#76 |
| [x] | SmoothRamp | gsd123_#77 |
| [x] | SmoothStep | gsd123_#78 ZZZJ_#123 |
| [x] | SoftClip | uucoco_#21 |
| [x] | SoftClip+Affine | Ljy123_#30 |
| [x] | SoftExponential | uucoco_#20 |
| [x] | softmarginloss | hli28146 35 hli28146_#3 |
| [x] | softmax | Ljy123_#6 |
| [x] | softmin | uucoco_#14 |
| [x] | softplus | uucoco_#15 |
| [x] | Softplus+Bias | Ljy123_#15 |
| [x] | Softplus^2-Affine-Gate | Ljy123_#80 |
| [x] | Softplus^3-Affine-Gate | Ljy123_#102 |
| [x] | SoftplusGLU | uucoco_#54 |
| [x] | SoftplusSqrt-Affine-Gate | Ljy123_#108 |
| [x] | softshrink | uucoco_#16 |
| [x] | SoftShrink-Affine-Gate | Ljy123_#103 |
| [x] | softsign | uucoco_#18 |
| [x] | Softsign+Affine | Ljy123_#18 |
| [x] | SoftSign-Affine-Gate | Ljy123_#91 |
| [x] | Softsign-Sigmoid-Mix-Gate | Ljy123_#52 |
| [x] | SoftSignSquared-Affine-Gate | Ljy123_#119 |
| [x] | solarize | ZZZJ_#140 |
| [x] | Spatial-Diff Sigmoid Gate | Ljy123_#38 |
| [x] | spherefaceloss | hli28146_#23 |
| [x] | Spherical+Affine | Ljy123_#24 |
| [x] | SQRBF | gsd123_#59 |
| [x] | Sqrt(ReLU)+Affine | Ljy123_#28 |
| [x] | sqrtreciprocalrsqrt | uucoco_#110 |
| [x] | Square-Sigmoid-Affine-Gate | LJy123_#47 |
| [x] | squared_euclidean | wut0n_#23 |
| [x] | SquaredHingeLoss | uucoco_#72 |
| [x] | squareplus | ZZZJ_#124 |
| [x] | SReLU | uucoco_#49 |
| [x] | SRS | uucoco_#73 |
| [x] | std_mean | ZZZJ_#122 |
| [x] | STL | hli28146_#79 |
| [x] | structural_similarity_softplus | uucoco_#135 |
| [x] | SupConLoss | gsd123_#132 |
| [x] | SwAT | hli28146_#109 |
| [x] | swiglu | zizi05_#7 ZZZJ1 |
| [x] | swish | Ljy123_#7 |
| [x] | Swish(SiLU)-Affine-Gate | Ljy123_#86 |
| [x] | Swish^2+Bias | Ljy123_#25 |
| [x] | swish_layernorm | zizi05_10 |
| [x] | switchablenorm | ZZZJ 12 |
| [x] | SørensenDice | gsd123_#27 |
| [x] | Tanh-Affine-Gate | Ljy123_#45 Ljy123_#84 |
| [x] | tanhexp | hli28146_#20 |
| [x] | TanhGLU | uucoco_#55 |
| [x] | TanhLU | hli28146_#90 |
| [x] | tanhshrink | zizi05_#9 |
| [x] | Tanhshrink+Affine | Ljy123_#20 |
| [x] | TanhSlope-Affine-Gate | Ljy123_#111 |
| [x] | TanhSoft1 | hli28146_#96 |
| [x] | TanhSoft2 | hli28146_#97 |
| [x] | TanimotoCoefficient | uucoco 33 uucoco_#3 |
| [x] | TDLoss | uucoco_#111 |
| [x] | TeLU | hli28146_#80 |
| [x] | Temperature Softmax Channel Affine | Ljy123_#40 |
| [x] | tensor_roll | ZZZJ_#138 |
| [x] | three_interpolate | ZZZJ_#156 |
| [x] | thresholdscalenegate | uucoco_#112 |
| [x] | topk_filtering | ZZZJ_#139 |
| [x] | total_correlation_elu | uucoco_#136 |
| [x] | transpose_scale | ZZZJ_#125 |
| [x] | tripletloss | wut0n_#7 |
| [x] | tripletmarginloss | hli28146_#1 ZZZJ 30 |
| [x] | TripletMarginWithDistanceLoss | gsd123 39 gsd123_#14 |
| [x] | TrustRegionPolicyOptimizationLoss | uucoco_#113 |
| [x] | TsallisDivergenceLoss | uucoco_#114 |
| [x] | tversky_loss | ZZZJ_#72 |
| [x] | TverskyIndex | gsd123_#80 |
| [x] | tverskyloss | hli28146_#57 |
| [x] | TweedieLoss | gsd123_#100 |
| [x] | upsample | ZZZJ 21 |
| [x] | ValueLoss | uucoco_#115 |
| [x] | Variance | uucoco_#13 wut0n_#26 |
| [x] | VariationOfInformation | uucoco_#56 |
| [x] | vecdot | hli28146_#8 |
| [x] | VIDLoss | gsd123_#107 |
| [x] | voxel_hash | ZZZJ_#158 |
| [x] | voxel_mean | ZZZJ_#159 |
| [x] | voxel_to_point | ZZZJ_#160 |
| [x] | wasserstein_energy_gelu | uucoco_#137 |
| [x] | wasserstein_layernorm | gsd123_#166 |
| [x] | waveletaffine | gsd123_#101 |
| [x] | WeightDecay | gsd123_#81 |
| [x] | wingloss | hli28146_#14 |
| [x] | winsorize_scale_normalize | gsd123_#93 |
| [x] | wiou | ZZZJ_#33 |
| [x] | xIELU | hli28146_#77 |
| [x] | xSiLU | hli28146_#76 |
| [x] | xyz_to_rgb | ZZZJ_#38 |
| [x] | yuv_to_rgb | ZZZJ_#49 |
| [x] | zeropad2d | ZZZJ_#9 |
| [x] | zeropad3d | ZZZJ_#10 |
| [x] | zscoresigmoiddenormalize | uucoco_#116 |
| [x] | 仿射+ReLU | Ljy123_#9 |
📥 参赛流程
一句话概括:进入GPUCodeForces赛事首页,完成一份成功合并到仓库内的提交即为参赛成功!时间自由,方法自由,只要有灵感就可以动手开code~
🌰举个栗子
- 登录or注册自己的Gitlink账号后,进入赛事首页初步查看仓库内的文件内容:
.
├── S1(说明:第一季比赛名称,该目录下文件需选手自建)
│ ├── issue id 1(选手提交算子前创建的issue对应的id)
│ │ ├── cudacode.py(必要提交文件)
│ │ ├── torchcode.py(必要提交文件)
│ │ ├── run_code.py(必要提交文件)
│ │ ├── prompt.txt(必要提交文件)
│ ├── issue id 2
│ ├── issue id ...
├── example(样例提供,供大家上手)
│ ├── 001-example(文件结构与 issue id x 一致)
│ ├── 002-example
├── images(图片文件夹,参赛选手可忽略)
├── FAQ.md(社区收集的问题与解答)
├── LICENSE(证书,参赛选手可忽略)
├── README.md(赛题baseline)
├── how-to-contribute.md(提交指南看这里)
-
在S1文件夹的文件即为参赛选手需要提交的文件,其余文件夹和文件皆为辅助参赛选手了解比赛、提供思路、排忧解难之用。
-
我们将当前赛题的项目clone到本地电脑上(建议使用git clone + 链接的方式),在S1文件夹下创建一个以自己issue id命名的文件夹,待提交的参赛代码文件都放在这里面。
Tips:issue id ≠ issue名称,名称建议为对该算子的概括性描述。创建了issue后,链接末尾处的数字即为issue id。同时,也可以在issue界面的醒目位置查看如"#123"这样的数字标识。
-
做好了准备工作,就可以开始尽情发挥,去寻找算子亦或是优化算子。在example文件夹中提供了算子样例,如果想简单上手可以查看该文件夹。虽然有效的算子优化也算一次提交,但我们鼓励大家发现新的算子✨真正与其他选手拉开差距。
🔧简单介绍一下样例代码:
example_torchcode.py: 基准模型(Baseline)。示例提供一个简单的PyTorch模型,只包含一个ReLU激活函数。
example_cudacode.py:优化模型。示例使用PyTorch的load_inline功能直接编译和加载CUDA代码,创建了一个新的模型类,使用自定义CUDA实现替代PyTorch的ReLU。
run_code.py:验证和性能测试脚本。验证自定义CUDA实现与原始PyTorch实现的数值精度一致性,比较两种实现的性能,计算加速比。
prompt.txt:提示词文本。提供类似 “融合算子 CUDA 设计” 的 prompt 编写思路。
💡如何将一个example变为自己的一份提交,具体的算子优化思路可参考:GPUCodeForces赛题解读
-
为了测试代码最终的跑通结果,需要使用规定的GPU。在模力方舟平台上准备了大家此次需要的算力资源,使用免费的算力券购买实例,接着便可以在云端实例上进行代码修改和测试。
相关算力券的领取方式请见算力平台使用说明、算力券兑换发放和兑换。
Tips:进行云端服务器的实例选择有库存的即可,点击进入后需要确定配置。其余选项保持默认,只需更改镜像处的选择:基础镜像-->CV-CUDA-->PyTorch2.4.0-->Python任意-->maca 3.0.0.5 -
代码测试运行没有问题后,便可以准备提交了(记得将所有必要文件保存到提交文件夹)。提交流程如下,全程使用git:
# cd到自己克隆到本地的项目路径下,如:C:\Users\Desktop\ODTC AI Infra\GPUCodeForces git remote -v # 检查是否链接到自己的Gitlink仓库 git checkout -b dev # 新建一个分支,dev即分支名字可以任取 git add . # 将文件的变更操作暂存 git commit -m "输入你本次提交的目的" # 目的简洁明了最好 git push origin dev # 提交你的修改到分支上对git与远程仓库操作的疑问可以点击how-to-contribute.md查看详情。
-
顺利提交后的代码还只在你自己fork的仓库下,还需要和主仓库合并才能真正让管理员看到你的代码。
fork仓库(你自己的仓库)与主仓库之间关系如下:
ODTC AI Infra/GPUCodeForces(main) ├── ... ├── folders your_name/GPUCodeForces(main) # 自己仓库下的main分支内容与主仓库一致 ├── ... ├── folders your_name/GPUCodeForces(dev) # dev分支才是你修改后的代码存放处 ├── ... │ ├── your codes ├── folders进入自己的仓库,点击上方选项栏:
合并请求(PR)-->+新建合并请求-->源分支选择dev(名称任取)-->填写下方选框-->标题为自己的issue标题-->描述填请简明扼要,描述内关联自己的issue id(如“fixes #001”)提交后便能看到自己的PR记录了,在对应记录的评论区会有测试结果的告知,请留意查看~
🌳一份完整的提交流程如上,期待各位自由发挥,赛出风采与水平!
⏺如仍有疑问,请点击提交流程演示视频
⭐审核流程
- 你提交的PR都会得到回复,大概存在的几种情况如下
也就是说,除了能够自己在算力平台的实例上运行得到算子测算的初步结果外,还可以在这里看到最终的测算结果。这里显示测试通过才能进入后续审核流程,并最终上传至比赛的算子仓库。提交PR-->测试通过✔️-->已合并-->有效提交 ヽ(✿゚▽゚)ノ 提交PR-->测试通过✔️-->已关闭-->代码重复/相似-->无效提交 (;′⌒`) 提交PR-->测试失败✖️-->已关闭-->代码不合格-->无效提交 (;′⌒`)
✅ 参赛资格
- 你提交的PR样本中,至少有 1 个样本被评审通过并正式整合到“GPU CodeForces” 数据集,即可算作有效参赛。
⚠️注意事项
-
请勿抄袭他人代码或成果
-
请勿恶意提交(如相同算子多次提交、相近优化重复提交)
---相近优化:即指同一份参赛用例在优化后加速比没有提升或更低的用例提交 -
请遵守提交的格式要求、内容规范
🏅 竞赛排名机制
-
优先按接受数量从高到低排序作为排名,取前12名。
-
若接受数量相同:
-
比较总基础评分高者优先
-
若仍相同,比加分项得分高者优先
-
接受数量 = 提交并被评审通过的样本总数
接受数量相同需要区分排名时如下的评分规则才会生效
📈 评分规则
📊 基础得分
| 内容 | 分值 |
|---|---|
| 提供标准 GT 输出生成函数(Numpy-CPU / 原始框架实现) | +2 分 |
| CUDA 执行时间评估 | +5 分 |
| CUDA 吞吐量评估 | +4 分 |
| CUDA 内存带宽评估 | +3 分 |
✨ 加分项
| 内容 | 分值 |
|---|---|
| 提供 Prompt 让 LLM 生成对应的 CUDA 代码,并同样进行性能评价 | 额外加分 |
📚 术语解释
-
评测数据集:用来测试 GPU 性能的一组标准化样本,包括代码、输入数据和预期结果。
-
GT(Ground Truth):标准参考答案或结果,用来验证程序运行是否正确。
-
吞吐量(Throughput):每秒钟能处理的数据量,越高表示 GPU 处理能力越强。
-
内存带宽(Memory Bandwidth):单位时间内 GPU 内存与计算核心之间的数据传输速度。
-
Prompt:引导大语言模型(LLM)生成代码或内容的提示词。
-
LLM:Large Language Model,大语言模型,如 ChatGPT、LLaMA 等。
📬 联系与帮助
如需更多信息或格式说明,请查看官方文档或在本仓库提交想法进行讨论,或直接在交流群内与主办团队进行沟通。
祝各位挑战成功,贡献出高质量的 GPU 评测数据集!🚀