Go to file
YuxuanFan 5dcbd90d82 Add GEGLU operator sample 2026-04-26 01:56:32 -07:00
.gitee/ISSUE_TEMPLATE update ISSUE_TEMPLATE 2025-08-28 18:31:12 +08:00
S1 codes Add GEGLU operator sample 2026-04-26 01:56:32 -07:00
example Delete example/.DS_Store 2025-11-13 15:38:21 +08:00
images 删除冗余文件 2025-10-29 12:13:28 +08:00
scripts Add GEGLU operator sample 2026-04-26 01:56:32 -07:00
FAQ.md update FAQ.md. 2025-09-04 02:26:20 +00:00
GPUCodeForces代码解读.md add GPUCodeForces赛题入门 2025-10-29 10:47:57 +08:00
GPUCodeForces赛题入门.md add GPUCodeForces赛题入门 2025-10-29 10:47:57 +08:00
LICENSE add LICENSE. 2025-08-11 14:46:43 +00:00
README.md Add GEGLU operator sample 2026-04-26 01:56:32 -07:00
how-to-contribute.md update how-to-contribute.md 2025-09-26 13:56:37 +08:00

README.md

子赛题一、评测数据集生成挑战赛

欢迎参加 评测数据集生成挑战赛 📊!   本比赛旨在构建一个标准化、可用于 GPU 性能测试的评测数据集帮助开发者更高效地比较不同硬件和框架的性能表现。


💻 比赛背景简介

在 AI 模型开发和部署中GPU 性能评测是一个非常重要的环节。   不同 GPU、不同深度学习框架如 PyTorch、TensorFlow、PaddlePaddle 等在运行相同任务时速度、吞吐量、内存占用等表现差异很大。   本次挑战赛希望通过社区的力量,构建一个标准化、带权重的评测数据集让 GPU 性能比较更加科学、公正。


🎯 比赛目标

  • 从 PyTorch、PaddlePaddle、TensorFlow、Jax、MMCV、Transformers 等框架中收集并生成评测样本。

  • 为每个样本提供标准输出性能指标,确保结果可复现。

  • 最终形成 GPU CodeForces 数据集和评价方法。

初次了解本类比赛的小伙伴可以查看以下两份文档,希望帮助你快速入门和上手: 赛题入门代码解读


算子实现状态

该清单由 scripts/update_operator_checklist.py 根据 scripts/operator_targets.txtS1 codes/ 自动生成;新增待实现算子请写入目标清单,新增实现目录后运行 python scripts/update_operator_checklist.py --sync-targets 即可自动勾选。

  • 已实现578
  • 未实现0
  • 跟踪总数578
展开查看算子实现状态
状态 算子 实现目录
[x] aconc hli28146_#25
[x] ActorCriticLoss uucoco_#74
[x] adaptive_maxpool1d ZZZJ_#83
[x] adaptive_maxpool3d ZZZJ_#85
[x] Adaptivepiecewiselinear gsd123_#32
[x] AdvantageLoss uucoco_#75
[x] AdversarialLoss uucoco_#76
[x] Affine+ReLU6 融合 Ljy123_#13
[x] affine_grid3d ZZZJ_#173
[x] affineleakyreluclamp uucoco_#77
[x] AHAF gsd123_#33
[x] AHerfReLU hli28146_#86
[x] alpha_iou ZZZJ_#16
[x] alphablend ZZZJ_#174
[x] angle hli28146_#35
[x] AngularDistance gsd123_#62
[x] AngularLoss uucoco_#57
[x] AOAF hli28146_#102
[x] APALU hli28146_#112
[x] AQuLU hli28146_#105
[x] arcfaceloss hli28146_#22
[x] ArcSinh-Affine-Gate Ljy123_#116
[x] ArcSinTanh-Affine-Gate Ljy123_#109
[x] Arctan-Affine-Gate Ljy123_#97
[x] ARiA2 hli28146_#66
[x] Atan-Sigmoid-Mix-Gate LJy123_#50
[x] balanced_softmax_loss hli28146_#46
[x] ball_query ZZZJ_#175
[x] batchnorm1d Icy_Cola10
[x] bce wut0n_#8
[x] bcewithlogitsloss ZZZJ 14
[x] BehaviorCloningLoss uucoco_#79
[x] BellmanLoss uucoco_#80
[x] BetaDivergenceLoss uucoco_#81
[x] BhattacharyyaDistance uucoco_#5
[x] Bias+GELUtanh 近似) Ljy123_#10
[x] Bias+SiLUSwish融合 Ljy123_#11
[x] bilinear zizi05_#6
[x] BilinearGLU uucoco_#34
[x] Bipolar uucoco_#31
[x] BipolarSigmoid uucoco_#32
[x] black_scholes ZZZJ_#135
[x] blurpool ZZZJ_#134
[x] box_area ZZZJ_#18
[x] box_corner_to_center ZZZJ_#19
[x] box_iou ZZZJ_#17
[x] boxfilter ZZZJ_#21
[x] braycurtis wut0n_#22
[x] braycurtis_adaptive_triplet wut0n_#104
[x] bregman_divergence_gelu uucoco_#117
[x] BregmanDivergenceLoss uucoco_#82
[x] BReLU uucoco_#33
[x] broadcast_tensors ZZZJ_#180
[x] bucketize ZZZJ_#181
[x] BYOLLoss gsd123_#105
[x] canberra wut0n_#21
[x] canberra_focalloss wut0n_#88
[x] CanberraDistance gsd123_#26
[x] cartesian_prod ZZZJ_#182
[x] causal_mask ZZZJ_#183
[x] CELU-Affine-Gate Ljy123_#101
[x] CenterNetLoss uucoco_#118
[x] Channel RMS Gate Ljy123_#35
[x] Channel-Softmax-Affine gating Ljy123_#33
[x] channel_permute ZZZJ_#130
[x] channelmeangate gsd123_#84
[x] ChannelShuffle uucoco_#8
[x] CharbonnierLoss uucoco_#10
[x] chebyshev wut0n_#16
[x] chebyshev_abs_square uucoco_#119
[x] chebyshev_hardswish wut0n_#105
[x] chebyshev_leakyrelu wut0n_#59
[x] chebyshev_sigmoid wut0n_#42
[x] chebyshevaffine gsd123_#87
[x] ChebyshevDistance gsd123_#29
[x] cholesky hli28146_#7
[x] circleloss gsd123 18
gsd123_#9
[x] circularpad1d ZZZJ_#184
[x] circularpad2d ZZZJ_#185
[x] circularpad3d ZZZJ_#186
[x] clarksDistance gsd123_#28
[x] cmyk_to_rgb ZZZJ_#50
[x] Colu gsd123_#34
[x] column_stack ZZZJ_#65
[x] ComboLoss uucoco_#58
[x] complex_abs_angle_polar uucoco_#83
[x] complex_conj_mul_div uucoco_#84
[x] complex_exp_log_power uucoco_#85
[x] complex_mul ZZZJ_#66
[x] constantpad3d ZZZJ_#189
[x] contrastiveloss gsd123_#22
wut0n_#11
[x] conv2d Icy_cola 11
[x] Cos-Affine-Gate Ljy123_#43
Ljy123_#82
[x] cosfaceloss hli28146_#21
[x] cosine wut0n_#19
[x] Cosine-Affine-Gate Ljy123_#113
[x] Cosine-Square-Affine-Gate Ljy123_#49
[x] cosine_swish_gelu uucoco_#120
[x] cosinedistance wut0n_#15
[x] cosinedistance_softmax wut0n_#58
[x] CosineEmbeddingLoss gsd123 37
gsd123_#15
[x] cosineloss ZZZJ_#1
[x] cosinesimilarity wwmm_#2
[x] CoVariance uucoco_#12
[x] crop_resize ZZZJ_#190
[x] cross ZZZJ_#164
[x] cross_layer_norm ZZZJ_#136
[x] CrossEntropyDiceLoss uucoco_#59
[x] CrossEntropyLoss gsd123_#6
[x] CRReLU hli28146_#115
[x] cumsum hli28146_#11
[x] DecayingSineUnit uucoco_#29
[x] deepnorm hli28146_#32
[x] depthwise_conv1d ZZZJ_#74
[x] dequantize_fp4 ZZZJ_#86
[x] dequantize_int8 ZZZJ_#87
[x] dequantize_linear ZZZJ_#88
[x] dice wut0n_#6
[x] dice_bce wut0n_#110
[x] dice_from_2d wut0n_#108
[x] DiceLoss gsd123_#17
[x] DiceSimilarity gsd123_#66
[x] digitization ZZZJ_#191
[x] Dilation1d ZZZJ_#107
[x] Dilation2d ZZZJ_#108
[x] DistillationLoss gsd123_#108
[x] dot_mse_tanh uucoco_#121
[x] DoubleGLU uucoco_#44
[x] dropblock1d ZZZJ_#192
[x] DSiLU hli28146_#107
[x] DSReLU hli28146_#131
[x] Dual-Input Contrastive Gate Ljy123_#34
[x] dw_transpose ZZZJ_#54
[x] dw_transpose2d ZZZJ_#55
[x] dw_transpose3d ZZZJ_#56
[x] EIS1 hli28146_#128
[x] EIS2 hli28146_#129
[x] EIS3 hli28146_#130
[x] ELU-Affine-Gate Ljy123_#89
[x] ELUGLU uucoco_#46
[x] embeddingbag wwmm_#3
[x] EMDLoss gsd123_#109
[x] Erf-Affine-Gate Ljy123_#98
[x] ErfAct hli28146_#91
[x] ErfReLU hli28146_#87
[x] Erosion1d ZZZJ_#110
[x] Erosion2d ZZZJ_#111
[x] Esh hli28146_#84
[x] euclidean wut0n_#14
[x] euclidean_erfc uucoco_#122
[x] evonorm gsd123 13
gsd123_#5
[x] Exp-Square Affine Gate Ljy123_#42
[x] Expm1+Affine Ljy123_#29
[x] Expm1-Sigmoid-Affine-Gate Ljy123_#51
[x] expnormalizelog uucoco_#86
[x] ExponentialLinear-Affine-Gate Ljy123_#120
[x] fake_quantize_per_channel_affine hli28146_#37
[x] fake_quantize_per_tensor_affine hli28146_#38
[x] farthest_point_sampling ZZZJ_#116
[x] FastAPLoss uucoco_#123
[x] FDivergenceLoss uucoco_#87
[x] finite_difference ZZZJ_#195
[x] fisherrao_rmsnorm uucoco_#124
[x] FlattenT gsd123_#53
[x] flip_horizontal ZZZJ_#146
[x] fma_activation wut0n_#36
[x] focal_eiou ZZZJ_#15
[x] FocalLoss gsd123_#18
wut0n_#2
[x] focalloss_fused wut0n_#31
[x] focalloss_labelsmoothing wut0n_#109
[x] focalloss_reduction wut0n_#40
[x] focalloss_sigmoid wut0n_#107
[x] focaltverskyloss hli28146_#58
uucoco_#61
[x] fold ZZZJ_#196
[x] fourieraffine gsd123_#88
[x] FPFLU hli28146_#127
[x] FReLU gsd123_#45
[x] fresnel_schlick ZZZJ_#144
[x] FTS gsd123_#55
hli28146_#24
[x] FunnelActivationforVisualRecognition gsd123_#46
[x] fused_adam_step ZZZJ_#121
[x] fused_rmsprop_step ZZZJ_#145
[x] gamma_correction ZZZJ_#197
[x] GammaDivergenceLoss uucoco_#88
[x] gateblendnormalize uucoco_#89
[x] gather_elements ZZZJ_#198
[x] Gaussian+Bias Ljy123_#22
[x] Gaussian-Affine-Gate Ljy123_#100
[x] gaussian_blur ZZZJ_#113
[x] gaussian_filter_2d ZZZJ_#114
[x] gaussian_pdf ZZZJ_#120
[x] GaussianNLLLoss hli28146_#113
uucoco 31
uucoco_#1
[x] GDL hli28146_#55
[x] geglu geglu_sample
[x] GELU-Affine-Gate Ljy123_#94
[x] gelu_dropout Ljy123_#3
[x] gempool hli28146_#12
[x] GeneratorLoss gsd123_#19
[x] giouloss hli28146_#13
[x] global_average_pooling ZZZJ_#118
[x] global_response_normalization ZZZJ_#119
[x] GLUGated Linear Unit融合 Ljy123_#12
[x] Gompertz-Affine-Gate Ljy123_#123
[x] gowerdistance uucoco_#50
[x] GradientClip gsd123_#67
[x] gridsample1d ZZZJ_#200
[x] Group-Softmax-Affine gating Ljy123_#37
[x] groupnorm wut0n_#5
ZZZJ2
[x] GrowingCosineUnit uucoco_#35
[x] GTUtanh(a) * sigmoid(b) Ljy123_#19
[x] GumbelCDF hli28146_#82
[x] GumbelPDF hli28146_#83
[x] hamming wut0n_#20
[x] hamming_gelu gsd123_#139
[x] hamming_relu gsd123_#140
[x] hamming_sigmoid gsd123_#141
[x] hamming_swish gsd123_#142
[x] hamming_xor_and uucoco_#125
[x] HammingDistance uucoco_#4
[x] hardbootstrappingloss hli28146_#42
[x] HardELiSH uucoco_#36
[x] hardmish gsd123_#36
zizi05_#8
[x] hardshrink uucoco_#28
[x] HardShrink-Affine-Gate Ljy123_#104
[x] HardSigmoid uucoco_#27
[x] Hardsigmoid+Affine Ljy123_#23
[x] HardSigmoid-Affine-Gate Ljy123_#78
[x] HardSReLUE hli28146_#110
[x] HardSwish uucoco_#26
[x] Hardswish-Affine-Gate Ljy123_#48
Ljy123_#95
[x] hardswishgate gsd123_#89
[x] HardTanh uucoco_#25
[x] HardTanh-Affine-Gate Ljy123_#87
[x] hardtanhgate gsd123_#90
[x] haversine_distance ZZZJ_#117
[x] hellinger_bhattacharyya gsd123_#147
[x] hellinger_gelu gsd123_#148
[x] HellingerDistance uucoco_#6
[x] hexpo hli28146_#68
[x] hingeembeddingloss ZZZJ 15
[x] hingeloss wut0n_#13
[x] HistogramLoss uucoco_#90
[x] Huber-Affine-Gate Ljy1234_#107
[x] huber_loss_tukey_biweight gsd123_#113
[x] huberloss wut0n_#12
[x] HungarianLoss uucoco_#126
[x] image_normalize ZZZJ_#68
[x] ImitationLearningLoss uucoco_#91
[x] infonceloss gsd123 19
gsd123_#8
[x] Instancenorm wut0n_#4
[x] instancenorm_dropout wut0n_#34
[x] instancenorm_relu wut0n_#35
[x] IntraClassCorrelation uucoco_#11
[x] inverse_lerp ZZZJ_#148
[x] InverseReinforcementLearningLoss uucoco_#92
[x] InverseSquare-Affine-Gate Ljy123_#122
[x] InvMultiquadratic gsd123_#48
[x] iou_tanh uucoco_#127
[x] IOULoss uucoco_#17
[x] IpLU hli28146_#95
[x] Isigmoid hli28146_#124
[x] ISRLU gsd123_#49
hli28146_#72
[x] ISRU gsd123_#50
[x] ItakuraSaitoDistanceLoss uucoco_#93
[x] jaccard_dice_sqrt uucoco_#128
[x] jaccard_legendre uucoco_#129
[x] JaccardSimilarity uucoco_#9
[x] jaro_winkler_softmax uucoco_#130
[x] jensenshannon_groupnorm uucoco_#131
[x] jsdivergence hli28146_#31
[x] kldiv_jsdiv_swish uucoco_#132
[x] kldivloss gsd123_#24
ZZZJ 29
[x] KulczynskiIndex gsd123_#69
[x] kullbackleibler_layernorm uucoco_#133
[x] l1 wut0n_#9
[x] l1_fused wut0n_#45
[x] l1loss ZZZJ 26
[x] l2_normalize ZZZJ_#126
[x] LaLU hli28146_#104
[x] laplacian ZZZJ_#127
[x] Laplacian-Affine-Gate Ljy123_#105
[x] laplacian_filter ZZZJ_#128
[x] layernorm Ljy123_#1
wut0n_#1
[x] LDAMLoss hli28146_#45
[x] Leaky-Swish+Bias Ljy123_#31
[x] LeakyReGLU uucoco_#37
[x] LeakyReLU-Affine-Gate Ljy123_#79
[x] LeCunTanh uucoco_#38
[x] legendreaffine gsd123_#91
[x] linear_gelu HHyy 43
[x] lisht hli28146_#19
[x] localresponsenorm ZZZJ 8
[x] Log1p(Square)+Bias Ljy123_#27
[x] Log1pAbs-Affine-Gate LJy123_#115
[x] logbeta wut0n_#29
[x] LogCosh-Affine-Gate Ljy123_#106
Ljy123_#58
[x] logcoshdiceloss hli28146_#56
[x] LogCoshLoss Lwh20070813 42
Lwh20070813_#2
[x] logdet ZZZJ_#167
[x] logitsigmoidshift uucoco_#95
[x] LogLU hli28146_#75
[x] LogMeanExp uucoco_#24
[x] LogSigmoid uucoco_#23
[x] LogSigmoid Affine Gate Ljy123_#41
[x] LogSigmoid-Affine-Gate Ljy123_#96
[x] LogSumExp gsd123_#71
hli28146_#10
wut0n_#28
[x] LogWeightedSumExp uucoco_#22
[x] lp_pool2d ZZZJ_#149
[x] lrn_simple zizi05_#5
[x] Lsoftmaxloss hli28146_#53
[x] MahalanobisDistanceLoss uucoco_#96
[x] manhattan wut0n_#17
[x] manhattan_distance_matrix ZZZJ_#80
[x] manhattan_erf uucoco_#134
[x] manhattan_hardswish wut0n_#103
[x] manhattan_leakyrelu wut0n_#60
[x] manhattan_mse wut0n_#66
[x] manhattan_relu wut0n_#62
[x] manhattan_sigmoid wut0n_#61
[x] manhattan_sqrt wut0n_#67
[x] manhattan_swish wut0n_#64
[x] manhattan_tanh wut0n_#65
[x] marcsinh gsd123_#51
[x] marginrankingloss ZZZJ 16
[x] matmul HHyy 25
[x] maxunpool1d ZZZJ_#11
[x] maxunpool2d ZZZJ_#12
[x] meanstdnormalizeclip uucoco_#97
[x] median_filter_3d ZZZJ_#106
[x] MElliott hli28146_#134
[x] MeshEdgeLoss gsd123_#116
[x] MetaAconC hli28146_#26
[x] minkowski wut0n_#18
[x] minkowski_contrastiveloss wut0n_#68
[x] minkowski_instancenorm wut0n_#78
[x] minkowski_relu wut0n_#74
[x] MinkowskiDistance uucoco_#7
[x] minmax_observer ZZZJ_#103
[x] minmaxscaleshift uucoco_#98
[x] Mish gsd123_#31
zizi05_#1
[x] Mish+Bias Ljy123_#17
[x] Mish-Affine-Gate Ljy123_#93
[x] MishB uucoco_#62
[x] mishglu hli28146_#59
uucoco_#39
[x] mixup ZZZJ_#147
[x] MMReLU hli28146_#94
[x] ModeSeekingLoss uucoco_#99
[x] ModReLU gsd123_#52
[x] ModSwish hli28146_#114
[x] mseloss wut0n_#10
ZZZJ 28
[x] MsewithLogitLoss uucoco_#100
[x] mulaw_decoding ZZZJ_#100
[x] mulaw_encoding ZZZJ_#101
[x] multilabelmarginloss gsd123_#73
hli28146 44
[x] multimarginloss hli28146_#2
[x] Multiquadratic gsd123_#54
[x] MutualInformation uucoco_#51
[x] NIPUNA hli28146_#85
[x] Nish hli28146_#74
[x] NISRLU hli28146_#73
[x] NLLLoss uucoco 32
uucoco_#2
[x] NLReLU hli28146_#78
[x] optional_get_element ZZZJ_#22
[x] optional_has_element ZZZJ_#23
[x] PAA hli28146_#132
[x] pairwise_distance zizi05_#3
[x] pairwisedistance ZZZJ 38
[x] ParametricSigmoid uucoco_#63
[x] PATS hli28146_#88
[x] PearsonCorrelation Lwh20070813 41
Lwh20070813_#1
[x] penalizedtanh hli28146_#64
[x] PerceptualLoss uucoco_#101
[x] permute ZZZJ_#143
[x] PGELU hli28146_#99
[x] piecewiseaffine gsd123_#94
[x] PiecewiseLinearUnit gsd123_#39
[x] poissonnllloss gsd123 20
[x] polar_to_cartesian ZZZJ_#132
[x] polaraffine gsd123_#95
[x] poly1crossentropy hli28146_#15
[x] poly1focalloss hli28146_#16
[x] PolyLoss uucoco_#64
[x] polynomial_eval ZZZJ_#99
[x] polynomialaffine gsd123_#96
[x] Power-Sigmoid-Affine-Gate Ljy123_#46
[x] Power-Sigmoid-Gate Ljy123_#21
[x] PPOLoss uucoco_#102
[x] PReLU uucoco_#40
[x] projectiveaffine gsd123_#97
[x] Prototype-Cosine Gate Ljy123_#36
[x] Pserf hli28146_#92
[x] PseudoHuber-Affine-Gate Ljy123_#99
[x] PSGU hli28146_#101
[x] PSMish uucoco_#42
[x] PTELU hli28146_#122
[x] PTLU uucoco_#65
[x] python Ljy123_#67
[x] QLearningLoss uucoco_#103
[x] QReLU gsd123_#60
[x] QuantileLoss hli28146_#69
uucoco_#66
[x] quantilenormalizeexpand uucoco_#104
[x] RadialBasisFunction uucoco_#43
[x] Range-Gate Affine Ljy123_#39
[x] rangescalegate uucoco_#68
[x] rangeshiftgate uucoco_#69
[x] rank_normalize_scale gsd123_#122
[x] ranknetloss hli28146_#50
[x] ransac_normalize_outlier_reject gsd123_#123
[x] RationalClip-Affine-Gate Ljy123_#112
[x] RationalFunctionApproximator uucoco_#52
[x] real_imag_hypot uucoco_#105
[x] ReflectionPad3d gsd123 22
[x] ReLTanh hli28146_#125
[x] ReLU-Affine-Gate Ljy123_#88
[x] ReLU6-Affine-Gate Ljy123_#83
[x] ReLU^2 Ljy123_#14
[x] RenyiDivergenceLoss uucoco_#106
[x] repeat_interleave ZZZJ_#102
[x] replicationpad1d wwmm_#4
[x] replicationpad2d wwmm_#5
[x] replicationpad3d wwmm_#6
[x] RePU hli28146_#60
[x] resistance_distance_exp gsd123_#163
[x] resize_nearest ZZZJ_#133
[x] rgb_to_bayer ZZZJ_#36
[x] rgb_to_grayscale ZZZJ_#41
[x] rgb_to_xyz ZZZJ_#39
[x] rgb_to_yuv ZZZJ_#47
[x] RMAF hli28146_#121
[x] rmsnorm Icy_cola9
Ljy123_#8
wut0n_#3
[x] rmsnorm_residual wut0n_#32
[x] rmsnorm_silu hli28146_#61
[x] robustscalegate uucoco_#70
[x] robustscalehuber uucoco_#107
[x] rogers_tanimoto_silu gsd123_#164
[x] roiaware_pool1d ZZZJ_#152
[x] roll2d ZZZJ_#52
[x] roll3d ZZZJ_#53
[x] rope wwmm_#1
[x] SAAF hli28146_#93
[x] SaRa hli28146_#106
[x] SbPiPLU hli28146_#116
[x] scalenorm hli28146_#33
[x] scatter_add ZZZJ#24
[x] scatter_div ZZZJ_25
[x] scatter_nd ZZZJ_#30
[x] sceloss hli28146_#40
[x] SCLMish hli28146_#119
[x] SCSwish hli28146_#118
[x] segment_reduce ZZZJ_#69
[x] SELU+Affine Ljy123_#26
[x] SELU-Affine-Gate Ljy123_#90
[x] selu_clip zizi05_#4
[x] Sep hli28146_#111
[x] separable_conv2d ZZZJ_#141
[x] separable_conv3d ZZZJ_#142
[x] serf hli28146_#65
uucoco_#45
[x] Serlu gsd123_#40
[x] ShiftedSincUnit uucoco_#47
[x] Sigmoid+Clamp+Affine Ljy123_#16
[x] Sigmoid-Affine-Gate Ljy123_#85
[x] sigmoid_derivative wut0n_#27
[x] sigmoid_focal_loss ZZZJ_#131
[x] SigmoidGLU uucoco_#53
[x] SigmoidSlope-Affine-Gate Ljy123_#110
[x] SigmoidSquared-Affine-Gate Ljy123_#117
[x] signmuladd uucoco_#108
[x] SimCLRLoss gsd123_#133
[x] Sin-Affine-Gate Ljy123_#44
[x] Sinc-Affine-Gate Ljy123_#92
[x] sincoshypot uucoco_#109
[x] Sine-Affine-Gate Ljy123_#114
[x] Sinh-Affine-Gate Ljy123_#81
[x] SinLU hli28146_#89
[x] SinuGaussian uucoco_#71
[x] smelu hli28146_#27
uucoco_#48
[x] SmoothAbs gsd123_#74
[x] SmoothL1Loss gsd123 40
gsd123_#13
[x] SmoothMaximum gsd123_#75
[x] SmoothMinimum gsd123_#76
[x] SmoothRamp gsd123_#77
[x] SmoothStep gsd123_#78
ZZZJ_#123
[x] SoftClip uucoco_#21
[x] SoftClip+Affine Ljy123_#30
[x] SoftExponential uucoco_#20
[x] softmarginloss hli28146 35
hli28146_#3
[x] softmax Ljy123_#6
[x] softmin uucoco_#14
[x] softplus uucoco_#15
[x] Softplus+Bias Ljy123_#15
[x] Softplus^2-Affine-Gate Ljy123_#80
[x] Softplus^3-Affine-Gate Ljy123_#102
[x] SoftplusGLU uucoco_#54
[x] SoftplusSqrt-Affine-Gate Ljy123_#108
[x] softshrink uucoco_#16
[x] SoftShrink-Affine-Gate Ljy123_#103
[x] softsign uucoco_#18
[x] Softsign+Affine Ljy123_#18
[x] SoftSign-Affine-Gate Ljy123_#91
[x] Softsign-Sigmoid-Mix-Gate Ljy123_#52
[x] SoftSignSquared-Affine-Gate Ljy123_#119
[x] solarize ZZZJ_#140
[x] Spatial-Diff Sigmoid Gate Ljy123_#38
[x] spherefaceloss hli28146_#23
[x] Spherical+Affine Ljy123_#24
[x] SQRBF gsd123_#59
[x] Sqrt(ReLU)+Affine Ljy123_#28
[x] sqrtreciprocalrsqrt uucoco_#110
[x] Square-Sigmoid-Affine-Gate LJy123_#47
[x] squared_euclidean wut0n_#23
[x] SquaredHingeLoss uucoco_#72
[x] squareplus ZZZJ_#124
[x] SReLU uucoco_#49
[x] SRS uucoco_#73
[x] std_mean ZZZJ_#122
[x] STL hli28146_#79
[x] structural_similarity_softplus uucoco_#135
[x] SupConLoss gsd123_#132
[x] SwAT hli28146_#109
[x] swiglu zizi05_#7
ZZZJ1
[x] swish Ljy123_#7
[x] Swish(SiLU)-Affine-Gate Ljy123_#86
[x] Swish^2+Bias Ljy123_#25
[x] swish_layernorm zizi05_10
[x] switchablenorm ZZZJ 12
[x] SørensenDice gsd123_#27
[x] Tanh-Affine-Gate Ljy123_#45
Ljy123_#84
[x] tanhexp hli28146_#20
[x] TanhGLU uucoco_#55
[x] TanhLU hli28146_#90
[x] tanhshrink zizi05_#9
[x] Tanhshrink+Affine Ljy123_#20
[x] TanhSlope-Affine-Gate Ljy123_#111
[x] TanhSoft1 hli28146_#96
[x] TanhSoft2 hli28146_#97
[x] TanimotoCoefficient uucoco 33
uucoco_#3
[x] TDLoss uucoco_#111
[x] TeLU hli28146_#80
[x] Temperature Softmax Channel Affine Ljy123_#40
[x] tensor_roll ZZZJ_#138
[x] three_interpolate ZZZJ_#156
[x] thresholdscalenegate uucoco_#112
[x] topk_filtering ZZZJ_#139
[x] total_correlation_elu uucoco_#136
[x] transpose_scale ZZZJ_#125
[x] tripletloss wut0n_#7
[x] tripletmarginloss hli28146_#1
ZZZJ 30
[x] TripletMarginWithDistanceLoss gsd123 39
gsd123_#14
[x] TrustRegionPolicyOptimizationLoss uucoco_#113
[x] TsallisDivergenceLoss uucoco_#114
[x] tversky_loss ZZZJ_#72
[x] TverskyIndex gsd123_#80
[x] tverskyloss hli28146_#57
[x] TweedieLoss gsd123_#100
[x] upsample ZZZJ 21
[x] ValueLoss uucoco_#115
[x] Variance uucoco_#13
wut0n_#26
[x] VariationOfInformation uucoco_#56
[x] vecdot hli28146_#8
[x] VIDLoss gsd123_#107
[x] voxel_hash ZZZJ_#158
[x] voxel_mean ZZZJ_#159
[x] voxel_to_point ZZZJ_#160
[x] wasserstein_energy_gelu uucoco_#137
[x] wasserstein_layernorm gsd123_#166
[x] waveletaffine gsd123_#101
[x] WeightDecay gsd123_#81
[x] wingloss hli28146_#14
[x] winsorize_scale_normalize gsd123_#93
[x] wiou ZZZJ_#33
[x] xIELU hli28146_#77
[x] xSiLU hli28146_#76
[x] xyz_to_rgb ZZZJ_#38
[x] yuv_to_rgb ZZZJ_#49
[x] zeropad2d ZZZJ_#9
[x] zeropad3d ZZZJ_#10
[x] zscoresigmoiddenormalize uucoco_#116
[x] 仿射+ReLU Ljy123_#9

📥 参赛流程

一句话概括:进入GPUCodeForces赛事首页完成一份成功合并到仓库内的提交即为参赛成功时间自由方法自由只要有灵感就可以动手开code~

🌰举个栗子

  • 登录or注册自己的Gitlink账号后进入赛事首页初步查看仓库内的文件内容
.
├── S1(说明:第一季比赛名称,该目录下文件需选手自建)
│   ├── issue id 1(选手提交算子前创建的issue对应的id)
│   │   ├── cudacode.py(必要提交文件)
│   │   ├── torchcode.py(必要提交文件)
│   │   ├── run_code.py(必要提交文件)
│   │   ├── prompt.txt(必要提交文件)
│   ├── issue id 2
│   ├── issue id ...
├── example(样例提供,供大家上手)
│   ├── 001-example(文件结构与 issue id x 一致)
│   ├── 002-example
├── images(图片文件夹,参赛选手可忽略)
├── FAQ.md(社区收集的问题与解答)
├── LICENSE(证书,参赛选手可忽略)
├── README.md(赛题baseline)
├── how-to-contribute.md(提交指南看这里)
  • 在S1文件夹的文件即为参赛选手需要提交的文件其余文件夹和文件皆为辅助参赛选手了解比赛、提供思路、排忧解难之用。

  • 我们将当前赛题的项目clone到本地电脑上建议使用git clone + 链接的方式在S1文件夹下创建一个以自己issue id命名的文件夹待提交的参赛代码文件都放在这里面。

 Tipsissue id ≠ issue名称名称建议为对该算子的概括性描述。创建了issue后链接末尾处的数字即为issue id。同时也可以在issue界面的醒目位置查看如"#123"这样的数字标识。
  • 做好了准备工作就可以开始尽情发挥去寻找算子亦或是优化算子。在example文件夹中提供了算子样例如果想简单上手可以查看该文件夹。虽然有效的算子优化也算一次提交但我们鼓励大家发现新的算子真正与其他选手拉开差距。

    🔧简单介绍一下样例代码:

    example_torchcode.py 基准模型Baseline。示例提供一个简单的PyTorch模型只包含一个ReLU激活函数。

    example_cudacode.py优化模型。示例使用PyTorch的load_inline功能直接编译和加载CUDA代码创建了一个新的模型类使用自定义CUDA实现替代PyTorch的ReLU。

    run_code.py验证和性能测试脚本。验证自定义CUDA实现与原始PyTorch实现的数值精度一致性比较两种实现的性能计算加速比。

    prompt.txt:提示词文本。提供类似 “融合算子 CUDA 设计” 的 prompt 编写思路。

    💡如何将一个example变为自己的一份提交具体的算子优化思路可参考GPUCodeForces赛题解读

  • 为了测试代码最终的跑通结果需要使用规定的GPU。在模力方舟平台上准备了大家此次需要的算力资源,使用免费的算力券购买实例,接着便可以在云端实例上进行代码修改和测试。

    相关算力券的领取方式请见算力平台使用说明算力券兑换发放和兑换

    Tips进行云端服务器的实例选择有库存的即可点击进入后需要确定配置。其余选项保持默认只需更改镜像处的选择基础镜像-->CV-CUDA-->PyTorch2.4.0-->Python任意-->maca 3.0.0.5
    
  • 代码测试运行没有问题后便可以准备提交了记得将所有必要文件保存到提交文件夹。提交流程如下全程使用git

    # cd到自己克隆到本地的项目路径下C:\Users\Desktop\ODTC AI Infra\GPUCodeForces
    
    git remote -v      # 检查是否链接到自己的Gitlink仓库
    git checkout -b dev      # 新建一个分支dev即分支名字可以任取
    git add .      # 将文件的变更操作暂存
    git commit -m "输入你本次提交的目的"      # 目的简洁明了最好
    git push origin dev      # 提交你的修改到分支上
    

    对git与远程仓库操作的疑问可以点击how-to-contribute.md查看详情。

  • 顺利提交后的代码还只在你自己fork的仓库下还需要和主仓库合并才能真正让管理员看到你的代码。

    fork仓库你自己的仓库与主仓库之间关系如下

    ODTC AI Infra/GPUCodeForces(main)   
    ├── ...
    ├── folders
    
    your_name/GPUCodeForces(main) # 自己仓库下的main分支内容与主仓库一致
    ├── ...
    ├── folders
    
    your_name/GPUCodeForces(dev) # dev分支才是你修改后的代码存放处
    ├── ...
    │   ├── your codes
    ├── folders
    

    进入自己的仓库,点击上方选项栏:

    合并请求(PR)-->+新建合并请求-->源分支选择dev(名称任取)-->填写下方选框-->标题为自己的issue标题-->描述填请简明扼要描述内关联自己的issue id(如“fixes #001”)
    

    提交后便能看到自己的PR记录了在对应记录的评论区会有测试结果的告知请留意查看~

🌳一份完整的提交流程如上,期待各位自由发挥,赛出风采与水平!

⏺如仍有疑问,请点击提交流程演示视频

审核流程

  • 你提交的PR都会得到回复大概存在的几种情况如下
    提交PR-->测试通过✔️-->已合并-->有效提交 ヽ(✿゚▽゚)
    提交PR-->测试通过✔️-->已关闭-->代码重复/相似-->无效提交 (;′⌒`)
    提交PR-->测试失败✖️-->已关闭-->代码不合格-->无效提交 (;′⌒`)
    
    也就是说,除了能够自己在算力平台的实例上运行得到算子测算的初步结果外,还可以在这里看到最终的测算结果。这里显示测试通过才能进入后续审核流程,并最终上传至比赛的算子仓库。

 参赛资格

  • 你提交的PR样本中至少有 1 个样本被评审通过并正式整合到“GPU CodeForces” 数据集,即可算作有效参赛。

⚠️注意事项

  1. 请勿抄袭他人代码或成果

  2. 请勿恶意提交(如相同算子多次提交、相近优化重复提交)
    ---相近优化:即指同一份参赛用例在优化后加速比没有提升或更低的用例提交

  3. 请遵守提交的格式要求、内容规范


🏅 竞赛排名机制

  1. 优先按接受数量从高到低排序作为排名取前12名。

  2. 若接受数量相同:

    • 比较总基础评分高者优先

    • 若仍相同,比加分项得分高者优先

接受数量 = 提交并被评审通过的样本总数

接受数量相同需要区分排名时如下的评分规则才会生效


📈 评分规则

📊 基础得分

内容 分值
提供标准 GT 输出生成函数Numpy-CPU / 原始框架实现) +2 分
CUDA 执行时间评估 +5 分
CUDA 吞吐量评估 +4 分
CUDA 内存带宽评估 +3 分

 加分项

内容 分值
提供 Prompt 让 LLM 生成对应的 CUDA 代码并同样进行性能评价 额外加分

📚 术语解释

  • 评测数据集用来测试 GPU 性能的一组标准化样本包括代码、输入数据和预期结果。

  • GTGround Truth:标准参考答案或结果,用来验证程序运行是否正确。

  • 吞吐量Throughput每秒钟能处理的数据量越高表示 GPU 处理能力越强。

  • 内存带宽Memory Bandwidth单位时间内 GPU 内存与计算核心之间的数据传输速度。

  • Prompt引导大语言模型LLM生成代码或内容的提示词。

  • LLMLarge Language Model大语言模型如 ChatGPT、LLaMA 等。


📬 联系与帮助

如需更多信息或格式说明,请查看官方文档或在本仓库提交想法进行讨论,或直接在交流群内与主办团队进行沟通。

祝各位挑战成功贡献出高质量的 GPU 评测数据集🚀

FAQ

第一季FAQ参考