NVIDIA Transformer Engine ускоряет трансформеры через объединенные fused GPU kernels и FP8 вычисления. В статье проведено сравнение производительности Transformer Engine и стандартного PyTorch с замерами времени и использования памяти.
Для демонстрации возможностей Engine использовались компоненты te.Linear, te.LayerNorm, te.LayerNormLinear, te.LayerNormMLP и te.TransformerLayer. Конфигурировался рецепт FP8 с задержкой масштабирования, поддерживающий гибридные форматы E4M3/E5M2.