✅ Перевірена відповідь на це питання доступна нижче. Наші рішення, перевірені спільнотою, допомагають краще зрозуміти матеріал.
In the Self-Attention mechanism of a Transformer, how is the attention weight matrix scaled before applying the Softmax function?