Attention, Selbstaufmerksamkeit, Positionsdarstellung und Encoder-Decoder-Strukturen erklären moderne Sequenzmodelle. Ein kleiner Transformer wird trainiert und hinsichtlich Rechen- sowie Speicherbedarf untersucht.