Architektúra Transformer, predstavená v roku 2017, zásadne zmenila spracovanie sekvencií tým, že odstránila potrebu rekurencie. Namiesto postupného spracovania prvkov využíva mechanizmus "Self-Attention" (vlastná pozornosť), ktorý umožňuje modelu vážiť dôležitosť rôznych častí vstupu súčasne. Tento paralelizmus dramaticky zrýchľuje trénovanie na veľkých datasetoch.
Pracovný postup Transformera:
- Positional Encoding: Pridanie informácie o poradí slov do vstupných vektorov, keďže model nemá vrodenú predstavu o sekvencii.
- Multi-Head Attention: Paralelné výpočty pozornosti umožňujúce zamerať sa na rôzne aspekty vzťahov medzi dátami.
- Feed-Forward Networks: Každá vrstva pozornosti je nasledovaná plne prepojenou sieťou pre ďalšiu transformáciu.
Tento prístup vyžaduje precízne Spracovanie a príprava dát, aby sa predišlo šumu v trénovacom procese. Transformery sú dnes základom pre modely ako BERT, GPT a T5.