Neu: PultOS — Ihr Unternehmen auf einem Bildschirm • 71 fertige Integrationen • Server in Deutschland

Was ist ein Transformer-Modell?

Transformer-Modell verständlich erklärt: Self-Attention, Kontextfenster, Encoder und Decoder – und was die Architektur für KI im Unternehmen bedeutet.

· Aktualisiert:

KI & AgentenWie KI eine Aufgabe erledigt
  1. Eingabe
  2. Wissen
  3. SprachmodellTransformer-Modell
  4. Werkzeuge
  5. Ergebnis
Einordnung: Transformer-Modell gehört zum Schritt „Sprachmodell“. Schema zur Einordnung, keine Messwerte.
Inhaltsverzeichnis

Ein Transformer-Modell ist eine Bauart neuronaler Netze, die eine Eingabe nicht Wort für Wort nacheinander verarbeitet, sondern alle Teile gleichzeitig betrachtet und berechnet, welche davon für welche anderen wichtig sind. Dieses Prinzip heißt Self-Attention. Fast alle heutigen Sprachmodelle, Übersetzungsdienste und viele Bildmodelle beruhen auf dieser Architektur.

Das „T“ in GPT steht für Transformer. Wer verstehen will, warum Sprachmodelle so gut formulieren, warum sie trotzdem Fehler machen und warum lange Dokumente Geld kosten, kommt an diesem Begriff nicht vorbei. Technische Vorkenntnisse brauchen Sie für diesen Artikel nicht.

Woher der Transformer kommt

Vorgestellt wurde die Architektur 2017 von einem Forschungsteam bei Google in einem Aufsatz mit dem Titel „Attention Is All You Need“. Ziel war zunächst bessere maschinelle Übersetzung. Bis dahin verarbeiteten Sprachmodelle Texte der Reihe nach, wie ein Mensch, der einen Satz Wort für Wort liest und sich dabei den Anfang merken muss. Bei langen Sätzen ging dabei viel verloren, und das Training ließ sich schlecht beschleunigen.

Der Transformer löste beide Probleme: Er betrachtet den ganzen Text auf einmal, und weil die Berechnungen parallel laufen, lässt er sich auf sehr vielen Grafikprozessoren gleichzeitig trainieren. Erst das machte Modelle mit Milliarden von Parametern praktikabel.

Das Kernprinzip: Self-Attention

Nehmen Sie den Satz: „Der Monteur hat die Pumpe ausgebaut, weil sie undicht war.“ Worauf bezieht sich „sie“? Für uns ist klar: auf die Pumpe, nicht auf den Monteur. Ein Transformer klärt das über Aufmerksamkeit. Für jedes Wort berechnet er, wie stark es mit jedem anderen Wort des Satzes zusammenhängt. „Sie“ bekommt eine starke Verbindung zu „Pumpe“ und zu „undicht“.

Diese Rechnung läuft in vielen Schichten und mit mehreren „Köpfen“ parallel. Ein Kopf achtet vielleicht auf grammatische Bezüge, ein anderer auf Fachbegriffe, ein dritter auf Verneinungen. Niemand legt das fest – die Aufteilung entsteht beim Training.

Was bei einer Anfrage passiert

  1. Zerlegen: Der Text wird in Token zerlegt, also Wörter oder Wortteile.
  2. Übersetzen in Zahlen: Jedes Token wird zu einem Zahlenvektor, einem Embedding. Dazu kommt eine Angabe, an welcher Stelle im Text es steht.
  3. Aufmerksamkeit berechnen: In jeder Schicht verfeinert das Modell die Vektoren, indem es sie mit dem übrigen Text in Beziehung setzt.
  4. Nächstes Token vorhersagen: Bei Sprachmodellen wie GPT steht am Ende eine Wahrscheinlichkeitsverteilung über alle möglichen nächsten Token. Eines wird gewählt, angehängt, und der Vorgang beginnt von vorn.

Eine lange Antwort entsteht also Stück für Stück. Das erklärt, warum Sprachmodelle flüssig formulieren – und warum sie manchmal überzeugend Falsches erzeugen: Sie wählen das Wahrscheinliche, nicht das Geprüfte.

Encoder, Decoder und beides

BauformStärkeBekannte VertreterEinsatz
Nur EncoderTexte verstehen und einordnenBERT und NachfolgerKlassifikation, Suche, Embeddings
Nur DecoderTexte fortschreiben und erzeugenGPT, Claude, Llama, MistralChat, Entwürfe, Zusammenfassungen, Code
Encoder und DecoderEine Eingabe in eine andere Form bringenT5, klassische ÜbersetzungsmodelleÜbersetzung, Umformulierung

Für die Suche in Firmendokumenten arbeiten oft kleine Encoder-Modelle im Hintergrund, während ein Decoder-Modell die Antwort formuliert. Beide gehören zur selben Familie.

Kontextfenster: wie viel ein Modell auf einmal sieht

Ein Transformer kann nur eine begrenzte Menge Text gleichzeitig betrachten, das Kontextfenster. Es wird in Token gemessen und ist in den letzten Jahren stark gewachsen; aktuelle große Modelle verarbeiten ganze Vertragswerke in einer Anfrage.

Trotzdem gilt: Mehr Kontext heißt mehr Rechenaufwand und höhere Kosten pro Anfrage. Und Modelle nutzen Informationen aus der Mitte sehr langer Texte weniger zuverlässig als solche vom Anfang oder Ende. Für große Wissensbestände ist es deshalb meist besser, gezielt die passenden Stellen herauszusuchen und nur diese mitzugeben – genau das leistet RAG.

Grenzen der Architektur

  • Kein Faktenspeicher. Was ein Transformer „weiß“, steckt verteilt in seinen Gewichten. Nachschlagen kann er darin nicht, deshalb entstehen Halluzinationen.
  • Aufwand wächst mit der Länge. Bei der klassischen Self-Attention steigt der Rechenaufwand überproportional mit der Textlänge.
  • Rechnen ist nicht seine Stärke. Zahlen werden als Token verarbeitet, nicht als Werte. Für Kalkulationen gehört ein Rechenwerkzeug dazu.
  • Stand des Trainings. Ohne angebundene Quellen kennt das Modell nichts, was nach seinem Training passiert ist.

In der Praxis: das passende Modell für die Aufgabe

Für Unternehmen ist nicht die Architektur die Frage, sondern die Auswahl: großes Allzweckmodell, kleines spezialisiertes Modell oder eine Kombination. Ein Small Language Model auf eigenem Server kann für eine eng umrissene Aufgabe genügen, ein LLM ist bei offenen Fragen stärker. Bei der KI-Implementierung testen wir mehrere Modelle mit Ihren echten Daten und wählen das, das Qualität, Kosten und Datenschutz am besten verbindet.

Häufige Fragen

Was bedeutet GPT?

Generative Pre-trained Transformer: ein generatives, vortrainiertes Modell in Transformer-Bauweise. Es wurde zuerst auf großen Textmengen allgemein trainiert und dann für Dialoge und Anweisungen nachjustiert.

Sind alle KI-Modelle Transformer?

Nein. Viele Prognosemodelle für Tabellendaten arbeiten mit ganz anderen Verfahren, und in der Bildverarbeitung sind Faltungsnetze weiter verbreitet. Bei Sprachmodellen ist der Transformer aber der Standard.

Was ist der Unterschied zwischen Transformer und LLM?

Der Transformer ist die Bauart, das LLM ein konkretes, sehr großes Sprachmodell, das nach dieser Bauart gebaut und mit riesigen Textmengen trainiert wurde.

Warum ist ein größeres Kontextfenster nicht immer besser?

Weil jede Anfrage dann teurer und langsamer wird und das Modell Details in sehr langen Texten leichter übersieht. Gezielt ausgewählte Textstellen liefern oft bessere Antworten.

Brauchen Sie Unterstützung?

Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.

Erstgespräch vereinbaren
Schreiben Sie uns per WhatsApp