Die Verarbeitung von Sprache in Large Language Models (LLMs) basiert auf einem fundamentalen Konzept: Tokens. Diese bilden die Grundbausteine, mit denen KI-Modelle Text verarbeiten und verstehen[1][5].
Tokens sind die kleinsten Verarbeitungseinheiten in einem LLM, die aus Wortbestandteilen, einzelnen Wörtern oder Satzzeichen bestehen können[1]. Ein Text wird zunächst in diese Token zerlegt, bevor er vom Modell verarbeitet werden kann. Dabei werden die Token in numerische Werte umgewandelt, die das Modell mathematisch verarbeiten kann[2].
Zerlegung des Textes Die Tokenisierung erfolgt durch spezielle Algorithmen, die Text in sinnvolle Einheiten aufteilen. Im Deutschen wird der Text oft kleinteiliger zerlegt als im Englischen[1].
Numerische Repräsentation Jedes Token erhält eine eindeutige ID, die es dem Modell ermöglicht, damit zu rechnen[3]. Diese IDs werden dann in Vektoren (Embeddings) umgewandelt, die die semantische Bedeutung des Tokens repräsentieren[2].
Kontextfenster LLMs haben ein begrenztes Kontextfenster, das bestimmt, wie viele Token sie gleichzeitig verarbeiten können[1]. Bei GPT-4 liegt diese Grenze beispielsweise bei 8.192 Token[3].
Verarbeitungsqualität Die Tokenisierungsmethode beeinflusst direkt:
- Die Fähigkeit des Modells, unbekannte Wörter zu verstehen
- Die Verarbeitungsgeschwindigkeit
- Den Speicherverbrauch[3]
Die Tokenisierung hat direkten Einfluss auf die Leistungsfähigkeit des Modells. Ein höheres Tokenlimit ermöglicht:
- Längere Texteingaben und -ausgaben
- Besseres Kontextverständnis
- Präzisere Antworten[4]
Allerdings führt ein höheres Tokenlimit auch zu erhöhtem Rechenaufwand und längeren Verarbeitungszeiten[4].
Citations: [1] https://www.soutier.de/blog/2023/05/27/kuenstliche-intelligenz-large-language-models/ [2] https://www.iese.fraunhofer.de/blog/wie-funktionieren-llms/ [3] https://learn.microsoft.com/de-de/dotnet/ai/conceptual/understanding-tokens [4] https://online-marketing-leipzig.de/das-tokenlimit-ein-einstieg-fuer-anfaenger-mit-tipps-zum-prompting/ [5] https://hubertusporschen.com/openai-gpt-tokens/ [6] https://www.bitpanda.com/academy/de/lektionen/large-language-model-llm/