Skip to content

Instantly share code, notes, and snippets.

@dhcgn
Created November 22, 2024 07:52
Show Gist options
  • Select an option

  • Save dhcgn/c7c927407ac81b23a7110804522e056e to your computer and use it in GitHub Desktop.

Select an option

Save dhcgn/c7c927407ac81b23a7110804522e056e to your computer and use it in GitHub Desktop.
Einführung in Token in LLMs für Einsteiger

Die Verarbeitung von Sprache in Large Language Models (LLMs) basiert auf einem fundamentalen Konzept: Tokens. Diese bilden die Grundbausteine, mit denen KI-Modelle Text verarbeiten und verstehen[1][5].

Was sind Tokens?

Tokens sind die kleinsten Verarbeitungseinheiten in einem LLM, die aus Wortbestandteilen, einzelnen Wörtern oder Satzzeichen bestehen können[1]. Ein Text wird zunächst in diese Token zerlegt, bevor er vom Modell verarbeitet werden kann. Dabei werden die Token in numerische Werte umgewandelt, die das Modell mathematisch verarbeiten kann[2].

Tokenisierungsprozess

Zerlegung des Textes Die Tokenisierung erfolgt durch spezielle Algorithmen, die Text in sinnvolle Einheiten aufteilen. Im Deutschen wird der Text oft kleinteiliger zerlegt als im Englischen[1].

Numerische Repräsentation Jedes Token erhält eine eindeutige ID, die es dem Modell ermöglicht, damit zu rechnen[3]. Diese IDs werden dann in Vektoren (Embeddings) umgewandelt, die die semantische Bedeutung des Tokens repräsentieren[2].

Bedeutung der Tokens

Kontextfenster LLMs haben ein begrenztes Kontextfenster, das bestimmt, wie viele Token sie gleichzeitig verarbeiten können[1]. Bei GPT-4 liegt diese Grenze beispielsweise bei 8.192 Token[3].

Verarbeitungsqualität Die Tokenisierungsmethode beeinflusst direkt:

  • Die Fähigkeit des Modells, unbekannte Wörter zu verstehen
  • Die Verarbeitungsgeschwindigkeit
  • Den Speicherverbrauch[3]

Praktische Auswirkungen

Die Tokenisierung hat direkten Einfluss auf die Leistungsfähigkeit des Modells. Ein höheres Tokenlimit ermöglicht:

  • Längere Texteingaben und -ausgaben
  • Besseres Kontextverständnis
  • Präzisere Antworten[4]

Allerdings führt ein höheres Tokenlimit auch zu erhöhtem Rechenaufwand und längeren Verarbeitungszeiten[4].

Citations: [1] https://www.soutier.de/blog/2023/05/27/kuenstliche-intelligenz-large-language-models/ [2] https://www.iese.fraunhofer.de/blog/wie-funktionieren-llms/ [3] https://learn.microsoft.com/de-de/dotnet/ai/conceptual/understanding-tokens [4] https://online-marketing-leipzig.de/das-tokenlimit-ein-einstieg-fuer-anfaenger-mit-tipps-zum-prompting/ [5] https://hubertusporschen.com/openai-gpt-tokens/ [6] https://www.bitpanda.com/academy/de/lektionen/large-language-model-llm/

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment