Fogalomtár FOGALOM

Token

token az a feldolgozási egység, amelyre egy nyelvi modell a bemeneti szöveget felbontja, és amelyeken a modell a számításait végzi. Egy token lehet teljes szó, szórészlet, írásjel vagy más karakterkombináció; ezért a token nem azonos sem a szóval, sem a karakterrel.

Mielőtt egy Large Language Model (LLM) feldolgozhatná a szöveget, egy tokenizer a bemenetet tokenek sorozatára alakítja. Minden tokenhez numerikus azonosító tartozik, amelyből a modell további matematikai reprezentációkat képez. Szöveggeneráláskor a folyamat fordított irányban is megjelenik: a modell a lehetséges következő tokenek valószínűségét számítja ki, kiválaszt egy következő tokent, majd ezt a folyamatot ismételve építi fel a választ.

A tokenizáció modell- és tokenizerfüggő. Ugyanazt a mondatot két különböző modell eltérő tokenekre bonthatja, és a különböző nyelvek vagy karakterkészletek tokenhatékonysága is eltérhet. Emiatt az olyan egyszerű átváltások, mint hogy „egy token mindig ennyi szó”, csak közelítések.

A tokenek a modell kontextusablakának mérésében is alapvetőek. Ha egy modell például meghatározott számú tokenből álló kontextusablakkal rendelkezik, ebbe kell beleférnie az adott feldolgozás során használható bemenetnek és – az adott rendszer működésétől függően – a generált kimenetnek is.

Konkrét példa

A „webshop” szó emberi szemmel egyetlen szó, de egy adott tokenizer kezelheti egy tokenként vagy több részre is bonthatja. Ugyanez igaz egy terméknévre, URL-re, számra vagy magyar összetett szóra.

Ezért egy 10 000 szavas dokumentumról pusztán a szavak száma alapján nem lehet pontosan megmondani, hány tokent fog elfoglalni egy adott modellben. Ehhez az adott modell tokenizerét kell figyelembe venni.

Miért fontos?

A token közvetlenül befolyásolja, mennyi információt tud egy LLM egyszerre feldolgozni, és API-alapú AI-szolgáltatásoknál a használati költség számításának alapja is lehet. A hosszú promptok, dokumentumok, beszélgetési előzmények és generált válaszok mind tokeneket foglalnak.

A token fogalmának megértése ezért fontos a kontextusablak, az AI-költségek és az LLM-alapú rendszerek technikai korlátainak értelmezéséhez.

Kapcsolódó fogalmak

Tokenization
Context Window
Large Language Model (LLM)
Embedding
Transformer