A token az a feldolgozási egység, amelyre egy nyelvi modell a bemeneti szöveget felbontja, és amelyeken a modell a számításait végzi. Egy token lehet teljes szó, szórészlet, írásjel vagy más karakterkombináció; ezért a token nem azonos sem a szóval, sem a karakterrel.
Mielőtt egy Large Language Model (LLM) feldolgozhatná a szöveget, egy tokenizer a bemenetet tokenek sorozatára alakítja. Minden tokenhez numerikus azonosító tartozik, amelyből a modell további matematikai reprezentációkat képez. Szöveggeneráláskor a folyamat fordított irányban is megjelenik: a modell a lehetséges következő tokenek valószínűségét számítja ki, kiválaszt egy következő tokent, majd ezt a folyamatot ismételve építi fel a választ.
A tokenizáció modell- és tokenizerfüggő. Ugyanazt a mondatot két különböző modell eltérő tokenekre bonthatja, és a különböző nyelvek vagy karakterkészletek tokenhatékonysága is eltérhet. Emiatt az olyan egyszerű átváltások, mint hogy „egy token mindig ennyi szó”, csak közelítések.
A tokenek a modell kontextusablakának mérésében is alapvetőek. Ha egy modell például meghatározott számú tokenből álló kontextusablakkal rendelkezik, ebbe kell beleférnie az adott feldolgozás során használható bemenetnek és – az adott rendszer működésétől függően – a generált kimenetnek is.
Konkrét példa
A „webshop” szó emberi szemmel egyetlen szó, de egy adott tokenizer kezelheti egy tokenként vagy több részre is bonthatja. Ugyanez igaz egy terméknévre, URL-re, számra vagy magyar összetett szóra.
Ezért egy 10 000 szavas dokumentumról pusztán a szavak száma alapján nem lehet pontosan megmondani, hány tokent fog elfoglalni egy adott modellben. Ehhez az adott modell tokenizerét kell figyelembe venni.
Miért fontos?
A token közvetlenül befolyásolja, mennyi információt tud egy LLM egyszerre feldolgozni, és API-alapú AI-szolgáltatásoknál a használati költség számításának alapja is lehet. A hosszú promptok, dokumentumok, beszélgetési előzmények és generált válaszok mind tokeneket foglalnak.
A token fogalmának megértése ezért fontos a kontextusablak, az AI-költségek és az LLM-alapú rendszerek technikai korlátainak értelmezéséhez.
Kapcsolódó fogalmak
Tokenization
Context Window
Large Language Model (LLM)
Embedding
Transformer