Firma Google ogłosiła niedawno, że okno kontekstowe Gemini 1.5 Pro zwiększy się z 1 miliona tokenów do 2 milionów. Brzmi imponująco, ale czym w ogóle jest symbol?
W istocie nawet chatboty potrzebują pomocy w przetwarzaniu otrzymywanego tekstu, aby mogły zrozumieć koncepcje i komunikować się z Tobą w sposób ludzki. Osiąga się to za pomocą systemu tokenów w generatywnej przestrzeni AI, który rozkłada dane, aby były łatwiej przyswajalne przez modele AI.
Co to jest token AI?

Token AI to najmniejsza jednostka, na którą można podzielić słowo lub frazę przetwarzaną przez duży model językowy (LLM). Tokeny uwzględniają słowa, znaki interpunkcyjne lub słowa podrzędne, które umożliwiają modelom skuteczną analizę i interpretację tekstu, a następnie generowanie treści w podobny sposób oparty na jednostkach. Przypomina to sposób, w jaki komputer konwertuje dane na zera i jedynki Unicode w celu łatwiejszego przetwarzania. Tokeny umożliwiają modelowi określenie wzorca lub relacji w obrębie słów i wyrażeń, dzięki czemu może przewidzieć przyszłe warunki i odpowiedzieć w kontekście podpowiedzi.
Kiedy wprowadzasz monit, fraza i słowa są zbyt długie, aby chatbot mógł je zinterpretować w takiej postaci, w jakiej są – muszą zostać podzielone na mniejsze części, zanim LLM będzie w stanie w ogóle przetworzyć żądanie. Są one zamieniane na tokeny, następnie żądanie jest przesyłane i analizowane, a odpowiedź jest zwracana do Ciebie.
Proces przekształcania tekstu w tokeny nazywa się tokenizacją. Jest wiele metody tokenizacji, które mogą się różnić w zależności od wariantów, w tym instrukcji słownikowych, kombinacji słów, języka itp. Na przykład metoda tokenizacji opartej na spacjach dzieli słowa na podstawie odstępów między nimi. Wyrażenie „Na zewnątrz pada deszcz” zostanie podzielone na żetony „Pada”, „pada”, „na zewnątrz”.
Jak działają tokeny AI?
a 100 żetonów to około 75 słów. Inne konwersje sugerują, że jedno do dwóch zdań to około 30 tokenów, jeden akapit to około 100 tokenów, a 1500 słów to około 2048 tokenów.
Niezależnie od tego, czy jesteś zwykłym użytkownikiem, programistą czy przedsiębiorstwem, program AI, którego używasz, wykorzystuje tokeny do wykonywania swoich zadań. Kiedy zaczniesz płacić za generatywne usługi AI, płacisz za tokeny, aby utrzymać usługę na optymalnym poziomie.
Większość generatywnych marek AI ma również podstawowe zasady dotyczące działania tokenów w swoich modelach AI. Wiele firm ma ograniczenia dotyczące tokenów, które ograniczają liczbę tokenów, które można przetworzyć w jednej turze. Jeśli żądanie jest większe niż limit tokenów na LLM, narzędzie nie będzie w stanie zrealizować żądania w jednej turze. Na przykład, jeśli wprowadzisz artykuł o długości 10 000 słów do przetłumaczenia na GPT z limitem 4096 tokenów, nie będzie on w stanie go w pełni przetworzyć, aby udzielić szczegółowej odpowiedzi, ponieważ takie żądanie wymagałoby co najmniej 15 000 tokenów.
Jednak firmy szybko zwiększały możliwości swoich LLM, zwiększając ograniczenia tokenów w nowych wersjach. Oparty na badaniach model BERT firmy Google miał maksymalną długość wejściową wynoszącą 512 tokenów. GPT-3.5 LLM OpenAI, na którym działa bezpłatna wersja ChatGPT, ma maksymalnie 4096 tokenów wejściowych, podczas gdy jego GPT-4 LLM, na którym działa płatna wersja ChatGPT, ma maksymalnie 32 768 tokenów wejściowych.
Odpowiada to około 64 000 słów lub 50 stronom tekstu. Google Gemini 1.5 Pro, które zapewnia funkcjonalność audio dla AI Studio marki, ma standardowe okno kontekstowe zawierające 128 000 tokenów. Claude 2.1 LLM ma limit do 200 000 tokenów kontekstu. Odpowiada to około 150 000 słów lub 500 stronom tekstu.
Jakie są różne typy tokenów AI?
Tam są kilka rodzajów tokenów wykorzystywane w generatywnej przestrzeni AI, które pozwalają LLM identyfikować najmniejsze jednostki dostępne do analizy. Oto niektóre z głównych tokenów interesujących model AI.
- Żetony słów to słowa, które same w sobie reprezentują pojedyncze jednostki, np. „ptak”, „dom” lub „telewizor”.
- Tokeny podsłów to słowa, które można podzielić na mniejsze jednostki, na przykład podzielić wtorek na „wtorek” i „dzień”.
- Znaki interpunkcyjne zastępują znaki interpunkcyjne, w tym przecinki (,), kropki (.) i inne.
- Żetony liczbowe zastępują cyfry, w tym cyfrę „10”.
Tokeny specjalne mogą zapisywać kilka unikalnych instrukcji w ramach wykonywania zapytań i danych szkoleniowych.
Jakie są zalety tokenów?
Tokeny w generatywnej przestrzeni AI mają kilka zalet. Przede wszystkim działają jako łącznik między językiem ludzkim a językiem komputerowym podczas pracy z LLM i innymi procesami sztucznej inteligencji. Tokeny pomagają modelom przetwarzać duże ilości danych jednocześnie, co jest szczególnie korzystne w przestrzeniach korporacyjnych korzystających z LLM. Firmy mogą pracować z limitami tokenów, aby zoptymalizować wydajność modeli AI. Wraz z wprowadzeniem przyszłych wersji LLM tokeny umożliwią modelom posiadanie większej pamięci dzięki wyższym limitom lub oknom kontekstowym.
Inne zalety tokenów polegają na aspektach szkoleniowych LLM. Ponieważ są to małe jednostki, można je wykorzystać w celu ułatwienia optymalizacji szybkości przetwarzania danych. Ze względu na predykcyjny charakter tokenów lepiej rozumieją one koncepcje i z biegiem czasu ulepszają sekwencje. Tokeny pomagają we wdrażaniu aspektów multimodalnych, takich jak obrazy, filmy i dźwięk, w LLM wraz z chatbotami przetwarzającymi tekst na mowę.
Tokeny też mają trochę ochrona danych i korzyści związane z oszczędnością dzięki konfiguracji Unicode chroniącej ważne dane i obcinającej dłuższy tekst do uproszczonej wersji.
Wesprzyj naszą pracę ❤️
Jeśli spodobał Ci się ten artykuł, rozważ pozostawienie napiwku, aby pomóc nam dalej publikować wartościowe treści.




















