Demonstração interativa de como diferentes modelos de IA tokenizam texto.
0
stars
3
commits
TypeScript
primary language
Aug 20, 2026
updated
Demonstração interativa de como diferentes modelos de IA tokenizam texto. Digite uma frase, escolha os modelos e veja, com cores, como cada um deles quebra seu input em tokens.
Tokenização é o primeiro passo de qualquer modelo de linguagem: antes de "entender" um texto, o modelo precisa fatiá-lo em pedaços (tokens) que ele conhece. Modelos diferentes usam vocabulários diferentes, então a mesma frase pode virar 16 tokens em um modelo e 31 em outro, o que impacta diretamente custo e limite de contexto. Esse projeto torna esse processo visível.
| Modelo | Vocabulário | Observação |
|---|---|---|
| GPT-2 | 50.257 tokens | Codificação mais antiga, treinada quase só em inglês; fragmenta bastante acentos e outros idiomas. |
| GPT-4o | 200.019 tokens | Codificação mais recente da OpenAI, com vocabulário maior e melhor cobertura multilíngue. |
| DeepSeek-R1 | 129.280 tokens | Tokenizador BPE do modelo de raciocínio da DeepSeek, com foco multilíngue. |
O resultado mostra, para cada modelo, os tokens coloridos, as estatísticas (caracteres, tokens, chars/token) e um gráfico comparando o custo em tokens entre os modelos escolhidos.
yarn install
yarn dev
Outros scripts disponíveis:
yarn build # build de produção (type-check + vite build)
yarn preview # serve o build de produção localmente
gpt-tokenizer para os modelos da família GPT@huggingface/transformers para tokenizadores do Hugging Face (ex.: DeepSeek-R1)Feito com 💗 por Lucas Panizio.
3 commits
TypeScript
96.1%
CSS
2.3%
HTML
1.6%
Demonstração interativa de como diferentes modelos de IA tokenizam texto.
0
stars
3
commits
TypeScript
primary language
Aug 20, 2026
updated
Demonstração interativa de como diferentes modelos de IA tokenizam texto. Digite uma frase, escolha os modelos e veja, com cores, como cada um deles quebra seu input em tokens.
Tokenização é o primeiro passo de qualquer modelo de linguagem: antes de "entender" um texto, o modelo precisa fatiá-lo em pedaços (tokens) que ele conhece. Modelos diferentes usam vocabulários diferentes, então a mesma frase pode virar 16 tokens em um modelo e 31 em outro, o que impacta diretamente custo e limite de contexto. Esse projeto torna esse processo visível.
| Modelo | Vocabulário | Observação |
|---|---|---|
| GPT-2 | 50.257 tokens | Codificação mais antiga, treinada quase só em inglês; fragmenta bastante acentos e outros idiomas. |
| GPT-4o | 200.019 tokens | Codificação mais recente da OpenAI, com vocabulário maior e melhor cobertura multilíngue. |
| DeepSeek-R1 | 129.280 tokens | Tokenizador BPE do modelo de raciocínio da DeepSeek, com foco multilíngue. |
O resultado mostra, para cada modelo, os tokens coloridos, as estatísticas (caracteres, tokens, chars/token) e um gráfico comparando o custo em tokens entre os modelos escolhidos.
yarn install
yarn dev
Outros scripts disponíveis:
yarn build # build de produção (type-check + vite build)
yarn preview # serve o build de produção localmente
gpt-tokenizer para os modelos da família GPT@huggingface/transformers para tokenizadores do Hugging Face (ex.: DeepSeek-R1)Feito com 💗 por Lucas Panizio.
3 commits
TypeScript
96.1%
CSS
2.3%
HTML
1.6%