tokenizador lab64k64.000 peças
código aberto
Do corpus ao peso.
leve
Feito para rodar no seu computador.
pesquisa
Método publicado, número registrado.
corpus auditável
Licença declarada, fonte por fonte.
projeto open source em construção
leve
Menos tokens para o mesmo português.
Cada token poupado é conta a menos na hora de rodar. Entre os tokenizadores multilíngues abertos, o lab64k é o que menos gasta. O Tucano, feito só para português, gasta menos ainda.
| tokenizador | vocabulário | tokens por palavra | escala | vs lab64k |
|---|---|---|---|---|
| Tucano 2B4 | 32.000 | 1,48 | −14,8% | |
| lab64k | 64.000 | 1,73 | base | |
| SmolLM3 3B | 128.256 | 1,90 | +9,4% | |
| Qwen3 1.7B | 151.669 | 1,97 | +13,6% |
Método: 1.084 documentos em português (Wikipédia e Querido Diário), cerca de 5 milhões de caracteres, retidos fora do treino do lab64k. O mesmo texto passou pelos quatro tokenizadores, com quebras de linha normalizadas. Medido em 15/09/2026.
aberto
Do primeiro coletor ao último peso, tudo à vista.
laboratorio/ ├── lab/ │ ├── collectors/ │ ├── pipeline/ │ ├── tokenizer/ │ ├── train/ │ └── eval/ ├── data/ │ └── manifest.csv └── pesquisa/
pesquisa
Cada passo vira método. Cada número, registro.
- Método e catálogo de falhas silenciosasem breve
- labpt1t: um trilhão de tokens em portuguêsem breve
- FLOP compra raciocínioem breve
auditável
Cada fonte com licença, origem e assinatura.
| source_id | licenca | uso_comercial | redistribuivel | tokens_est |
|---|---|---|---|---|
| 340 fontes | 2.494.379.989.410 tokens | |||
Seja um CO-laborator.
pesquisa, dados, acervo ou GPU