laborator.io

tokenizador lab64k64.000 peças

  • código aberto

    Do corpus ao peso.

  • leve

    Feito para rodar no seu computador.

  • pesquisa

    Método publicado, número registrado.

  • corpus auditável

    Licença declarada, fonte por fonte.

projeto open source em construção

leve

Menos tokens para o mesmo português.

Cada token poupado é conta a menos na hora de rodar. Entre os tokenizadores multilíngues abertos, o lab64k é o que menos gasta. O Tucano, feito só para português, gasta menos ainda.

Tokens por palavra em português. Menor é melhor.
tokenizadorvocabuláriotokens por palavraescalavs lab64k
Tucano 2B432.0001,48−14,8%
lab64k64.0001,73base
SmolLM3 3B128.2561,90+9,4%
Qwen3 1.7B151.6691,97+13,6%

Método: 1.084 documentos em português (Wikipédia e Querido Diário), cerca de 5 milhões de caracteres, retidos fora do treino do lab64k. O mesmo texto passou pelos quatro tokenizadores, com quebras de linha normalizadas. Medido em 15/09/2026.

aberto

Do primeiro coletor ao último peso, tudo à vista.

laboratorio/
├── lab/
│   ├── collectors/
│   ├── pipeline/
│   ├── tokenizer/
│   ├── train/
│   └── eval/
├── data/
│   └── manifest.csv
└── pesquisa/

pesquisa

Cada passo vira método. Cada número, registro.

  • Método e catálogo de falhas silenciosasem breve
  • labpt1t: um trilhão de tokens em portuguêsem breve
  • FLOP compra raciocínioem breve

auditável

Cada fonte com licença, origem e assinatura.

source_idlicencauso_comercialredistribuiveltokens_est
340 fontes2.494.379.989.410 tokens

Seja um CO-laborator.

pesquisa, dados, acervo ou GPU

Seja um CO-laborator

por onde quer entrar