TEASER 01Game generation
Prompt → código → mundos jogáveis.
8B TOTAL / ~1B ACTIVE
Um modelo já disponível, quantizado e pós-treinado quase inteiramente para código.
Local-first. Não é um chatbot. É uma ferramenta para construir software.
BUILT, NOT ANSWERED.
VELUM Coder é um post-training especializado sobre unsloth/LFM2.5-8B-A1B, com 8B parâmetros totais e ~1B ativos. O modelo base já entrega a arquitetura eficiente; o VELUM concentra a especialização.
O post-training foi deliberadamente agressivo: aproximadamente 95% do material de especialização é código e 5% linguagem natural, o suficiente para preservar comunicação sem empurrar o modelo de volta para conversa genérica.
8B DISPONÍVEIS. ~1B TRABALHANDO.
A eficiência vem da base LFM2.5-8B-A1B. O VELUM não reivindica a arquitetura original: ele adiciona uma camada de especialização por fine-tuning e post-training focada em desenvolvimento de software.
8B totais e ~1B ativos herdados do LFM2.5-8B-A1B.
95% código, 5% linguagem natural para preservar instrução e comunicação.
LFM2.5-230M usado como draft model no stack de inferência.
FROM PROMPT TO RUNNING CODE.
Sem benchmark sintético por enquanto. Em vez de esconder isso, mostramos avaliações funcionais: projetos completos gerados pelo modelo e executáveis diretamente no navegador.

Game loop, obstáculos, colisão, score, animações e interface.
TESTAR JOGO ↗

Corrida 3D com câmera de perseguição, pista, trem e collectibles.
TESTAR JOGO ↗$ velum run
model: VELUM-8B
mode: local
focus: code
> crie um jogo 3D com uma pista,
moedas e um trem ao lado da estrada
✓ planning architecture
✓ generating game loop
✓ building scene
✓ wiring controls
✓ runnable output
BUILD COMPLETE.
IDEA IN. SOFTWARE OUT.
O objetivo do post-training é fazer o modelo operar como ferramenta de desenvolvimento: entender intenção, estruturar solução, gerar código, corrigir erros e iterar.
CONFIGURAÇÃO RECOMENDADA
VELUM-Coder foi pós-treinado de forma muito agressiva para código. Ele funciona melhor com sampling conservador, instrução explícita e um começo de resposta que já coloque o modelo no formato esperado. Sem isso, ele pode voltar para texto genérico em vez de entregar código completo.
Para geração de projetos completos, use preferencialmente este padrão:
Crie um [o que você quiser] em um único HTML. Retorne somente o HTML completo.
Exemplo: “Crie um jogo 3D de corrida de carro em uma floresta em um único HTML. Retorne somente o HTML completo.” Quanto menos ambígua a instrução e mais claro o formato de saída, maior a chance de o modelo permanecer em modo de código em vez de gerar explicações genéricas.
| Parâmetro | Recomendado | Descrição |
|---|---|---|
| Temperature | 0.1 – 0.2 | Mantém a geração focada e determinística. |
| Top P | 0.9 – 0.95 | Nucleus sampling padrão para cobertura de vocabulário. |
| Top K | 40 | Limita a dispersão de tokens. |
| Min P | 0.05 | Remove tokens de cauda longa com probabilidade irrelevante. |
| Repetition Penalty | 1.0 – 1.05 | Evite valores altos (> 1.1), que podem quebrar sintaxes de código. |
Sensibilidade de instrução: para projetos completos, diga exatamente o artefato, o formato e que a saída deve conter somente o código.
Prefill recomendado: comece a resposta com <!DOCTYPE html> para HTML, import para Python, ou o cabeçalho natural do arquivo esperado.
System prompt: use algo curto e direto. O objetivo é colocar o modelo em modo de programação, não convidá-lo para escrever um ensaio filosófico sobre a própria existência.
Você é um assistente especialista em programação. Gere código limpo, funcional, completo e bem estruturado. Siga exatamente o formato de saída solicitado. Evite explicações quando o usuário pedir somente código.
Se o seu runtime suporta JSON Schema / structured output, você pode travar a resposta em um formato previsível. Isso ajuda bastante quando o VELUM é usado em pipelines, agentes, IDEs ou geração automática de arquivos.
{
"$schema": "http://json-schema.org/draft-07/schema#",
"type": "object",
"properties": {
"language": {
"type": "string"
},
"code": {
"type": "string"
},
"markdown_full": {
"type": "string"
}
},
"required": [
"language",
"code",
"markdown_full"
],
"additionalProperties": false
}
Linguagem principal do artefato gerado, por exemplo html, javascript, python.
Código puro, pronto para salvar em arquivo ou encaminhar para outra etapa do pipeline.
Resposta completa em Markdown quando você quiser preservar contexto, explicação ou documentação junto do código.
Os exemplos abaixo seguem prompts usados nos projetos locais demonstrados na landing. A lista completa também vai dentro do pacote.
Crie um jogo Flappy Bird completo e responsivo em um único arquivo HTML. Retorne somente o HTML completo.Crie uma experiência 3D interativa de um bonsai voxel em um único HTML. Retorne somente o HTML completo.Crie um joguinho 3D de carro em uma corrida ao lado de uma ferrovia. Retorne somente o HTML completo.Crie um jogo 3D de carro em uma rodovia cyberpunk retrô em um único HTML. Retorne somente o HTML completo.Crie um jogo de tiro 3D inspirado em Doom usando Three.js em um único HTML. Retorne somente o HTML completo.Crie um sistema solar 3D interativo em um único HTML. Retorne somente o HTML completo.Crie um jogo 3D chamado Semáforo do Caos em um único HTML. Retorne apenas o HTML.Crie um jogo 3D chamado Deploy na Sexta às 18h em um único HTML. Retorne apenas o HTML.AVAILABLE NOW · QUANTIZED · HUGGING FACE
Baixe as versões quantizadas diretamente no Hugging Face e rode localmente no seu próprio stack.
ABRIR NO HUGGING FACE ↗| Base model | unsloth/LFM2.5-8B-A1B |
|---|---|
| Draft model | LFM2.5-230M |
| Parâmetros | 8B total · ~1B active |
| Post-training | 95% code · 5% language |
| Uso | Código / desenvolvimento de software |
O orçamento de compute foi priorizado no treinamento e post-training na H100. Ainda não rodei uma bateria padronizada completa como HumanEval/MBPP com metodologia reproduzível. Em vez de preencher a página com números parciais, esta release mostra avaliações funcionais e projetos executáveis. Eles demonstram capacidade prática, mas não substituem benchmarks padronizados.
A distribuição pública é do modelo quantizado. Dataset de treinamento, pipeline de treinamento e outros artefatos internos não fazem parte desta release.
Baixe. Rode localmente. Aponte para código.