LOCAL-FIRST · CODE SPECIALIST

VELUM

8B TOTAL / ~1B ACTIVE

Um modelo já disponível, quantizado e pós-treinado quase inteiramente para código.
Local-first. Não é um chatbot. É uma ferramenta para construir software.

BASEunsloth/LFM2.5-8B-A1B
POST-TRAINING95% CODE · 5% LANGUAGE
STATUSAVAILABLE · QUANTIZED

BUILT, NOT ANSWERED.

Menos chatbot.
Mais ferramenta.

VELUM Coder é um post-training especializado sobre unsloth/LFM2.5-8B-A1B, com 8B parâmetros totais e ~1B ativos. O modelo base já entrega a arquitetura eficiente; o VELUM concentra a especialização.

O post-training foi deliberadamente agressivo: aproximadamente 95% do material de especialização é código e 5% linguagem natural, o suficiente para preservar comunicação sem empurrar o modelo de volta para conversa genérica.

VELUM não foi otimizado para conversa casual. Ele foi otimizado para escrever, entender, corrigir e montar software.
PARÂMETROS TOTAIS8Bcapacidade disponível
ATIVOS~1Bpor inferência
POST-TRAINING95%conteúdo focado em código
RELEASEREADYquantizado no Hugging Face

8B DISPONÍVEIS. ~1B TRABALHANDO.

Capacidade sem
força bruta.

A eficiência vem da base LFM2.5-8B-A1B. O VELUM não reivindica a arquitetura original: ele adiciona uma camada de especialização por fine-tuning e post-training focada em desenvolvimento de software.

  • 01
    Base eficiente

    8B totais e ~1B ativos herdados do LFM2.5-8B-A1B.

  • 02
    Post-training extremo

    95% código, 5% linguagem natural para preservar instrução e comunicação.

  • 03
    Draft model

    LFM2.5-230M usado como draft model no stack de inferência.

INFERENCE FLOW
INPUT
BASE MODEL
CODE
REASON
STRUCTURE
RUNNING CODE
TEASER 01Game generation

Prompt → código → mundos jogáveis.

TEASER 02Model identity

Local. Fast. Efficient. Smart.

FROM PROMPT TO RUNNING CODE.

Código que
realmente roda.

Sem benchmark sintético por enquanto. Em vez de esconder isso, mostramos avaliações funcionais: projetos completos gerados pelo modelo e executáveis diretamente no navegador.

Flappy Bird gerado
01 / BROWSER GAME

Flappy Bird

Game loop, obstáculos, colisão, score, animações e interface.

HTMLCSSJS
TESTAR JOGO ↗
Bonsai Voxel 3D gerado
02 / THREE.JS

Bonsai Voxel

Cena 3D, voxels, câmera orbital, interação e partículas.

THREE.JSWEBGL3D
TESTAR JOGO ↗
Railway Rush gerado
03 / GAMEPLAY

Railway Rush

Corrida 3D com câmera de perseguição, pista, trem e collectibles.

THREE.JSPHYSICSGAME
TESTAR JOGO ↗
velum.local
$ velum run

model: VELUM-8B
mode: local
focus: code

> crie um jogo 3D com uma pista,
  moedas e um trem ao lado da estrada

✓ planning architecture
✓ generating game loop
✓ building scene
✓ wiring controls
✓ runnable output

BUILD COMPLETE.

IDEA IN. SOFTWARE OUT.

O resultado não precisa ser outro parágrafo.

O objetivo do post-training é fazer o modelo operar como ferramenta de desenvolvimento: entender intenção, estruturar solução, gerar código, corrigir erros e iterar.

GERAÇÃOprojetos completos
DEBUGanálise + correção
REFATORAÇÃOestrutura + clareza
PROTOTIPAGEMideia → executável

CONFIGURAÇÃO RECOMENDADA

USE DO
JEITO CERTO.

VELUM-Coder foi pós-treinado de forma muito agressiva para código. Ele funciona melhor com sampling conservador, instrução explícita e um começo de resposta que já coloque o modelo no formato esperado. Sem isso, ele pode voltar para texto genérico em vez de entregar código completo.

POR QUE O FORMATO DO PROMPT IMPORTA: como o VELUM-Coder trabalha com aproximadamente 1B de parâmetros ativos por inferência, ele é muito eficiente, mas tem menos margem para raciocínio aberto e interpretação ambígua do que modelos muito maiores. Prompts vagos tendem a degradar a saída. O modelo responde melhor quando recebe uma estrutura curta, direta e com o formato final explicitamente definido.

Estrutura recomendada de prompt

Para geração de projetos completos, use preferencialmente este padrão:

Crie um [o que você quiser] em um único HTML.
Retorne somente o HTML completo.

Exemplo: “Crie um jogo 3D de corrida de carro em uma floresta em um único HTML. Retorne somente o HTML completo.” Quanto menos ambígua a instrução e mais claro o formato de saída, maior a chance de o modelo permanecer em modo de código em vez de gerar explicações genéricas.

IMPORTANTE: este não é um modelo de conversa. Para geração de código, use prompts objetivos, peça explicitamente o formato de saída e, em tarefas maiores, use prefill do começo do arquivo esperado.

Sampling

ParâmetroRecomendadoDescrição
Temperature0.1 – 0.2Mantém a geração focada e determinística.
Top P0.9 – 0.95Nucleus sampling padrão para cobertura de vocabulário.
Top K40Limita a dispersão de tokens.
Min P0.05Remove tokens de cauda longa com probabilidade irrelevante.
Repetition Penalty1.0 – 1.05Evite valores altos (> 1.1), que podem quebrar sintaxes de código.

Prompting

Sensibilidade de instrução: para projetos completos, diga exatamente o artefato, o formato e que a saída deve conter somente o código.

Prefill recomendado: comece a resposta com <!DOCTYPE html> para HTML, import para Python, ou o cabeçalho natural do arquivo esperado.

System prompt: use algo curto e direto. O objetivo é colocar o modelo em modo de programação, não convidá-lo para escrever um ensaio filosófico sobre a própria existência.

Você é um assistente especialista em programação.
Gere código limpo, funcional, completo e bem estruturado.
Siga exatamente o formato de saída solicitado.
Evite explicações quando o usuário pedir somente código.

Structured Output

Se o seu runtime suporta JSON Schema / structured output, você pode travar a resposta em um formato previsível. Isso ajuda bastante quando o VELUM é usado em pipelines, agentes, IDEs ou geração automática de arquivos.

JSON SCHEMA
{
  "$schema": "http://json-schema.org/draft-07/schema#",
  "type": "object",
  "properties": {
    "language": {
      "type": "string"
    },
    "code": {
      "type": "string"
    },
    "markdown_full": {
      "type": "string"
    }
  },
  "required": [
    "language",
    "code",
    "markdown_full"
  ],
  "additionalProperties": false
}
language

Linguagem principal do artefato gerado, por exemplo html, javascript, python.

code

Código puro, pronto para salvar em arquivo ou encaminhar para outra etapa do pipeline.

markdown_full

Resposta completa em Markdown quando você quiser preservar contexto, explicação ou documentação junto do código.

RECOMENDAÇÃO: structured output não substitui um bom prompt. Continue dizendo explicitamente o que deve ser criado, o formato esperado e, quando possível, use prefill.

Prompts usados nos exemplos

Os exemplos abaixo seguem prompts usados nos projetos locais demonstrados na landing. A lista completa também vai dentro do pacote.

Flappy Bird
Crie um jogo Flappy Bird completo e responsivo em um único arquivo HTML. Retorne somente o HTML completo.
Bonsai Voxel
Crie uma experiência 3D interativa de um bonsai voxel em um único HTML. Retorne somente o HTML completo.
Railway Rush
Crie um joguinho 3D de carro em uma corrida ao lado de uma ferrovia. Retorne somente o HTML completo.
Cyber Highway 1984
Crie um jogo 3D de carro em uma rodovia cyberpunk retrô em um único HTML. Retorne somente o HTML completo.
Doom Three.js
Crie um jogo de tiro 3D inspirado em Doom usando Three.js em um único HTML. Retorne somente o HTML completo.
Sistema Solar 3D
Crie um sistema solar 3D interativo em um único HTML. Retorne somente o HTML completo.
Semáforo do Caos
Crie um jogo 3D chamado Semáforo do Caos em um único HTML. Retorne apenas o HTML.
Deploy na Sexta às 18h
Crie um jogo 3D chamado Deploy na Sexta às 18h em um único HTML. Retorne apenas o HTML.

AVAILABLE NOW · QUANTIZED · HUGGING FACE

Já está
disponível.

MODELO

VELUM-Coder

Baixe as versões quantizadas diretamente no Hugging Face e rode localmente no seu próprio stack.

ABRIR NO HUGGING FACE ↗
STACK
Base modelunsloth/LFM2.5-8B-A1B
Draft modelLFM2.5-230M
Parâmetros8B total · ~1B active
Post-training95% code · 5% language
UsoCódigo / desenvolvimento de software
SOBRE BENCHMARKS

Ainda não tem uma tabela bonita de números. De propósito.

O orçamento de compute foi priorizado no treinamento e post-training na H100. Ainda não rodei uma bateria padronizada completa como HumanEval/MBPP com metodologia reproduzível. Em vez de preencher a página com números parciais, esta release mostra avaliações funcionais e projetos executáveis. Eles demonstram capacidade prática, mas não substituem benchmarks padronizados.

O QUE É PUBLICADO

A distribuição pública é do modelo quantizado. Dataset de treinamento, pipeline de treinamento e outros artefatos internos não fazem parte desta release.

VELUM / BRAZIL

Inteligência
que fica perto.

Baixe. Rode localmente. Aponte para código.

by guell00 · Miguel Penha Reis