Milo X1 (fine-tuned)
Modelo de lenguaje Transformer autoregresivo en español, entrenado completamente desde cero (sin pesos preentrenados, arquitectura propia con RoPE + atención causal + SwiGLU + RMSNorm).
- Parámetros: ~18.79M
- d_model: 320 | capas: 6 | heads: 8
- context_length: 768
- Vocabulario: 14000 tokens (BPE byte-level, librería
tokenizers)
Archivos
model.safetensors: pesos del modeloconfig.json: hiperparámetros de arquitectura (para reconstruirMiloX1)tokenizer.json: tokenizer BPE byte-level (formato nativo de la libreríatokenizers)
- Downloads last month
- 35
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support