Autor: Daniel Dieser (TokioAI) Version: 1.0 -- Octubre 2026 Licencia: MIT
Esta guia documenta el proceso completo de fine-tuning de Large Language Models (LLMs), desde los fundamentos teoricos hasta el deploy en produccion. Incluye scripts reproducibles, lecciones aprendidas, y todo lo necesario para que cualquier persona pueda entrenar su propio modelo especializado.
-
Fundamentos: Que es un LLM y como funciona
- Transformers y el mecanismo de atencion
- Tokenizacion: de texto a numeros
- Pre-training vs Fine-tuning
- Por que fine-tunear (y cuando NO hacerlo)
-
El Loop Humano: Datos Sinteticos y Dataset Design
- La importancia de los datos
- Datos sinteticos vs datos reales
- Curado y limpieza
- Formato JSONL para fine-tuning
- Balance de categorias
- Herramientas y scripts
-
Setup GPU: Cloud, Hardware Propio, y Opciones de Bajo Costo
- Elegir la GPU correcta (tabla comparativa con precios)
- Cloud: GCP, AWS, Azure (creacion de VM, tips Spot/Preemptible)
- Proveedores GPU dedicados: Lambda, RunPod, Vast.ai, CoreWeave
- Hardware propio: builds recomendados ($1,500 / $3,500 / $8,000)
- tinybox de tinygrad (George Hotz): 6x Radeon 7900 XTX, 144 GB VRAM
- Comparativa de costos: cloud vs hardware propio vs tinybox
- Instalar drivers (NVIDIA y AMD/ROCm)
- Tips de ahorro
-
- Estructura de un ejemplo de training
- Categorias y cobertura
- Generacion con LLM (datos sinteticos)
- Validacion y QA
- Script completo de generacion
-
- Que es LoRA (Low-Rank Adaptation)
- Que es QLoRA (Quantized LoRA)
- Hiperparametros criticos
- El script de training paso a paso
- Monitoreo y troubleshooting
- Cuanto tarda segun hardware
-
Post-Entrenamiento: Merge, GGUF, y Quantizacion
- Merge del adapter con el modelo base
- Conversion a formato GGUF
- Quantizacion (Q4_K_M, Q8_0, F16)
- Crear modelo en Ollama
-
Inferencia y Deploy: Think/Act/Observe/Learn
- El ciclo Think/Act/Observe/Learn
- Tool calling: como el modelo ejecuta herramientas
- Integracion con TokioAI CLI
- System prompts efectivos
- Benchmarking y evaluacion
-
01_setup_gpu.sh-- Setup completo de la VM02_generate_dataset.py-- Generacion de dataset03_train.py-- Script de training04_merge_convert.py-- Merge + GGUF + Ollama05_benchmark.py-- Benchmark automatizado
- Acceso a GPU(s) con suficiente VRAM (cloud, hardware propio, o tinybox -- ver seccion 3)
- Python 3.10+
- Conocimientos basicos de Linux y terminal
- ~$5-20 USD para las GPUs (dependiendo del modelo y tiempo)
| Modelo | Parametros | VRAM minima | Tiempo training (716 examples) |
|---|---|---|---|
| Qwen2.5-3B-Instruct | 3B | 8 GB (1x T4) | ~7 min |
| Qwen2.5-14B-Instruct | 14B | 16 GB (1x T4) | ~45 min |
| Qwen2.5-72B-Instruct | 72B | 48 GB (2x L4) | ~3 horas |
| Devstral-Small-2505 | 24B | 60 GB (4x T4) | ~15 horas |
"The best way to learn is to build. The best way to teach is to document what you built."