Skip to content

Repository files navigation

Fine-Tuning LLMs: Guia Completa End-to-End

De la Teoria a la Produccion -- TokioAI

Autor: Daniel Dieser (TokioAI) Version: 1.0 -- Octubre 2026 Licencia: MIT


Esta guia documenta el proceso completo de fine-tuning de Large Language Models (LLMs), desde los fundamentos teoricos hasta el deploy en produccion. Incluye scripts reproducibles, lecciones aprendidas, y todo lo necesario para que cualquier persona pueda entrenar su propio modelo especializado.

Tabla de Contenidos

  1. Fundamentos: Que es un LLM y como funciona

    • Transformers y el mecanismo de atencion
    • Tokenizacion: de texto a numeros
    • Pre-training vs Fine-tuning
    • Por que fine-tunear (y cuando NO hacerlo)
  2. El Loop Humano: Datos Sinteticos y Dataset Design

    • La importancia de los datos
    • Datos sinteticos vs datos reales
    • Curado y limpieza
    • Formato JSONL para fine-tuning
    • Balance de categorias
    • Herramientas y scripts
  3. Setup GPU: Cloud, Hardware Propio, y Opciones de Bajo Costo

    • Elegir la GPU correcta (tabla comparativa con precios)
    • Cloud: GCP, AWS, Azure (creacion de VM, tips Spot/Preemptible)
    • Proveedores GPU dedicados: Lambda, RunPod, Vast.ai, CoreWeave
    • Hardware propio: builds recomendados ($1,500 / $3,500 / $8,000)
    • tinybox de tinygrad (George Hotz): 6x Radeon 7900 XTX, 144 GB VRAM
    • Comparativa de costos: cloud vs hardware propio vs tinybox
    • Instalar drivers (NVIDIA y AMD/ROCm)
    • Tips de ahorro
  4. Construir el Dataset

    • Estructura de un ejemplo de training
    • Categorias y cobertura
    • Generacion con LLM (datos sinteticos)
    • Validacion y QA
    • Script completo de generacion
  5. Entrenamiento: LoRA y QLoRA

    • Que es LoRA (Low-Rank Adaptation)
    • Que es QLoRA (Quantized LoRA)
    • Hiperparametros criticos
    • El script de training paso a paso
    • Monitoreo y troubleshooting
    • Cuanto tarda segun hardware
  6. Post-Entrenamiento: Merge, GGUF, y Quantizacion

    • Merge del adapter con el modelo base
    • Conversion a formato GGUF
    • Quantizacion (Q4_K_M, Q8_0, F16)
    • Crear modelo en Ollama
  7. Inferencia y Deploy: Think/Act/Observe/Learn

    • El ciclo Think/Act/Observe/Learn
    • Tool calling: como el modelo ejecuta herramientas
    • Integracion con TokioAI CLI
    • System prompts efectivos
    • Benchmarking y evaluacion
  8. Scripts Reproducibles

    • 01_setup_gpu.sh -- Setup completo de la VM
    • 02_generate_dataset.py -- Generacion de dataset
    • 03_train.py -- Script de training
    • 04_merge_convert.py -- Merge + GGUF + Ollama
    • 05_benchmark.py -- Benchmark automatizado

Requisitos Previos

  • Acceso a GPU(s) con suficiente VRAM (cloud, hardware propio, o tinybox -- ver seccion 3)
  • Python 3.10+
  • Conocimientos basicos de Linux y terminal
  • ~$5-20 USD para las GPUs (dependiendo del modelo y tiempo)

Modelos Probados

Modelo Parametros VRAM minima Tiempo training (716 examples)
Qwen2.5-3B-Instruct 3B 8 GB (1x T4) ~7 min
Qwen2.5-14B-Instruct 14B 16 GB (1x T4) ~45 min
Qwen2.5-72B-Instruct 72B 48 GB (2x L4) ~3 horas
Devstral-Small-2505 24B 60 GB (4x T4) ~15 horas

"The best way to learn is to build. The best way to teach is to document what you built."

About

Complete end-to-end guide for fine-tuning LLMs with LoRA/QLoRA. 7 chapters, reproducible scripts, hardware comparison. From theory to production.

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages