Ver equipos

AI Supercomputers es el portal de IA local del Grupo Ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Tutorial completo · Adaptación local

Fine-tuning con LoRA y Unsloth en local: datos, entrenamiento y evaluación

Una guía para adaptar un modelo sin reentrenar todos sus pesos: cuándo utilizar LoRA, cómo preparar un dataset, calcular memoria, entrenar, evaluar, exportar y decidir el hardware.

LoRA y QLoRADataset versionadoEvaluación antes de fusionar
Ruta de montaje

Qué necesitas antes y cómo sabrás que has terminado

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

Un objetivo que RAG o prompting no resuelvan y un dataset separado de la evaluación.

Resultado verificable

Entrenar un adaptador LoRA, compararlo con el modelo base y documentar su publicación o reversión.

Primera decisión

Cuándo hacer fine-tuning y cuándo basta con prompt o RAG

En palabras sencillas

Tres formas de enseñar a la IA, de menor a mayor esfuerzo: darle instrucciones (prompt) es explicarle la tarea; darle documentos (RAG) es dejarle consultar tus manuales; el fine-tuning es enviarla a un curso para que interiorice tu estilo. La mayoría de empresas resuelve con las dos primeras; el curso se reserva para jerga y formatos muy repetitivos.

LoRA adapta el comportamiento de un modelo entrenando matrices de bajo rango añadidas a determinadas capas. Reduce parámetros entrenables y memoria frente a un ajuste completo. No introduce por sí sola una base de conocimiento actualizable ni garantiza que el modelo cite fuentes.

NecesidadTécnica preferenteMotivo
Cambiar tono o formatoPrompt primero; LoRA si no es estableEvita entrenamiento innecesario
Responder con documentos que cambianRAGActualiza fuentes sin reentrenar
Aprender una estructura de salida repetitivaLoRA / SFTRefuerza patrones y seguimiento
Especializar vocabulario y tareaLoRA con dataset de calidadAdapta comportamiento del modelo
Corregir una regla de negocioAplicación deterministaUna regla no debe depender de probabilidad
Dar acceso a sistemasHerramientas con permisosFine-tuning no aporta autorización

Antes de entrenar, crea una línea base con el modelo original. Si un prompt o una recuperación bien diseñada resuelven la tarea, conservarás un sistema más fácil de actualizar y auditar.

Conceptos

LoRA, QLoRA, SFT, adaptador y fusión

SFT. Ajuste supervisado con pares de entrada y respuesta o conversaciones de ejemplo.
LoRA. Entrena adaptadores de bajo rango en módulos seleccionados mientras los pesos base permanecen congelados.
QLoRA. Carga el modelo base cuantizado para reducir memoria y entrena adaptadores en una precisión adecuada.
Rango. Capacidad del adaptador. Aumentarlo añade parámetros y memoria; no garantiza mejor generalización.
Alpha. Escala aplicada a la actualización LoRA. Se interpreta junto al rango y la implementación.
Target modules. Capas en las que se insertan adaptadores, por ejemplo proyecciones de atención y MLP.
Adapter checkpoint. Archivo pequeño con los pesos entrenados y configuración, dependiente del modelo base.
Merge. Integración del adaptador en una copia de los pesos base para exportar un modelo combinado.
Chat template. Formato que convierte mensajes en tokens. Debe coincidir entre dataset, entrenamiento e inferencia.
Overfitting. El modelo memoriza ejemplos o patrones del entrenamiento y empeora en casos nuevos.

Un adaptador no es autónomo: registra el identificador exacto del modelo base, tokenizer, plantilla, configuración y licencia. Cargarlo sobre otra variante puede producir errores o un comportamiento impredecible.

Modelo base

Elegir una familia que ya esté cerca del resultado deseado

Fine-tuning no convierte un modelo pequeño en uno de capacidad ilimitada. Selecciona primero una familia que siga instrucciones, entienda castellano y soporte el contexto, visión o herramientas que necesitas. Evalúa Qwen, Llama, Gemma, DeepSeek-R1 o gpt-oss según tarea y licencia, y registra la variante concreta.

  1. Prueba en cero ejemplos. Ejecuta el banco de evaluación con el modelo base.
  2. Prueba prompting. Añade instrucciones y pocos ejemplos representativos.
  3. Comprueba la licencia. Uso, adaptación, redistribución y modelo derivado.
  4. Verifica formato. Tokenizer, plantilla de chat y soporte de la biblioteca de entrenamiento.
  5. Estima memoria. Pesos, cuantización, activaciones, gradientes, optimizador y longitud de secuencia.
  6. Conserva una alternativa. Una familia menor o mayor permite saber si el límite es adaptación o capacidad.

La guía modelos de IA local explica cómo comparar familias y cuantizaciones antes del entrenamiento.

Dataset

Construir ejemplos que representen producción y no enseñen errores

La calidad del dataset domina el resultado. Un conjunto grande de respuestas inconsistentes puede empeorar el modelo. Define una política de redacción, revisa cada ejemplo y separa datos de entrenamiento, validación y prueba por origen para evitar filtraciones.

CampoRequisitoFallo frecuente
InstrucciónObjetivo claro y suficiente contextoPreguntas ambiguas con una única respuesta asumida
RespuestaCorrecta, completa y con el formato finalTexto generado sin revisión
NegativosCasos de abstención y fuera de alcanceEnseñar que siempre debe responder
DiversidadVariaciones reales de idioma y longitudPlantillas casi duplicadas
MetadatosFuente, autor, licencia y versiónNo poder retirar un ejemplo
SeparaciónTest no visto y sin duplicados semánticosMedir memoria del dataset

Formato conversacional

{"messages": [
  {"role": "system", "content": "Política de la tarea"},
  {"role": "user", "content": "Entrada representativa"},
  {"role": "assistant", "content": "Respuesta aprobada"}
]}

Utiliza la plantilla oficial de la variante. No concatentes manualmente tokens especiales sin comprobar el tokenizer. Filtra secuencias demasiado largas y registra cuántos ejemplos se truncarían.

Datos personales y confidenciales

Minimiza, anonimiza cuando sea posible y limita acceso al dataset. Un modelo puede memorizar fragmentos. No introduzcas secretos, credenciales, correos completos o documentos sin una finalidad, base y evaluación claras.

Entorno de entrenamiento

Instalar Unsloth en un entorno reproducible

Unsloth optimiza el ajuste de modelos compatibles y ofrece cuadernos y ejemplos que cambian con rapidez. Utiliza un entorno virtual o contenedor, comprueba compatibilidad entre GPU, controlador, CUDA, PyTorch, bitsandbytes y la biblioteca. Fija versiones una vez que el entrenamiento funciona.

python -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip

# Instala PyTorch para tu plataforma y después la pila de entrenamiento.
pip install unsloth datasets trl peft

El comando es orientativo. Revisa las instrucciones vigentes para tu plataforma antes de instalar. En DGX Spark o cualquier sistema ARM64, confirma que cada dependencia y kernel dispone de soporte para la arquitectura.

Configuración

Elegir secuencia, lote, rango y módulos mediante una prueba pequeña

Empieza con un subconjunto y una ejecución corta. Comprueba que la pérdida baja, los checkpoints se guardan y la evaluación funciona. Solo después aumenta pasos o dataset.

ParámetroEfectoCómo decidir
Longitud máximaActivaciones y memoriaDistribución real de tokens; evita fijar el máximo teórico
MicrobatchMemoria por pasoEl mayor que cabe con margen
AcumulaciónLote efectivo sin cargar todo a la vezEquilibra estabilidad y tiempo
Learning rateTamaño de las actualizacionesCurvas de entrenamiento y validación
Rango LoRACapacidad del adaptadorCompara pequeño y medio; vigila sobreajuste
Target modulesCapas adaptadasReceta de la arquitectura y ablation
Épocas o pasosExposición a los ejemplosParada por validación, no por una cifra fija
CheckpointRecuperación y comparaciónGuarda por intervalos y limita retención

La precisión mixta reduce memoria y puede acelerar entrenamiento. QLoRA reduce la memoria del modelo base, pero activaciones y longitud siguen siendo determinantes. Gradient checkpointing intercambia cálculo por menor memoria.

Ejecución

Entrenar con controles de pérdida, validación y recuperación

  1. Carga modelo y tokenizer. Registra el identificador y la revisión.
  2. Aplica la plantilla. Convierte cada conversación exactamente como se usará en inferencia.
  3. Filtra y tokeniza. Informa de ejemplos vacíos, truncados y distribución de longitud.
  4. Crea el adaptador. Define rango, alpha, dropout y módulos objetivo.
  5. Ejecuta una prueba corta. Confirma memoria, velocidad y guardado.
  6. Entrena con validación. Observa pérdida de entrenamiento y validación; detén si se separan.
  7. Guarda adaptador y configuración. Incluye tokenizer, plantilla y métricas.
  8. Evalúa el checkpoint. No selecciones solo el último; compara en el banco de pruebas.
Artefactos mínimos
- modelo base y revisión
- tokenizer y chat template
- configuración LoRA
- configuración de entrenamiento
- dataset y división versionados
- métricas y logs
- adaptador por checkpoint
- informe de evaluación

Una pérdida baja no demuestra utilidad. El modelo puede memorizar el dataset, alterar capacidades generales o empeorar seguridad. La evaluación externa decide.

Evaluación

Comparar base y adaptado con casos que el entrenamiento no ha visto

DimensiónPruebaFallo bloqueante
Tarea objetivoExactitud y formatoNo mejora o inventa campos
GeneralizaciónVariantes nuevasSolo funciona con plantillas del dataset
AbstenciónEntradas fuera de alcanceResponde con seguridad aparente
Conocimiento generalCasos del modelo baseRegresión relevante
SeguridadInyección y solicitudes prohibidasEl adaptador debilita límites
PrivacidadIntentos de extraer ejemplosReproduce datos sensibles
OperaciónLatencia y memoriaNo cabe en el entorno de destino

Ejecuta varias semillas o checkpoints cuando el coste lo permita. Revisa muestras humanas con una rúbrica. Conserva la línea base para demostrar qué aporta el ajuste y qué empeora.

Prueba de memorización

Busca fragmentos únicos del dataset mediante prompts directos e indirectos. La ausencia de reproducción en una prueba no garantiza privacidad, pero la presencia es una señal de retirada o rediseño.

Exportación

Servir el adaptador, fusionar o cuantizar sin perder la trazabilidad

Puedes mantener modelo base y adaptador separados, fusionar una copia o exportar a un formato de inferencia. Cada opción cambia almacenamiento, flexibilidad y riesgo.

OpciónVentajaPrecaución
Adaptador separadoPequeño y fácil de cambiarRequiere exactamente el modelo base compatible
Modelo fusionadoDespliegue más sencillo en algunos motoresCrea otro artefacto grande y debe evaluarse de nuevo
Cuantización posteriorReduce memoria de inferenciaPuede degradar el comportamiento aprendido
Registro de modelosVersiones, aprobaciones y retiradaDebe incluir licencia y procedencia
  1. Exporta a una carpeta nueva; no sobrescribas el checkpoint aprobado.
  2. Calcula hashes y registra configuración.
  3. Carga en el runtime de destino.
  4. Repite el banco de pruebas después de merge o cuantización.
  5. Mide memoria, contexto y velocidad.
  6. Publica con un identificador inmutable y plan de reversión.

Para Ollama, crea un Modelfile o importa un formato compatible según la ruta de exportación. El modelo servido debe conservar la plantilla usada durante entrenamiento.

Diagnóstico

Resolver falta de memoria, pérdida inestable y modelo que no aprende

SíntomaCausa probableOrden de actuación
OOM al iniciarModelo, secuencia o batch excesivosConfirma cuantización, reduce microbatch y longitud, activa checkpointing
OOM durante evaluaciónGeneración o lote de eval diferenteReduce lote y longitud; libera cachés entre fases
Pérdida no bajaFormato, máscaras o learning rateInspecciona ejemplos tokenizados y una muestra pequeña
Validación empeoraSobreajuste o datos inconsistentesDetén antes, limpia dataset y reduce capacidad
Respuestas con formato extrañoChat template incorrectaAlinea entrenamiento e inferencia
Adaptador no cargaModelo base o módulos distintosComprueba identificador, revisión y configuración
Entrenamiento muy lentoDescarga, kernels o CPU de datosPerfila GPU, precisión, dataloader y almacenamiento
Hardware

Dimensionar entrenamiento, no inferencia

La memoria de entrenamiento incluye más componentes que los pesos cuantizados de inferencia. Longitud y microbatch pueden dominar. Una GPU discreta es más rápida cuando el trabajo cabe. DGX Spark aporta 128 GB coherentes y puede permitir adaptaciones que no caben en VRAM convencional, aunque debes validar compatibilidad ARM64 y velocidad. RTX PRO 6000 ofrece 96 GB de VRAM y gran ancho de banda. DGX Station amplía de forma sustancial la memoria para modelos, lotes y usuarios mayores.

Prueba pequeña

GPU existente

Valida dataset, plantilla y evaluación con una variante contenida.

Velocidad y VRAM

RTX PRO 6000

Encaja cuando 96 GB permiten mantener entrenamiento en GPU y el tiempo importa.

Ver RTX PRO 6000 →
Capacidad coherente

DGX Spark o Station

Spark abre 128 GB en formato compacto; Station cubre una escala superior de memoria y servicio.

Analizar DGX Spark →

Para recomendar hardware necesitamos modelo base, cuantización, longitud, microbatch, acumulación, módulos LoRA, dataset, tiempo objetivo y si el equipo también servirá inferencia.

Lista de producción

Publicar un modelo adaptado con evidencia y reversión

Siguientes pasos

Conectar el entrenamiento con conocimiento, gobierno y servicio

Conocimiento cambiante

Comprueba si RAG resuelve la necesidad antes de introducir datos en un entrenamiento.

Diseñar el RAG →

Datos y cumplimiento

Documenta procedencia, minimización, retirada, acceso y riesgo de memorización.

Aplicar controles →

Escala de hardware

Compara VRAM rápida, memoria coherente y una estación compartida con la configuración real.

Analizar DGX Station →

Entrena solo después de demostrar el límite del modelo base

Una muestra limpia, una línea base y un banco de evaluación evitan invertir hardware en corregir un problema de prompt, datos o RAG.

Consultar compra y disponibilidad
Del tutorial a la compra

Mide esta carga y elige el equipo con datos

Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.

  1. 01

    Define la carga

    Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.

    Aclarar el caso de uso →
  2. 02

    Dimensiona memoria

    Compara VRAM, memoria coherente, velocidad y margen de crecimiento.

    Usar el recomendador de hardware →
  3. 03

    Compra en la tienda

    Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.

    Contacto y disponibilidad →
Si la carga cabe en VRAM

RTX PRO 6000 · 96 GB

Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.

Ver ficha profesional →
Si todavía no tienes medidas

Recomendador de hardware

Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.

Comparar opciones →

aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.

Preguntas frecuentes

Respuestas directas

¿Qué diferencia hay entre LoRA y RAG?

LoRA adapta el comportamiento del modelo mediante entrenamiento. RAG recupera documentos en el momento de la consulta. Para conocimiento actualizable y citas, RAG suele ser la primera opción.

¿QLoRA significa que el adaptador también está cuantizado?

QLoRA carga el modelo base cuantizado para reducir memoria y entrena adaptadores con una precisión adecuada. El detalle depende de la implementación y debe registrarse.

¿Cuántos ejemplos necesito?

No existe una cifra universal. Un conjunto pequeño y coherente puede superar a uno grande con errores. Empieza con ejemplos representativos, mide y amplía donde la evaluación muestre carencias.

¿Puedo entrenar con correos y documentos internos?

Solo tras revisar finalidad, permisos, minimización, licencia, confidencialidad y riesgo de memorización. RAG puede ser más adecuado si el conocimiento cambia o debe citarse.

¿Una GPU que ejecuta el modelo puede entrenarlo?

No necesariamente con la misma configuración. El entrenamiento añade activaciones, gradientes y optimizador. LoRA y QLoRA reducen memoria, pero debes medir longitud, batch y módulos.

¿DGX Spark es más rápido que una RTX PRO para LoRA?

No por definición. Una GPU discreta suele ser más rápida cuando el entrenamiento cabe en VRAM. Spark aporta capacidad coherente cuando la memoria se convierte en el límite.