Ver equipos

AI Supercomputers es el portal de IA local del Grupo Ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Guía de selección · Ollama

Modelos de IA local: cómo elegir familia, tamaño y cuantización

La mejor elección no es el modelo más grande, sino el que resuelve tu tarea con calidad suficiente, licencia adecuada, contexto útil y una velocidad compatible con tus usuarios. Esta guía evita rankings efímeros y organiza la decisión por familias y memoria.

Familias, no una lista cerradaMemoria total, no solo pesosPruebas con documentos propios
Ruta de montaje

Qué necesitas antes y cómo sabrás que has terminado

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

Cinco o más ejemplos reales de entrada y la salida que considerarías correcta.

Resultado verificable

Crear una lista corta de familias y variantes que puedas comparar con las mismas pruebas.

Hardware relacionado

Convierte el tamaño del modelo en una decisión de hardware

Compara una GPU rápida con 128 GB coherentes utilizando el mismo modelo, contexto y runtime.

Panorama de familias

Qué aporta cada familia

FamiliaCuándo evaluarlaQué debes comprobar
QwenUso general, código, razonamiento, herramientas y escenarios multilingüesTamaño, variante, contexto, licencia y calidad en castellano para tu dominio
LlamaEcosistema amplio, integraciones, ejemplos y despliegues generalesLicencia de la variante, cuantización y comportamiento con herramientas
GemmaModelos eficientes, tareas generales y equipos con memoria limitadaVersión de la familia, formato y equilibrio entre tamaño y precisión
DeepSeek-R1Razonamiento y problemas que se benefician de más deliberaciónLongitud de salida, latencia, memoria y necesidad de validación
gpt-ossRazonamiento, herramientas y variantes de gran capacidadFormato, motor optimizado, memoria y diferencias entre tamaños
MistralUso general, despliegues compactos y familias con distintos perfilesLicencia, idioma, contexto y soporte de la variante concreta

La biblioteca cambia con frecuencia. Por eso el texto mantiene las familias y remite a ollama.com/library para etiquetas, tamaños y variantes actuales. No descargues una etiqueta solo por su nombre: abre su ficha y revisa memoria, cuantización, contexto y licencia.

Dimensionamiento

Del número de parámetros a la memoria real

En palabras sencillas

Regla de bolsillo: cada 1.000 millones de parámetros (1B) ocupa alrededor de 0,6 GB en el formato habitual. Un 8B ronda los 5-6 GB (portátil normal); un 32B, unos 20 GB (gráfica grande); un 120B, unos 70 GB (equipo de 96-128 GB). Y la cuantización Q4 es como la calidad "alta" de una foto: la mitad de espacio con una diferencia casi imperceptible.

Una aproximación de los pesos es:

memoria de pesos ≈ parámetros × bits por peso ÷ 8

El resultado no incluye escalas de cuantización, metadatos, caché KV, buffers del motor, contexto, adaptadores, embeddings ni memoria del sistema. Para una compra, utiliza la variante real y añade margen.

Escala orientativaPesos cuantizados aproximadosPlataforma habitual
Modelos compactosEn torno a 3–8 GB, según tamaño y formatoEquipo existente, portátil reciente o GPU modesta
Modelos mediosEn torno a 8–24 GBGPU con margen o memoria unificada
Modelos grandesEn torno a 40–90 GBGPU profesional, Spark o memoria unificada amplia
Modelos muy grandes o MoEPor encima de 100 GB en muchas variantesDGX Spark, pareja de Spark o DGX Station, según formato

Estas bandas son orientativas. Un modelo con menos pesos activos puede seguir necesitando almacenar muchos expertos, y una ventana de contexto amplia puede añadir una cantidad considerable de caché.

Selección por tarea

Empieza con una prueba mínima y comparable

Chat y redacción

Calidad, tono y seguimiento

Evalúa instrucciones, castellano, consistencia, resumen y capacidad para reconocer incertidumbre.

Código

Repositorio y herramientas

Mide edición sobre archivos reales, pruebas, contexto del proyecto y uso seguro de herramientas.

RAG

Respuesta apoyada en fuentes

Separa recuperación, relevancia de fragmentos, fidelidad y capacidad de abstenerse cuando falta evidencia.

Razonamiento

Exactitud y coste de latencia

Un razonamiento más largo no garantiza una respuesta correcta. Añade verificadores y criterios objetivos.

Visión

Imágenes y documentos

Comprueba formatos, resolución, OCR cuando corresponda y calidad con tus propios documentos.

Agentes

Herramientas y esquema

La fiabilidad al devolver JSON o llamadas estructuradas puede importar más que una conversación general.

Evaluación

Una batería pequeña vale más que una clasificación genérica

  1. Reúne entre veinte y cincuenta tareas representativas. Incluye casos normales, difíciles, ambiguos y entradas que deberían rechazarse.
  2. Fija los parámetros. Misma temperatura, contexto, prompt de sistema, formato y hardware.
  3. Mide calidad por criterio. Exactitud, cobertura, citas, formato, seguridad y tasa de abstención.
  4. Mide las dos fases. Tiempo hasta el primer token, prefill, generación y latencia total.
  5. Incluye memoria y concurrencia. Observa el modelo con una sesión y con el número real de usuarios.
  6. Revisa la licencia. Registra familia, variante, hash, fuente y condiciones aplicables.

Para RAG, evalúa por separado el recuperador y el generador. Un modelo competente no puede citar un documento que el sistema no recupera. La arquitectura se explica en IA con los datos de tu empresa.

Hardware

Cuando el modelo cabe y cuando deja de caber

Una GPU discreta ofrece gran ancho de banda y suele ser la opción más rápida si pesos, contexto y caché caben en su VRAM. DGX Spark se vuelve relevante con modelos grandes, contexto amplio o varios componentes que requieren más de la VRAM habitual. Para una escala muy superior, DGX Station combina 252 GB HBM3e con 496 GB LPDDR5X.

Evita utilizar toda la memoria anunciada para los pesos. El sistema, el motor y la caché necesitan margen. En Ollama, ollama ps ayuda a comprobar si la carga está en GPU, parcialmente en CPU o completamente en CPU.

Mapa de decisión

Separar familia, variante, formato y tarea antes de comparar modelos

«Modelo» se utiliza para varias cosas distintas. Una familia define arquitectura y entrenamiento; una variante puede cambiar tamaño o capacidades; una cuantización modifica cómo se almacenan los pesos; el formato determina qué motor puede cargarlos; y la plantilla de chat condiciona cómo se presentan las instrucciones. Registrar solo un nombre corto impide reproducir una prueba.

Modelo base. Pesos generales antes de una adaptación para conversación o instrucciones. No suele ser la mejor opción para un chat convencional.
Instruct. Variante ajustada para seguir peticiones y mantener diálogo. Sigue necesitando instrucciones claras y evaluación.
Razonamiento. Variante optimizada para descomponer problemas. Una respuesta extensa no demuestra corrección; utiliza resultados verificables.
Visión. Acepta imagen además de texto. El procesador visual, la resolución y el contexto elevan la memoria.
Embeddings. Produce vectores para búsqueda y agrupación. No debe elegirse por su calidad de conversación.
Tool calling. Capacidad de proponer llamadas estructuradas a funciones. La aplicación conserva la autoridad y valida argumentos.
GGUF. Formato habitual en motores locales basados en llama.cpp. Puede contener distintas cuantizaciones.
Etiqueta. Alias que apunta a una variante de la biblioteca. Puede cambiar; registra el identificador completo validado.

En Ollama conviene consultar la biblioteca actual antes de descargar. Verifica tamaño, capacidades, licencia, contexto anunciado y etiquetas disponibles. Después confirma la ventana que realmente utiliza tu servidor: el máximo teórico del modelo no garantiza que la aplicación lo haya configurado.

Familias a evaluar

Qué aporta cada familia y qué debes comprobar por tu cuenta

Qwen

Amplitud de tamaños y tareas

Suele ofrecer variantes para conversación, razonamiento, código, visión y embeddings. Es una candidata frecuente para castellano y contextos técnicos, pero compara la variante concreta y su licencia.

Prueba: instrucciones con varios requisitos, JSON válido, código con tests y documentos en castellano.

Llama

Ecosistema e integraciones

Dispone de un ecosistema amplio y compatibilidad en numerosos motores. La familia y la variante pueden tener condiciones distintas; no extrapoles una prueba entre tamaños o modalidades.

Prueba: seguimiento de instrucciones, consistencia multivuelta y comportamiento con herramientas.

Gemma

Modelos eficientes y multimodales

Incluye opciones adecuadas para equipos contenidos y variantes capaces de trabajar con imagen. La relación entre tamaño y calidad puede ser atractiva para asistentes internos.

Prueba: resumen fiel, clasificación, extracción y lectura de capturas representativas.

DeepSeek-R1

Razonamiento y variantes destiladas

Conviene evaluarla en problemas con respuesta verificable. Las variantes destiladas no equivalen al modelo de mayor tamaño y pueden comportarse de forma diferente.

Prueba: lógica, cálculo revisado por código y decisiones con criterios explícitos.

gpt-oss

Razonamiento, herramientas y despliegue abierto

Es relevante para cargas que necesitan razonamiento y uso de herramientas en infraestructura propia. Comprueba requisitos del motor, cuantización y contexto operativo.

Prueba: esquemas, llamadas a función, rechazo de acciones y recuperación ante errores.

Mistral

Opciones compactas y especializadas

Puede aportar buenas alternativas para baja latencia y tareas concretas. Como en el resto, «la familia» no sustituye una medición de la etiqueta exacta.

Prueba: castellano, velocidad, formato y estabilidad con el contexto esperado.

Una lista no es una recomendación permanente. Las bibliotecas cambian. Esta guía conserva el método: selecciona varias familias, fija casos propios y registra la variante aprobada.

Cálculo de capacidad

Estimar pesos, caché KV y margen de ejecución sin confundirlos

La aproximación inicial de los pesos es parámetros multiplicados por bits y divididos entre ocho. No es el consumo final: el fichero añade metadatos y el motor necesita buffers, activaciones y caché. Además, una arquitectura de mezcla de expertos puede tener muchos parámetros totales y activar solo una parte por token, pero los pesos que deben estar disponibles siguen condicionando la memoria.

memoria aproximada de pesos = parámetros × bits / 8
memoria de servicio = pesos + caché KV + buffers + margen del sistema
FactorQué aumentaConsecuencia práctica
Más parámetrosPesos y cálculo por tokenMayor capacidad potencial, menor velocidad y más memoria
Más bitsMemoria de pesosPuede preservar calidad, pero reduce el tamaño que cabe
Más contextoCaché KV y prefillPrimera respuesta más lenta y menor concurrencia
Más usuariosCachés y colas simultáneasUn modelo que cabe para uno puede saturar el servicio
VisiónTokens visuales y componentesMayor latencia y memoria según número y resolución de imágenes
HerramientasHistorial, esquemas y resultadosEl contexto crece en cada ciclo del agente

La cuantización se decide con una prueba de degradación

Empieza con una cuantización intermedia que deje margen. Ejecuta los mismos casos en una variante de más precisión y otra de menos. Mide exactitud, formato, uso de herramientas y velocidad. En tareas de extracción, código o razonamiento, una diferencia pequeña en memoria puede tener más valor que una respuesta ligeramente más rápida.

El contexto anunciado no es el contexto útil

Una ventana grande solo aporta valor si el modelo encuentra y utiliza la información adecuada. Documentos largos sin recuperación pueden diluir instrucciones, elevar el prefill y reducir la concurrencia. Para conocimiento empresarial, un RAG bien evaluado suele ser más controlable que introducir toda una biblioteca en cada consulta.

Evaluación reproducible

Crear un banco de pruebas que mida utilidad y no solo preferencia

Construye un conjunto de casos a partir del trabajo real. El evaluador debe conocer la respuesta esperada o los criterios de aceptación. Incluye casos negativos en los que el modelo deba abstenerse, solicitudes con instrucciones contradictorias y entradas que intenten alterar el sistema.

  1. Define la tarea. Resume una política, extrae campos, clasifica un correo, genera una consulta o propone una función. No mezcles objetivos en una puntuación opaca.
  2. Fija el contrato de salida. Texto breve, tabla, JSON con esquema o llamada a herramienta. Valida el formato mediante código.
  3. Prepara la referencia. Respuesta correcta, fuentes aceptables, campos obligatorios y errores críticos.
  4. Ejecuta varias veces. La variabilidad forma parte del comportamiento. Registra temperatura y semilla cuando estén disponibles.
  5. Mide operación. Tiempo hasta el primer token, velocidad de generación, memoria, longitud de salida y errores.
  6. Clasifica fallos. Dato inventado, omisión, formato, razonamiento, cita, seguridad, herramienta o idioma.
  7. Selecciona el menor que cumple. Conserva margen de memoria y una variante de respaldo.
PruebaMétrica principalFallo crítico
ResumenCobertura y fidelidadAñadir una decisión que no aparece en la fuente
ExtracciónExactitud por campoInventar un valor obligatorio
RAGRecuperación, cita y abstenciónResponder sin evidencia autorizada
CódigoTests superados y seguridadProponer un cambio que rompe datos o permisos
HerramientasLlamada y argumentos correctosEjecutar una acción no solicitada
VisiónCampos y relaciones visualesConfundir una cifra o elemento decisivo
Uso responsable

Licencia, procedencia y seguridad también forman parte del modelo

Antes de aprobar una variante, conserva su procedencia, licencia, hash o identificador, términos aplicables, finalidad y limitaciones. «Disponible para descargar» no significa que todos los usos, redistribuciones o modificaciones estén autorizados. Revisa también el código que carga los pesos y evita formatos ejecutables de origen desconocido.

Un modelo no es una frontera de autorización. Aunque siga instrucciones con fiabilidad, no debe decidir por sí solo qué documentos puede leer ni qué acciones puede ejecutar.

Del modelo al equipo

Traducir la variante aprobada a una configuración de hardware

Cabe con margen

GPU discreta

Es la opción prioritaria cuando pesos, caché y lote caben en VRAM. El ancho de banda suele aportar la mejor generación interactiva.

La VRAM se queda corta

DGX Spark

Los 128 GB unificados permiten trabajar con modelos y contextos que ya no entran en una GPU convencional. Debe medirse la velocidad de la carga real.

Escala superior

RTX PRO o DGX Station

RTX PRO aporta gran VRAM y velocidad; DGX Station amplía de forma sustancial la memoria coherente para modelos y usuarios más exigentes.

Entrega al dimensionador: familia, etiqueta exacta, cuantización, contexto, tokens de entrada y salida, usuarios simultáneos, tiempo objetivo, visión, herramientas, RAG y número de modelos residentes. Sin esos datos, cualquier recomendación es una aproximación.

Siguiente paso

Prueba la carga y después compra

El recomendador organiza la primera decisión; una prueba controlada confirma memoria, velocidad y concurrencia.

Abrir el recomendador

Elige con tus datos y tus límites

Instala dos o tres familias, ejecuta la misma batería y conserva el modelo menor que cumpla los requisitos. Escala memoria cuando la calidad o el contexto lo justifiquen.

Instalar Ollama
Del tutorial a la compra

Mide esta carga y elige el equipo con datos

Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.

  1. 01

    Define la carga

    Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.

    Aclarar el caso de uso →
  2. 02

    Dimensiona memoria

    Compara VRAM, memoria coherente, velocidad y margen de crecimiento.

    Usar el recomendador de hardware →
  3. 03

    Compra en la tienda

    Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.

    Contacto y disponibilidad →
Si la carga cabe en VRAM

RTX PRO 6000 · 96 GB

Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.

Ver ficha profesional →
Si todavía no tienes medidas

Recomendador de hardware

Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.

Comparar opciones →

aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.

Las reglas de conexión · ¿2, 4, 50, 500 unidades?
Preguntas frecuentes

Respuestas directas

¿Cuál es el mejor modelo para Ollama?

No existe uno universal. La elección depende de tarea, idioma, licencia, memoria, contexto, velocidad y herramientas. Compara familias con un conjunto de pruebas propio.

¿Cuánta memoria ocupa un modelo cuantizado?

Como estimación inicial, los pesos ocupan parámetros multiplicados por bits y divididos entre ocho, más metadatos, caché y memoria del motor. La cifra real debe comprobarse en la variante concreta.

¿Más parámetros siempre significan mejor resultado?

No. Datos, arquitectura, ajuste, razonamiento, herramientas y tarea pueden hacer que un modelo menor sea preferible. Además, un modelo demasiado grande puede reducir la velocidad y la concurrencia.

¿Qué familias conviene evaluar?

Qwen, Llama, Gemma, DeepSeek-R1, gpt-oss y Mistral cubren necesidades distintas. Consulta ollama.com/library para ver etiquetas, tamaños y requisitos vigentes.

¿Puedo usar cualquier modelo en una empresa?

No debe asumirse. Revisa la licencia de cada modelo y de sus pesos, las condiciones de uso, la procedencia y las obligaciones aplicables a tu caso.

¿Cómo compruebo si el modelo usa la GPU?

Ejecuta el modelo y consulta ollama ps. La salida muestra el procesador utilizado y ayuda a detectar descarga parcial a CPU, que puede reducir el rendimiento.