AI Supercomputers es el portal de IA local del grupo ietres.La compra se realiza en nuestras tiendas oficiales. Si una referencia no aparece con stock, consulta la posibilidad de reserva y la siguiente entrada prevista.

Guía de selección · Ollama

Qué modelo de IA usar para cada tarea

No elijas por popularidad ni por número de parámetros. Primero identifica la tarea: conversar, razonar, programar, analizar imágenes, buscar documentos, transcribir voz o generar audio.

Familias, no una lista cerradaMemoria total, no solo pesosPruebas con documentos propios
Ruta para pymes

El mejor modelo para una pyme es el más pequeño que supera su prueba

No empieces por el modelo con más parámetros. Compara dos o tres familias con ejemplos reales, en castellano y con el formato de salida que necesitas. Conserva el que cumple con menor coste de memoria y espera.

Empieza por esto

Una tarea, ejemplos reales y dos o tres modelos de distinto tamaño.

Compra cuando

Hardware cuando ya sepas qué modelo funciona y cuánto contexto necesita.

Deja para después

Mezclas de expertos, servicio para varios usuarios avanzado y adaptación específica.

La explicación avanzada continúa debajo. Puedes consultarla cuando el uso, los datos o el número de personas lo justifiquen.

Ruta de montaje

Lo que conviene tener a mano (y cómo sabrás que vas bien)

Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.

Antes de empezar

Cinco o más ejemplos reales de entrada y la salida que considerarías correcta.

Resultado verificable

Crear una lista corta de familias y variantes que puedas comparar con las mismas pruebas.

Hardware relacionado

Convierte el tamaño del modelo en una decisión de hardware

Compara una GPU rápida con 128 GB coherentes utilizando el mismo modelo, contexto y programa que ejecuta el modelo.

Mapa rápido

Qué modelo usar según lo que quieres hacer

TareaModelo o familiaPara qué sirve
Chat, redacción y resumenQwen, Llama o GemmaAsistentes generales, clasificación, correos, resúmenes y respuestas en castellano.
Razonamiento y problemas complejosDeepSeek-R1 o gpt-ossAnálisis con varios pasos, matemáticas, lógica y código; exige validar el resultado.
ProgramaciónQwen CoderExplicar código, completar funciones, proponer pruebas y preparar cambios revisables.
Texto e imágenesGemma 3 multimodalDescribir o consultar imágenes junto con texto; no sustituye un modelo especializado de visión industrial.
Buscar en documentosnomic-embed-text u otro embedding + LLMEl embedding recupera fragmentos; el LLM redacta la respuesta con esas fuentes.
Pasar voz a textoWhisperTranscripción multilingüe, identificación de idioma y preparación de actas o peticiones.
Pasar texto a vozPiperGenerar audio local para respuestas habladas; revisa la licencia de cada voz.
Familias prácticas

Qué es cada familia y por dónde empezar

Qwen

Qué es: familia general con variantes pequeñas, grandes y modos de razonamiento.

Úsala para: chat, redacción, castellano, herramientas, clasificación y código.

Empieza por: una variante pequeña o intermedia y sube solo si falla tu prueba.

Llama

Qué es: familia general orientada a diálogo y generación de texto.

Úsala para: asistentes, resumen, redacción y RAG.

Ten en cuenta: Llama 3.3 en Ollama es una variante 70B; no es el primer modelo para un equipo modesto.

Gemma 3

Qué es: familia compacta de Google con variantes de texto y multimodales.

Úsala para: chat, resumen, razonamiento moderado y consultas con imágenes.

Empieza por: 4B o 12B para comparar calidad y memoria.

DeepSeek-R1

Qué es: familia de razonamiento con variantes destiladas y un modelo completo muy grande.

Úsala para: lógica, matemáticas, análisis y programación.

Empieza por: 8B, 14B o 32B; no dimensionar para 671B sin una necesidad demostrada.

gpt-oss

Qué es: modelos abiertos orientados a razonamiento y uso de herramientas.

Úsala para: agentes controlados, análisis y tareas que requieren seguir un proceso.

Empieza por: 20B; la variante 120B exige mucha más memoria.

Qwen Coder

Qué es: familia especializada en código.

Úsala para: completar, explicar, corregir y generar pruebas.

No la uses sola para: ejecutar cambios sin revisión o acceder a secretos.

Embeddings

Qué son: modelos que convierten texto en vectores comparables.

Úsalos para: localizar documentos relevantes en un sistema RAG.

No hacen: conversar ni redactar la respuesta final.

Whisper y Piper

Qué son: Whisper convierte audio en texto; Piper convierte texto en audio.

Úsalos para: actas, llamadas, citas y asistentes hablados.

Necesitan: un LLM y conectores de agenda o mensajería si quieres ejecutar acciones.

Panorama de familias

Qué aporta cada familia

FamiliaCuándo evaluarlaQué debes comprobar
QwenUso general, código, razonamiento, herramientas y escenarios multilingüesTamaño, variante, contexto, licencia y calidad en castellano para tu dominio
LlamaEcosistema amplio, integraciones, ejemplos y despliegues generalesLicencia de la variante, cuantización y comportamiento con herramientas
GemmaModelos eficientes, tareas generales y equipos con memoria limitadaVersión de la familia, formato y equilibrio entre tamaño y precisión
DeepSeek-R1Razonamiento y problemas que se benefician de más deliberaciónLongitud de salida, latencia, memoria y necesidad de validación
gpt-ossRazonamiento, herramientas y variantes de gran capacidadFormato, motor optimizado, memoria y diferencias entre tamaños
MistralUso general, despliegues compactos y familias con distintos perfilesLicencia, idioma, contexto y soporte de la variante concreta

La biblioteca cambia con frecuencia. Por eso el texto mantiene las familias y remite a ollama.com/library para etiquetas, tamaños y variantes actuales. No descargues una etiqueta solo por su nombre: abre su ficha y revisa memoria, cuantización, contexto y licencia.

Dimensionamiento

Del número de parámetros a la memoria real

En palabras sencillas

Regla de bolsillo: cada 1.000 millones de parámetros (1B) ocupa alrededor de 0,6 GB en el formato habitual. Un 8B ronda los 5-6 GB (portátil normal); un 32B, unos 20 GB (gráfica grande); un 120B, unos 70 GB (equipo de 96-128 GB). Y la cuantización Q4 es como la calidad "alta" de una foto: la mitad de espacio con una diferencia casi imperceptible.

Una aproximación de los pesos es:

memoria de pesos ≈ parámetros × bits por peso ÷ 8

El resultado no incluye escalas de cuantización, metadatos, caché KV, buffers del motor, contexto, adaptadores, embeddings ni memoria del sistema. Para una compra, utiliza la variante real y añade margen.

Escala orientativaPesos cuantizados aproximadosPlataforma habitual
Modelos compactosEn torno a 3–8 GB, según tamaño y formatoEquipo existente, portátil reciente o GPU modesta
Modelos mediosEn torno a 8–24 GBGPU con margen o memoria unificada
Modelos grandesEn torno a 40–90 GBGPU profesional, Spark o memoria unificada amplia
Modelos muy grandes o MoEPor encima de 100 GB en muchas variantesDGX Spark, pareja de Spark o DGX Station, según formato

Estas bandas son orientativas. Un modelo con menos pesos activos puede seguir necesitando almacenar muchos expertos, y una ventana de contexto amplia puede añadir una cantidad considerable de caché.

Selección por tarea

Empieza con una prueba mínima y comparable

Chat y redacción

Calidad, tono y seguimiento

Evalúa instrucciones, castellano, consistencia, resumen y capacidad para reconocer incertidumbre.

Código

Repositorio y herramientas

Mide edición sobre archivos reales, pruebas, contexto del proyecto y uso seguro de herramientas.

RAG

Respuesta apoyada en fuentes

Separa recuperación, relevancia de fragmentos, fidelidad y capacidad de abstenerse cuando falta evidencia.

Razonamiento

Exactitud y coste de latencia

Un razonamiento más largo no garantiza una respuesta correcta. Añade verificadores y criterios objetivos.

Visión

Imágenes y documentos

Comprueba formatos, resolución, OCR cuando corresponda y calidad con tus propios documentos.

Agentes

Herramientas y esquema

La fiabilidad al devolver JSON o llamadas estructuradas puede importar más que una conversación general.

Evaluación

Una batería pequeña vale más que una clasificación genérica

  1. Reúne entre veinte y cincuenta tareas representativas. Incluye casos normales, difíciles, ambiguos y entradas que deberían rechazarse.
  2. Fija los parámetros. Misma temperatura, contexto, prompt de sistema, formato y hardware.
  3. Mide calidad por criterio. Exactitud, cobertura, citas, formato, seguridad y tasa de abstención.
  4. Mide las dos fases. Tiempo hasta el primer token, prefill, generación y latencia total.
  5. Incluye memoria y concurrencia. Observa el modelo con una sesión y con el número real de usuarios.
  6. Revisa la licencia. Registra familia, variante, hash, fuente y condiciones aplicables.

Para RAG, evalúa por separado el recuperador y el generador. Un modelo competente no puede citar un documento que el sistema no recupera. La arquitectura se explica en IA con los datos de tu empresa.

Hardware

Cuando el modelo cabe y cuando deja de caber

Una GPU discreta ofrece gran ancho de banda y suele ser la opción más rápida si pesos, contexto y caché caben en su VRAM. DGX Spark se vuelve relevante con modelos grandes, contexto amplio o varios componentes que requieren más de la VRAM habitual. Para una escala muy superior, DGX Station combina 252 GB HBM3e con 496 GB LPDDR5X.

Evita utilizar toda la memoria anunciada para los pesos. El sistema, el motor y la caché necesitan margen. En Ollama, ollama ps ayuda a comprobar si la carga está en GPU, parcialmente en CPU o completamente en CPU.

Información avanzada: formatos, memoria, evaluación, licencias y despliegue
Mapa de decisión

Separar familia, variante, formato y tarea antes de comparar modelos

«Modelo» se utiliza para varias cosas distintas. Una familia define arquitectura y entrenamiento; una variante puede cambiar tamaño o capacidades; una cuantización modifica cómo se almacenan los pesos; el formato determina qué motor puede cargarlos; y la plantilla de chat condiciona cómo se presentan las instrucciones. Registrar solo un nombre corto impide reproducir una prueba.

Modelo base. Pesos generales antes de una adaptación para conversación o instrucciones. No suele ser la mejor opción para un chat convencional.
Instruct. Variante ajustada para seguir peticiones y mantener diálogo. Sigue necesitando instrucciones claras y evaluación.
Razonamiento. Variante optimizada para descomponer problemas. Una respuesta extensa no demuestra corrección; utiliza resultados verificables.
Visión. Acepta imagen además de texto. El procesador visual, la resolución y el contexto elevan la memoria.
Embeddings. Produce vectores para búsqueda y agrupación. No debe elegirse por su calidad de conversación.
Tool calling. Capacidad de proponer llamadas estructuradas a funciones. La aplicación conserva la autoridad y valida argumentos.
GGUF. Formato habitual en motores locales basados en llama.cpp. Puede contener distintas cuantizaciones.
Etiqueta. Alias que apunta a una variante de la biblioteca. Puede cambiar; registra el identificador completo validado.

En Ollama conviene consultar la biblioteca actual antes de descargar. Verifica tamaño, capacidades, licencia, contexto anunciado y etiquetas disponibles. Después confirma la ventana que realmente utiliza tu servidor: el máximo teórico del modelo no garantiza que la aplicación lo haya configurado.

Familias a evaluar

Qué aporta cada familia y qué debes comprobar por tu cuenta

Qwen

Amplitud de tamaños y tareas

Suele ofrecer variantes para conversación, razonamiento, código, visión y embeddings. Es una candidata frecuente para castellano y contextos técnicos, pero compara la variante concreta y su licencia.

Prueba: instrucciones con varios requisitos, JSON válido, código con tests y documentos en castellano.

Llama

Ecosistema e integraciones

Dispone de un ecosistema amplio y compatibilidad en numerosos motores. La familia y la variante pueden tener condiciones distintas; no extrapoles una prueba entre tamaños o modalidades.

Prueba: seguimiento de instrucciones, consistencia multivuelta y comportamiento con herramientas.

Gemma

Modelos eficientes y multimodales

Incluye opciones adecuadas para equipos contenidos y variantes capaces de trabajar con imagen. La relación entre tamaño y calidad puede ser atractiva para asistentes internos.

Prueba: resumen fiel, clasificación, extracción y lectura de capturas representativas.

DeepSeek-R1

Razonamiento y variantes destiladas

Conviene evaluarla en problemas con respuesta verificable. Las variantes destiladas no equivalen al modelo de mayor tamaño y pueden comportarse de forma diferente.

Prueba: lógica, cálculo revisado por código y decisiones con criterios explícitos.

gpt-oss

Razonamiento, herramientas y despliegue abierto

Es relevante para cargas que necesitan razonamiento y uso de herramientas en infraestructura propia. Comprueba requisitos del motor, cuantización y contexto operativo.

Prueba: esquemas, llamadas a función, rechazo de acciones y recuperación ante errores.

Mistral

Opciones compactas y especializadas

Puede aportar buenas alternativas para baja latencia y tareas concretas. Como en el resto, «la familia» no sustituye una medición de la etiqueta exacta.

Prueba: castellano, velocidad, formato y estabilidad con el contexto esperado.

Una lista no es una recomendación permanente. Las bibliotecas cambian. Esta guía conserva el método: selecciona varias familias, fija casos propios y registra la variante aprobada.

Cálculo de capacidad

Estimar pesos, caché KV y margen de ejecución sin confundirlos

La aproximación inicial de los pesos es parámetros multiplicados por bits y divididos entre ocho. No es el consumo final: el fichero añade metadatos y el motor necesita buffers, activaciones y caché. Además, una arquitectura de mezcla de expertos puede tener muchos parámetros totales y activar solo una parte por token, pero los pesos que deben estar disponibles siguen condicionando la memoria.

memoria aproximada de pesos = parámetros × bits / 8
memoria de servicio = pesos + caché KV + buffers + margen del sistema
FactorQué aumentaConsecuencia práctica
Más parámetrosPesos y cálculo por tokenMayor capacidad potencial, menor velocidad y más memoria
Más bitsMemoria de pesosPuede preservar calidad, pero reduce el tamaño que cabe
Más contextoCaché KV y prefillPrimera respuesta más lenta y menor concurrencia
Más usuariosCachés y colas simultáneasUn modelo que cabe para uno puede saturar el servicio
VisiónTokens visuales y componentesMayor latencia y memoria según número y resolución de imágenes
HerramientasHistorial, esquemas y resultadosEl contexto crece en cada ciclo del agente

La cuantización se decide con una prueba de degradación

Empieza con una cuantización intermedia que deje margen. Ejecuta los mismos casos en una variante de más precisión y otra de menos. Mide exactitud, formato, uso de herramientas y velocidad. En tareas de extracción, código o razonamiento, una diferencia pequeña en memoria puede tener más valor que una respuesta ligeramente más rápida.

El contexto anunciado no es el contexto útil

Una ventana grande solo aporta valor si el modelo encuentra y utiliza la información adecuada. Documentos largos sin recuperación pueden diluir instrucciones, elevar el prefill y reducir la concurrencia. Para conocimiento empresarial, un RAG bien evaluado suele ser más controlable que introducir toda una biblioteca en cada consulta.

Evaluación reproducible

Crear un banco de pruebas que mida utilidad y no solo preferencia

Construye un conjunto de casos a partir del trabajo real. El evaluador debe conocer la respuesta esperada o los criterios de aceptación. Incluye casos negativos en los que el modelo deba abstenerse, solicitudes con instrucciones contradictorias y entradas que intenten alterar el sistema.

  1. Define la tarea. Resume una política, extrae campos, clasifica un correo, genera una consulta o propone una función. No mezcles objetivos en una puntuación opaca.
  2. Fija el contrato de salida. Texto breve, tabla, JSON con esquema o llamada a herramienta. Valida el formato mediante código.
  3. Prepara la referencia. Respuesta correcta, fuentes aceptables, campos obligatorios y errores críticos.
  4. Ejecuta varias veces. La variabilidad forma parte del comportamiento. Registra temperatura y semilla cuando estén disponibles.
  5. Mide operación. Tiempo hasta el primer token, velocidad de generación, memoria, longitud de salida y errores.
  6. Clasifica fallos. Dato inventado, omisión, formato, razonamiento, cita, seguridad, herramienta o idioma.
  7. Selecciona el menor que cumple. Conserva margen de memoria y una variante de respaldo.
PruebaMétrica principalFallo crítico
ResumenCobertura y fidelidadAñadir una decisión que no aparece en la fuente
ExtracciónExactitud por campoInventar un valor obligatorio
RAGRecuperación, cita y abstenciónResponder sin evidencia autorizada
CódigoTests superados y seguridadProponer un cambio que rompe datos o permisos
HerramientasLlamada y argumentos correctosEjecutar una acción no solicitada
VisiónCampos y relaciones visualesConfundir una cifra o elemento decisivo
Uso responsable

Licencia, procedencia y seguridad también forman parte del modelo

Antes de aprobar una variante, conserva su procedencia, licencia, hash o identificador, términos aplicables, finalidad y limitaciones. «Disponible para descargar» no significa que todos los usos, redistribuciones o modificaciones estén autorizados. Revisa también el código que carga los pesos y evita formatos ejecutables de origen desconocido.

  • Fuente oficial o repositorio reconocido y versión identificable
  • Licencia revisada para uso comercial, adaptación y redistribución
  • Plantilla de chat compatible con el motor
  • Filtros y límites definidos fuera del modelo
  • Casos adversarios y de abstención incluidos en evaluación
  • Plan de retirada cuando una variante deja de estar aprobada

Un modelo no es una frontera de autorización. Aunque siga instrucciones con fiabilidad, no debe decidir por sí solo qué documentos puede leer ni qué acciones puede ejecutar.

Del modelo al equipo

Traducir la variante aprobada a una configuración de hardware

Cabe con margen

GPU discreta

Es la opción prioritaria cuando pesos, caché y lote caben en VRAM. El ancho de banda suele aportar la mejor generación interactiva.

La VRAM se queda corta

DGX Spark

Los 128 GB unificados permiten trabajar con modelos y contextos que ya no entran en una GPU convencional. Debe medirse la velocidad de la carga real.

Escala superior

RTX PRO o DGX Station

RTX PRO aporta gran VRAM y velocidad; DGX Station amplía de forma sustancial la memoria coherente para modelos y usuarios más exigentes.

Entrega al dimensionador: familia, etiqueta exacta, cuantización, contexto, tokens de entrada y salida, usuarios simultáneos, tiempo objetivo, visión, herramientas, RAG y número de modelos residentes. Sin esos datos, cualquier recomendación es una aproximación.

Siguiente paso

Prueba la carga y después compra

El recomendador organiza la primera decisión; una prueba controlada confirma memoria, velocidad y concurrencia.

Abrir el recomendador

Elige con tus datos y tus límites

Instala dos o tres familias, ejecuta la misma batería y conserva el modelo menor que cumpla los requisitos. Escala memoria cuando la calidad o el contexto lo justifiquen.

Instalar Ollama
Antes de comprar

Mide el modelo, el contexto y los usuarios reales

El nombre del modelo no basta. Anota la variante exacta, contexto, sesiones simultáneas, memoria máxima y tiempo de respuesta.

  • Empieza por el modelo más pequeño que supere la prueba.
  • Compra cuando el límite medido sea memoria, velocidad o concurrencia.
Las reglas de conexión · ¿1, 2, 3 o 4 nodos?
Fuentes técnicas y criterio editorial

Las especificaciones, funciones y límites descritos se contrastan con documentación primaria de Ollama y modelos. Las recomendaciones de compra, el orden de los pasos y los márgenes de planificación son criterios editoriales de AI Supercomputers: deben confirmarse con la versión instalada y una prueba real.

Documentación oficial de Ollama · Biblioteca oficial de modelos · Contexto y comprobación de offload

Qwen3 en Ollama · Gemma 3 en Ollama · Llama 3.3 en Ollama · DeepSeek-R1 en Ollama · gpt-oss en Ollama · Qwen Coder en Ollama · nomic-embed-text

Whisper oficial · Piper oficial

Preguntas frecuentes

Respuestas directas

¿Cuál es el mejor modelo para Ollama?

No existe uno universal. La elección depende de tarea, idioma, licencia, memoria, contexto, velocidad y herramientas. Compara familias con un conjunto de pruebas propio.

¿Cuánta memoria ocupa un modelo cuantizado?

Como estimación inicial, los pesos ocupan parámetros multiplicados por bits y divididos entre ocho, más metadatos, caché y memoria del motor. La cifra real debe comprobarse en la variante concreta.

¿Más parámetros siempre significan mejor resultado?

No. Datos, arquitectura, ajuste, razonamiento, herramientas y tarea pueden hacer que un modelo menor sea preferible. Además, un modelo demasiado grande puede reducir la velocidad y la concurrencia.

¿Qué familias conviene evaluar?

Qwen, Llama, Gemma, DeepSeek-R1, gpt-oss y Mistral cubren necesidades distintas. Consulta ollama.com/library para ver etiquetas, tamaños y requisitos vigentes.

¿Puedo usar cualquier modelo en una empresa?

No debe asumirse. Revisa la licencia de cada modelo y de sus pesos, las condiciones de uso, la procedencia y las obligaciones aplicables a tu caso.

¿Cómo compruebo si el modelo usa la GPU?

Ejecuta el modelo y consulta ollama ps. La salida muestra el procesador utilizado y ayuda a detectar descarga parcial a CPU, que puede reducir el rendimiento.