Cinco o más ejemplos reales de entrada y la salida que considerarías correcta.
Modelos de IA local: cómo elegir familia, tamaño y cuantización
La mejor elección no es el modelo más grande, sino el que resuelve tu tarea con calidad suficiente, licencia adecuada, contexto útil y una velocidad compatible con tus usuarios. Esta guía evita rankings efímeros y organiza la decisión por familias y memoria.
Qué necesitas antes y cómo sabrás que has terminado
Ejecuta la guía sobre un entorno de prueba. No avances a producción hasta obtener la salida verificable y documentar la reversión.
Crear una lista corta de familias y variantes que puedas comparar con las mismas pruebas.
Continúa con la etapa relacionada y conserva comandos, versiones, métricas y responsables.
Abrir el siguiente paso →Convierte el tamaño del modelo en una decisión de hardware
Compara una GPU rápida con 128 GB coherentes utilizando el mismo modelo, contexto y runtime.
NVIDIA DGX Spark
Referencia NVIDIA con 128 GB coherentes para modelos y contextos que exceden la VRAM habitual.
Compra enTienda Ietres
ASUS Ascent GX10
La misma clase de capacidad GB10 con tres escalones de almacenamiento y chasis ASUS.
Lenovo ThinkStation PGX
Plataforma GB10 de Lenovo con varias referencias; el almacenamiento es la diferencia principal verificada.
RTX PRO 6000 Blackwell
Prioriza velocidad y concurrencia cuando la carga completa cabe en la VRAM disponible.
Compra enIetres Informática
Qué aporta cada familia
| Familia | Cuándo evaluarla | Qué debes comprobar |
|---|---|---|
| Qwen | Uso general, código, razonamiento, herramientas y escenarios multilingües | Tamaño, variante, contexto, licencia y calidad en castellano para tu dominio |
| Llama | Ecosistema amplio, integraciones, ejemplos y despliegues generales | Licencia de la variante, cuantización y comportamiento con herramientas |
| Gemma | Modelos eficientes, tareas generales y equipos con memoria limitada | Versión de la familia, formato y equilibrio entre tamaño y precisión |
| DeepSeek-R1 | Razonamiento y problemas que se benefician de más deliberación | Longitud de salida, latencia, memoria y necesidad de validación |
| gpt-oss | Razonamiento, herramientas y variantes de gran capacidad | Formato, motor optimizado, memoria y diferencias entre tamaños |
| Mistral | Uso general, despliegues compactos y familias con distintos perfiles | Licencia, idioma, contexto y soporte de la variante concreta |
La biblioteca cambia con frecuencia. Por eso el texto mantiene las familias y remite a ollama.com/library para etiquetas, tamaños y variantes actuales. No descargues una etiqueta solo por su nombre: abre su ficha y revisa memoria, cuantización, contexto y licencia.
Del número de parámetros a la memoria real
Regla de bolsillo: cada 1.000 millones de parámetros (1B) ocupa alrededor de 0,6 GB en el formato habitual. Un 8B ronda los 5-6 GB (portátil normal); un 32B, unos 20 GB (gráfica grande); un 120B, unos 70 GB (equipo de 96-128 GB). Y la cuantización Q4 es como la calidad "alta" de una foto: la mitad de espacio con una diferencia casi imperceptible.
Una aproximación de los pesos es:
memoria de pesos ≈ parámetros × bits por peso ÷ 8
El resultado no incluye escalas de cuantización, metadatos, caché KV, buffers del motor, contexto, adaptadores, embeddings ni memoria del sistema. Para una compra, utiliza la variante real y añade margen.
| Escala orientativa | Pesos cuantizados aproximados | Plataforma habitual |
|---|---|---|
| Modelos compactos | En torno a 3–8 GB, según tamaño y formato | Equipo existente, portátil reciente o GPU modesta |
| Modelos medios | En torno a 8–24 GB | GPU con margen o memoria unificada |
| Modelos grandes | En torno a 40–90 GB | GPU profesional, Spark o memoria unificada amplia |
| Modelos muy grandes o MoE | Por encima de 100 GB en muchas variantes | DGX Spark, pareja de Spark o DGX Station, según formato |
Estas bandas son orientativas. Un modelo con menos pesos activos puede seguir necesitando almacenar muchos expertos, y una ventana de contexto amplia puede añadir una cantidad considerable de caché.
Empieza con una prueba mínima y comparable
Calidad, tono y seguimiento
Evalúa instrucciones, castellano, consistencia, resumen y capacidad para reconocer incertidumbre.
Repositorio y herramientas
Mide edición sobre archivos reales, pruebas, contexto del proyecto y uso seguro de herramientas.
Respuesta apoyada en fuentes
Separa recuperación, relevancia de fragmentos, fidelidad y capacidad de abstenerse cuando falta evidencia.
Exactitud y coste de latencia
Un razonamiento más largo no garantiza una respuesta correcta. Añade verificadores y criterios objetivos.
Imágenes y documentos
Comprueba formatos, resolución, OCR cuando corresponda y calidad con tus propios documentos.
Herramientas y esquema
La fiabilidad al devolver JSON o llamadas estructuradas puede importar más que una conversación general.
Una batería pequeña vale más que una clasificación genérica
- Reúne entre veinte y cincuenta tareas representativas. Incluye casos normales, difíciles, ambiguos y entradas que deberían rechazarse.
- Fija los parámetros. Misma temperatura, contexto, prompt de sistema, formato y hardware.
- Mide calidad por criterio. Exactitud, cobertura, citas, formato, seguridad y tasa de abstención.
- Mide las dos fases. Tiempo hasta el primer token, prefill, generación y latencia total.
- Incluye memoria y concurrencia. Observa el modelo con una sesión y con el número real de usuarios.
- Revisa la licencia. Registra familia, variante, hash, fuente y condiciones aplicables.
Para RAG, evalúa por separado el recuperador y el generador. Un modelo competente no puede citar un documento que el sistema no recupera. La arquitectura se explica en IA con los datos de tu empresa.
Cuando el modelo cabe y cuando deja de caber
Una GPU discreta ofrece gran ancho de banda y suele ser la opción más rápida si pesos, contexto y caché caben en su VRAM. DGX Spark se vuelve relevante con modelos grandes, contexto amplio o varios componentes que requieren más de la VRAM habitual. Para una escala muy superior, DGX Station combina 252 GB HBM3e con 496 GB LPDDR5X.
Evita utilizar toda la memoria anunciada para los pesos. El sistema, el motor y la caché necesitan margen. En Ollama, ollama ps ayuda a comprobar si la carga está en GPU, parcialmente en CPU o completamente en CPU.
Separar familia, variante, formato y tarea antes de comparar modelos
«Modelo» se utiliza para varias cosas distintas. Una familia define arquitectura y entrenamiento; una variante puede cambiar tamaño o capacidades; una cuantización modifica cómo se almacenan los pesos; el formato determina qué motor puede cargarlos; y la plantilla de chat condiciona cómo se presentan las instrucciones. Registrar solo un nombre corto impide reproducir una prueba.
En Ollama conviene consultar la biblioteca actual antes de descargar. Verifica tamaño, capacidades, licencia, contexto anunciado y etiquetas disponibles. Después confirma la ventana que realmente utiliza tu servidor: el máximo teórico del modelo no garantiza que la aplicación lo haya configurado.
Qué aporta cada familia y qué debes comprobar por tu cuenta
Amplitud de tamaños y tareas
Suele ofrecer variantes para conversación, razonamiento, código, visión y embeddings. Es una candidata frecuente para castellano y contextos técnicos, pero compara la variante concreta y su licencia.
Prueba: instrucciones con varios requisitos, JSON válido, código con tests y documentos en castellano.
Ecosistema e integraciones
Dispone de un ecosistema amplio y compatibilidad en numerosos motores. La familia y la variante pueden tener condiciones distintas; no extrapoles una prueba entre tamaños o modalidades.
Prueba: seguimiento de instrucciones, consistencia multivuelta y comportamiento con herramientas.
Modelos eficientes y multimodales
Incluye opciones adecuadas para equipos contenidos y variantes capaces de trabajar con imagen. La relación entre tamaño y calidad puede ser atractiva para asistentes internos.
Prueba: resumen fiel, clasificación, extracción y lectura de capturas representativas.
Razonamiento y variantes destiladas
Conviene evaluarla en problemas con respuesta verificable. Las variantes destiladas no equivalen al modelo de mayor tamaño y pueden comportarse de forma diferente.
Prueba: lógica, cálculo revisado por código y decisiones con criterios explícitos.
Razonamiento, herramientas y despliegue abierto
Es relevante para cargas que necesitan razonamiento y uso de herramientas en infraestructura propia. Comprueba requisitos del motor, cuantización y contexto operativo.
Prueba: esquemas, llamadas a función, rechazo de acciones y recuperación ante errores.
Opciones compactas y especializadas
Puede aportar buenas alternativas para baja latencia y tareas concretas. Como en el resto, «la familia» no sustituye una medición de la etiqueta exacta.
Prueba: castellano, velocidad, formato y estabilidad con el contexto esperado.
Una lista no es una recomendación permanente. Las bibliotecas cambian. Esta guía conserva el método: selecciona varias familias, fija casos propios y registra la variante aprobada.
Estimar pesos, caché KV y margen de ejecución sin confundirlos
La aproximación inicial de los pesos es parámetros multiplicados por bits y divididos entre ocho. No es el consumo final: el fichero añade metadatos y el motor necesita buffers, activaciones y caché. Además, una arquitectura de mezcla de expertos puede tener muchos parámetros totales y activar solo una parte por token, pero los pesos que deben estar disponibles siguen condicionando la memoria.
memoria aproximada de pesos = parámetros × bits / 8 memoria de servicio = pesos + caché KV + buffers + margen del sistema
| Factor | Qué aumenta | Consecuencia práctica |
|---|---|---|
| Más parámetros | Pesos y cálculo por token | Mayor capacidad potencial, menor velocidad y más memoria |
| Más bits | Memoria de pesos | Puede preservar calidad, pero reduce el tamaño que cabe |
| Más contexto | Caché KV y prefill | Primera respuesta más lenta y menor concurrencia |
| Más usuarios | Cachés y colas simultáneas | Un modelo que cabe para uno puede saturar el servicio |
| Visión | Tokens visuales y componentes | Mayor latencia y memoria según número y resolución de imágenes |
| Herramientas | Historial, esquemas y resultados | El contexto crece en cada ciclo del agente |
La cuantización se decide con una prueba de degradación
Empieza con una cuantización intermedia que deje margen. Ejecuta los mismos casos en una variante de más precisión y otra de menos. Mide exactitud, formato, uso de herramientas y velocidad. En tareas de extracción, código o razonamiento, una diferencia pequeña en memoria puede tener más valor que una respuesta ligeramente más rápida.
El contexto anunciado no es el contexto útil
Una ventana grande solo aporta valor si el modelo encuentra y utiliza la información adecuada. Documentos largos sin recuperación pueden diluir instrucciones, elevar el prefill y reducir la concurrencia. Para conocimiento empresarial, un RAG bien evaluado suele ser más controlable que introducir toda una biblioteca en cada consulta.
Crear un banco de pruebas que mida utilidad y no solo preferencia
Construye un conjunto de casos a partir del trabajo real. El evaluador debe conocer la respuesta esperada o los criterios de aceptación. Incluye casos negativos en los que el modelo deba abstenerse, solicitudes con instrucciones contradictorias y entradas que intenten alterar el sistema.
- Define la tarea. Resume una política, extrae campos, clasifica un correo, genera una consulta o propone una función. No mezcles objetivos en una puntuación opaca.
- Fija el contrato de salida. Texto breve, tabla, JSON con esquema o llamada a herramienta. Valida el formato mediante código.
- Prepara la referencia. Respuesta correcta, fuentes aceptables, campos obligatorios y errores críticos.
- Ejecuta varias veces. La variabilidad forma parte del comportamiento. Registra temperatura y semilla cuando estén disponibles.
- Mide operación. Tiempo hasta el primer token, velocidad de generación, memoria, longitud de salida y errores.
- Clasifica fallos. Dato inventado, omisión, formato, razonamiento, cita, seguridad, herramienta o idioma.
- Selecciona el menor que cumple. Conserva margen de memoria y una variante de respaldo.
| Prueba | Métrica principal | Fallo crítico |
|---|---|---|
| Resumen | Cobertura y fidelidad | Añadir una decisión que no aparece en la fuente |
| Extracción | Exactitud por campo | Inventar un valor obligatorio |
| RAG | Recuperación, cita y abstención | Responder sin evidencia autorizada |
| Código | Tests superados y seguridad | Proponer un cambio que rompe datos o permisos |
| Herramientas | Llamada y argumentos correctos | Ejecutar una acción no solicitada |
| Visión | Campos y relaciones visuales | Confundir una cifra o elemento decisivo |
Licencia, procedencia y seguridad también forman parte del modelo
Antes de aprobar una variante, conserva su procedencia, licencia, hash o identificador, términos aplicables, finalidad y limitaciones. «Disponible para descargar» no significa que todos los usos, redistribuciones o modificaciones estén autorizados. Revisa también el código que carga los pesos y evita formatos ejecutables de origen desconocido.
- Fuente oficial o repositorio reconocido y versión identificable
- Licencia revisada para uso comercial, adaptación y redistribución
- Plantilla de chat compatible con el motor
- Filtros y límites definidos fuera del modelo
- Casos adversarios y de abstención incluidos en evaluación
- Plan de retirada cuando una variante deja de estar aprobada
Un modelo no es una frontera de autorización. Aunque siga instrucciones con fiabilidad, no debe decidir por sí solo qué documentos puede leer ni qué acciones puede ejecutar.
Traducir la variante aprobada a una configuración de hardware
GPU discreta
Es la opción prioritaria cuando pesos, caché y lote caben en VRAM. El ancho de banda suele aportar la mejor generación interactiva.
DGX Spark
Los 128 GB unificados permiten trabajar con modelos y contextos que ya no entran en una GPU convencional. Debe medirse la velocidad de la carga real.
RTX PRO o DGX Station
RTX PRO aporta gran VRAM y velocidad; DGX Station amplía de forma sustancial la memoria coherente para modelos y usuarios más exigentes.
Entrega al dimensionador: familia, etiqueta exacta, cuantización, contexto, tokens de entrada y salida, usuarios simultáneos, tiempo objetivo, visión, herramientas, RAG y número de modelos residentes. Sin esos datos, cualquier recomendación es una aproximación.
Prueba la carga y después compra
El recomendador organiza la primera decisión; una prueba controlada confirma memoria, velocidad y concurrencia.
Elige con tus datos y tus límites
Instala dos o tres familias, ejecuta la misma batería y conserva el modelo menor que cumpla los requisitos. Escala memoria cuando la calidad o el contexto lo justifiquen.
Instalar OllamaMide esta carga y elige el equipo con datos
Ejecuta una prueba representativa, registra memoria y tiempo, y utiliza el recomendador para comparar una GPU rápida con una plataforma de memoria coherente.
- 01
Define la carga
Concreta tarea, familia de modelo, contexto, lote y usuarios simultáneos.
Aclarar el caso de uso → - 02
Dimensiona memoria
Compara VRAM, memoria coherente, velocidad y margen de crecimiento.
Usar el recomendador de hardware → - 03
Compra en la tienda
Abre la ficha comercial para consultar configuración, precio cerrado, disponibilidad y condiciones vigentes.
Contacto y disponibilidad →
RTX PRO 6000 · 96 GB
Prioriza una GPU profesional para inferencia, imagen, vídeo o serving cuando el modelo y el contexto caben en sus 96 GB de VRAM.
Ver ficha profesional →NVIDIA DGX Spark · 128 GB
Considera memoria unificada para desarrollo CUDA y cargas que superan la VRAM de una GPU, aceptando que capacidad no equivale siempre a más velocidad.
Ver ficha y comprar →Recomendador de hardware
Responde cinco preguntas y compara el equipo actual, una GPU NVIDIA, la RTX PRO 6000 y sistemas GB10 como DGX Spark, ASUS Ascent GX10 o Lenovo ThinkStation PGX.
Comparar opciones →aisupercomputers.es aporta guías y herramientas de decisión. La compra, el precio cerrado en la ficha y el soporte comercial desde España se gestionan en las tiendas del grupo Ietres.
- Un modelo más grande: solo en pareja — dos unidades con su cable directo (hasta 405B). El "en serie" de 3 o 4 no existe.
- Más usuarios o más trabajo: las que quieras — 4, 50, 500 — en estrella a un switch, cada una con el modelo completo y un repartidor delante.
- Para recordar: dos se funden; los demás se suman. Guía completa de clústeres →
Respuestas directas
¿Cuál es el mejor modelo para Ollama?
No existe uno universal. La elección depende de tarea, idioma, licencia, memoria, contexto, velocidad y herramientas. Compara familias con un conjunto de pruebas propio.
¿Cuánta memoria ocupa un modelo cuantizado?
Como estimación inicial, los pesos ocupan parámetros multiplicados por bits y divididos entre ocho, más metadatos, caché y memoria del motor. La cifra real debe comprobarse en la variante concreta.
¿Más parámetros siempre significan mejor resultado?
No. Datos, arquitectura, ajuste, razonamiento, herramientas y tarea pueden hacer que un modelo menor sea preferible. Además, un modelo demasiado grande puede reducir la velocidad y la concurrencia.
¿Qué familias conviene evaluar?
Qwen, Llama, Gemma, DeepSeek-R1, gpt-oss y Mistral cubren necesidades distintas. Consulta ollama.com/library para ver etiquetas, tamaños y requisitos vigentes.
¿Puedo usar cualquier modelo en una empresa?
No debe asumirse. Revisa la licencia de cada modelo y de sus pesos, las condiciones de uso, la procedencia y las obligaciones aplicables a tu caso.
¿Cómo compruebo si el modelo usa la GPU?
Ejecuta el modelo y consulta ollama ps. La salida muestra el procesador utilizado y ayuda a detectar descarga parcial a CPU, que puede reducir el rendimiento.